指南 / 16GB 设备选本地大模型:独显与 Mac 怎么选

16GB 设备选本地大模型:独显与 Mac 怎么选

面向 16GB 独显或 16GB 内存 Mac 的人:表中配置通过本站的 16GB 估算筛选,并非运行保证;先分清自己是哪种 16GB,再按运行配置挑。

编辑推荐

先分清你的 16GB 是独显显存还是 Mac 统一内存,两者不是同一预算;再看卡上的「当前运行配置」而不是模型名,带 MLX 的只在 Apple Silicon 上跑。表中配置通过本站的 16GB 估算筛选,并非运行保证,实际需求还受运行方式、上下文和系统占用影响。展开「查看运行方式」可复制命令,全部文本模型见 /guide/text/。

  • 编码代理;通过筛选的是 MLX 4-bit 包,只在 Apple Silicon 上跑 Ornith-1.0-9B (DeepReinforce)

    预算内配置:lmstudio-community/Ornith-1.0-9B-MLX-4bit(4bit),最低约 5.4GB(估算)—— 名称与部署命令都属于这个变体,不是原生仓库。

    通过筛选的是 lmstudio-community/Ornith-1.0-9B-MLX-4bit 这个包:本站粗略估算约 5.4GB、卡上建议按 7GB 准备,不是实测。独显用户要看详情页里的 GGUF 包,本站对它们暂无估算;社区反馈 Q4_K_M 版适合 6–16GB 显存,这是社区说法。资料写 MIT 可商用、支持工具调用。社区反馈两极:配合 agent 框架可用,单独写代码不如 Qwen 3.5/3.6 稳,先小范围试。

16GB 预算内的配置

预算内 20 个配置(按结构化 footprint 估算,最低显存 ≤ 16GB);该域另有 174 个实体显存未知或超预算,不在本表 —— 见完整列表。显存预算不等于统一内存可用预算:同一个最低显存数字不能单独承诺 16GB 内存的 Mac 能跑。

  • Apple Silicon 用 4-bit 量化 LFM,始终思考模式

    参数量
    2.6B
    商用
    需自查

    本档靠 lmstudio-community/LFM2.5-2.6B-MLX-4bit (4bit)

    显存
    ~1.6GB 4-bit(估算)

    下方显存与命令都属于这个配置

    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/LFM2.5-2.6B-MLX-4bit
    许可证
    LFM Open License v1.0
    上下文
    128k
    国内可达
    需代理
    其它形态
    原生 · GGUF·liquidai · GGUF·lmstudio · 4bit · 8bit
  • Mac 上 Qwen3.8-27B 4-bit量化

    参数量
    27B
    商用
    可商用

    当前运行配置 Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed

    显存
    ~16GB 4-bit(估算)
    查看详情
    查看运行方式
    mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed
    许可证
    apache-2.0
    上下文
    262k
    国内可达
    需代理
  • Qwen3.6-27B 的 MLX 推理加速版供苹果芯片

    参数量
    27B
    商用
    可商用

    当前运行配置 Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed

    显存
    ~16GB 4-bit(估算)
    查看详情
    查看运行方式(还有 2 种)
    brew install youssofal/mtplx/mtplx

    其它 2 种运行方式见详情页

    许可证
    Apache-2.0
    国内可达
    需代理
  • Gemma4 26B 无审查 MLX, 本地代理加速

    参数量
    26B (4-bit)
    商用
    限制商用

    当前运行配置 Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2

    显存
    ~16GB 4-bit(估算)
    查看详情
    查看运行方式(还有 1 种)
    mlx_lm.server --model Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2

    其它 1 种运行方式见详情页

    许可证
    gemma
    国内可达
    需代理
  • MLX 8-bit量化,为Apple Silicon优化

    参数量
    9B
    商用
    可商用

    本档靠 lmstudio-community/Ornith-1.0-9B-MLX-4bit (4bit)

    显存
    ~5.4GB 4-bit(估算)

    下方显存与命令都属于这个配置

    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/Ornith-1.0-9B-MLX-4bit
    许可证
    mit
    上下文
    256k
    国内可达
    需代理
    其它形态
    原生 · GGUF·deepreinforce-ai · GGUF·lmstudio · 4bit · 8bit · GGUF·protolabsai
  • Apple Silicon 的 1-bit LLM,端侧极低内存推理

    参数量
    8B
    商用
    可商用

    当前运行配置 prism-ml/Bonsai-8B-mlx-1bit

    显存
    ~1.2GB 1-bit(估算)
    查看详情
    查看运行方式
    pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit')
    许可证
    Apache-2.0
    上下文
    65k
    国内可达
    需代理
  • Llama-3-8B 4-bit版,M系列芯片本地推理

    参数量
    8B
    商用
    限制商用

    当前运行配置 mlx-community/Meta-Llama-3-8B-Instruct-4bit

    显存
    ~4.8GB 4-bit(估算)
    查看详情
    查看运行方式(还有 1 种)
    pip install mlx-lm && mlx_lm.generate --model mlx-community/Meta-Llama-3-8B-Instruct-4bit --prompt "hello"

    其它 1 种运行方式见详情页

    许可证
    llama3
    上下文
    8k
    国内可达
    需代理
  • Mac本地Qwen3.8-27B-4bit量化

    参数量
    27B
    商用
    可商用

    当前运行配置 Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed

    显存
    ~16GB 4-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • 2-bit 量化 27B 模型,24GB 显卡 64k 上下文

    参数量
    27B
    商用
    可商用

    当前运行配置 EschaLabs/Qwen3.8-27B-Escha-W2

    显存
    ~9.2GB 2-bit(估算)
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
  • 昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能

    参数量
    8B
    商用
    可商用

    当前运行配置 openbmb/BitCPM-CANN-8B

    显存
    ~2.2GB ternary(估算)
    查看详情
    查看运行方式(还有 1 种)
    transformers: AutoModelForCausalLM.from_pretrained('openbmb/BitCPM-CANN-8B')

    其它 1 种运行方式见详情页

    许可证
    apache-2.0
    国内可达
    需代理
  • 面向硬件音乐设备的本地助手,基于Qwen3-4B微调

    参数量
    4B
    商用
    不可商用

    当前运行配置 zak-raindog/gear-manual-qwen3-4b

    显存
    ~2.4GB 4-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model zak-raindog/gear-manual-qwen3-4b --prompt "如何使用EP-133?"
    许可证
    cc-by-nc-4.0
    国内可达
    需代理
  • Apple Silicon 上 Claude-Code 式本地编码代理

    参数量
    35B (3B 活跃)
    商用
    需自查

    当前运行配置 nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX

    显存
    ~12GB 2-bit(估算)
    查看详情
    查看运行方式
    uvx --from git+https://github.com/nathansutton/mlxcc chad
    国内可达
    需代理
  • 多模态 27B 模型,纯 Q1_0 量化,语言部分仅 3.8 GB

    参数量
    27B
    商用
    可商用

    当前运行配置 prism-ml/Bonsai-27B-gguf

    显存
    ~4.1GB 1-bit(估算)
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/prism-ml/Bonsai-27B-gguf

    其它 1 种运行方式见详情页

    许可证
    Apache-2.0
    上下文
    262K
    国内可达
    需代理
    其它形态
    GGUF·prism-ml · GGUF·lmstudio
  • 20B-A1B 三元推理模型,M4 218 tok/s

    参数量
    20B-A1B
    商用
    可商用

    当前运行配置 deepgrove/maple-preview

    显存
    ~5.4GB ternary(估算)
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    许可证
    MIT
    上下文
    131k
    国内可达
    需代理
  • Atlassian 开发专用 27B MLX 模型

    参数量
    27B
    商用
    可商用

    本档靠 Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q4-mlx (MLX·mihai-leanzero)

    显存
    ~16GB 4-bit(估算)

    下方显存与命令都属于这个配置

    查看详情
    查看运行方式
    mlx_lm.generate --model Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q4-mlx --prompt "Which Forge module adds a panel to the Jira issue view?"
    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
    其它形态
    MLX·mihai-leanzero · MLX·mihai-leanzero
  • IBM Granite 3B MLX 量化,苹果芯片推理

    参数量
    3B
    商用
    可商用

    当前运行配置 lmstudio-community/granite-4.2-3b-MLX-8bit

    显存
    ~3.3GB 8-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/granite-4.2-3b-MLX-8bit
    许可证
    apache-2.0
    国内可达
    需代理
    其它形态
    8bit · GGUF · 4bit
  • 面向 Atlassian Forge 的 6-bit MLX 模型

    参数量
    9B
    商用
    可商用

    当前运行配置 Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx

    显存
    ~5.4GB 4-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx --prompt "Which Forge module adds a panel to the Jira issue view?"
    许可证
    Apache-2.0
    上下文
    32k
    国内可达
    需代理
    其它形态
    MLX·mihai-leanzero · MLX·mihai-leanzero
  • 2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理

    参数量
    35B (3B active)
    商用
    可商用

    当前运行配置 EschaLabs/Qwen3.6-35B-A3B-Escha-W2

    显存
    ~12GB 2-bit(估算)
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
  • 1-bit 27B 模型, 可在手机和笔记本本地运行推理

    参数量
    27B
    商用
    可商用

    当前运行配置 prism-ml/Bonsai-27B-mlx-1bit

    显存
    ~4.1GB 1-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model prism-ml/Bonsai-27B-mlx-1bit
    许可证
    apache-2.0
    上下文
    262K
    国内可达
    需代理
  • 35B 韩语模型,在 iPhone/Mac 上用 MLX 本地运行

    参数量
    35B
    商用
    可商用

    当前运行配置 FINAL-Bench/POCKET-KR-MLX

    显存
    ~12GB 2-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model FINAL-Bench/POCKET-KR-MLX
    许可证
    Apache-2.0
    国内可达
    需代理

常见坑

  • 独立编码任务稳定性不如 Qwen 3.5/3.6,容易出现 flaky 行为 —— deepreinforce-ai/Ornith-1.0-9B
  • 实际 bug 发现能力弱于同等规模模型,与基准评测表现有落差 —— deepreinforce-ai/Ornith-1.0-9B
  • 无工具支持的纯对话场景下幻觉倾向明显 —— deepreinforce-ai/Ornith-1.0-9B
  • 在某些配置下会无限重复输出,难以正常完成代码编辑 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 遇到不熟悉的代码容易出 eager error,几次调用就能破坏企业级代码库 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 不擅长探索代码库和制定计划,需搭配能消化全量上下文的模型 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 比 Claude 更挑剔/不稳定,需要较多人工引导 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 输出非常冗长(very verbose) —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 在同尺寸开源模型中价格偏高 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 存在使用错误版本(未固定 layers)导致体验差的情况 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • benchmark 在知识和技能维度上明显弱于部分竞品 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
  • 非 Google 官方发布,为个人社区微调,无官方维护承诺 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 24GB 统一内存为最低舒适门槛,推荐 32GB+ —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 基准测试数据来自创作者自己的模型卡,需独立验证,不宜全信 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 仅支持文本任务,不具备多模态能力 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 需要自行配置 MLX-LM 或 llama.cpp 等本地推理框架 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • LM Studio 的 MLX 后端在反复加载/卸载模型后可能出现性能下降,需重启解决 (1) —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
  • LM Studio 的 MLX 后端偶有生成时进入无限循环的问题 (1) —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
  • 不擅长精确理解和修改已有代码,容易偏离预期改动 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
  • 在代码移植/对齐场景下可能出现幻觉式修改,把正确的代码改坏 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
  • 部分用户反馈其调试能力(找 bug)表现一般,虽然基准评测分数高 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
  • 基准测试分数随模型规模或量化位宽降低而递减,1.58bit量化在部分任务上相比全精度仍有能力损失 —— openbmb/BitCPM-CANN-8B
  • 日常对话质量不及同内存占用的 Qwen 3.6 27B 和 Gemma 4 —— prism-ml/Bonsai-27B-gguf
  • 手机端实际运行速度偏慢 —— prism-ml/Bonsai-27B-mlx-1bit
  • 底模是 Qwen,核心创新在压缩效率而非模型本身 —— prism-ml/Bonsai-27B-mlx-1bit
  • 三元版本在质量对比中不敌同体量传统量化 Q2_K_XL —— prism-ml/Bonsai-27B-mlx-1bit
  • 部分用户实测认为其回答质量明显不如 Gemma-4-E2B 等传统精度的 8B 模型 —— prism-ml/Bonsai-8B-mlx-1bit
  • MLX 版本的每权重实际比特数为 1.25 bits,高于官方宣称的 1.125 bits,存在额外打包开销 —— prism-ml/Bonsai-8B-mlx-1bit
  • 官方声称的「end-to-end 1-bit,无高精度 escape hatch」表述容易引起误解 —— prism-ml/Bonsai-8B-mlx-1bit
  • 受 llama.cpp MTP 机制限制:不支持 -np > 1 并行,不支持 --mmproj —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 依赖 llama.cpp PR #22673,对推理框架版本有硬性要求 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • agentic 编码强但探索/理解整个代码库、制定计划偏弱,这类任务需要搭配能吞下全上下文的模型 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 使用体验比 Claude 更「较劲」,需要逐步人工引导才出彩 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 多模态与 grounded 任务排名靠后:34 个候选模型里排第 24,54.1/100 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • IQ4_XS 量化有已知坑:此前 llama.cpp 的 bug 让 IQ4_XS 量化体积偏大,16GB 显存场景建议用 llama-quantize 默认参数、不要加 --pure —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 表中配置通过本站的 16GB 估算筛选,并非运行保证。估算按参数量和权重格式粗算,不是实测;实际需求还受运行方式、上下文和系统占用影响,请按卡上的建议显存留余量。
  • 独显显存和 Mac 统一内存不是同一预算:Mac 的 16GB 要同时供系统、其它应用和模型使用,MLX 包的估算只描述权重本身,不能单独推出「16GB Mac 能跑」。
  • 不在表里的模型有两种情况:本站对它的权重格式没有可信资料(卡上显示「显存 暂无估算」),或者估算超过 16GB。两种都不是「跑不动」。仓库另有更低位量化包而本站未收录的,这里也不会替它猜。

常见问题

16GB 内存的 Mac 算不算 16GB 显存?
不算同一件事。这张表按本站估算 ≤ 16GB 筛选,数字描述的是把权重放进独显显存的粗略需求;Mac 的统一内存要同时给系统、其它应用和模型上下文用,能给模型的部分明显小于 16GB。带 MLX 的行说明有为 Apple Silicon 准备的权重包,但同一个数字不等于 16GB Mac 能跑,请按建议显存留余量自己试。
为什么有些熟悉的模型不在表里?
只有两种原因:本站对它的权重格式没有可信资料(详情页显示「显存 暂无估算」),或者本站估算超过 16GB。两种都不是「跑不动」的结论。想看全部文本生成模型(含暂无估算、超预算的)去 /guide/text/;只看 16GB 档的筛选去 /guide/text/16gb/。
卡上「本档靠」后面写着另一个仓库名是什么意思?
表示原生仓库自己没有通过筛选(暂无估算或超预算),是那个具体的量化包(GGUF / MLX)通过了本站的 16GB 估算筛选。此时名称、显存估算和运行命令都属于该包,下载时请认准这个 ID,不要拿原生仓库的权重去套这个数字。
我用的是 NVIDIA / AMD 独显,表里能选什么?
跳过配置 ID 带 MLX 的行(那是 Apple Silicon 专用权重;运行命令是 mlx_lm、mtplx 一类的行也是),看 GGUF 或原生权重的行,再展开「查看运行方式」确认有没有收录命令;「暂无收录命令」的行要去详情页或模型仓库找运行方法。目前表里多数是 MLX 包,独显能直接用的行比 Mac 少,不是独显跑不了,而是不少 GGUF 包本站还没有估算(一个仓库里有多档量化,本站不挑一个猜)。

对比表数据更新于 2026-09-13

收藏本页,或 订阅 RSS 追踪每日更新。

Read in English →