指南 / 16GB 设备选本地大模型:独显与 Mac 怎么选
16GB 设备选本地大模型:独显与 Mac 怎么选
面向 16GB 独显或 16GB 内存 Mac 的人:表中配置通过本站的 16GB 估算筛选,并非运行保证;先分清自己是哪种 16GB,再按运行配置挑。
编辑推荐
先分清你的 16GB 是独显显存还是 Mac 统一内存,两者不是同一预算;再看卡上的「当前运行配置」而不是模型名,带 MLX 的只在 Apple Silicon 上跑。表中配置通过本站的 16GB 估算筛选,并非运行保证,实际需求还受运行方式、上下文和系统占用影响。展开「查看运行方式」可复制命令,全部文本模型见 /guide/text/。
- 编码代理;通过筛选的是 MLX 4-bit 包,只在 Apple Silicon 上跑 Ornith-1.0-9B (DeepReinforce)
预算内配置:
lmstudio-community/Ornith-1.0-9B-MLX-4bit(4bit),最低约 5.4GB(估算)—— 名称与部署命令都属于这个变体,不是原生仓库。通过筛选的是 lmstudio-community/Ornith-1.0-9B-MLX-4bit 这个包:本站粗略估算约 5.4GB、卡上建议按 7GB 准备,不是实测。独显用户要看详情页里的 GGUF 包,本站对它们暂无估算;社区反馈 Q4_K_M 版适合 6–16GB 显存,这是社区说法。资料写 MIT 可商用、支持工具调用。社区反馈两极:配合 agent 框架可用,单独写代码不如 Qwen 3.5/3.6 稳,先小范围试。
16GB 预算内的配置
预算内 20 个配置(按结构化 footprint 估算,最低显存 ≤ 16GB);该域另有 174 个实体显存未知或超预算,不在本表 —— 见完整列表。显存预算不等于统一内存可用预算:同一个最低显存数字不能单独承诺 16GB 内存的 Mac 能跑。
本档靠
lmstudio-community/LFM2.5-2.6B-MLX-4bit(4bit)- 显存
- ~1.6GB 4-bit(估算)
下方显存与命令都属于这个配置
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/LFM2.5-2.6B-MLX-4bit- 许可证
- LFM Open License v1.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF·liquidai · GGUF·lmstudio · 4bit · 8bit
当前运行配置
Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed- 显存
- ~16GB 4-bit(估算)
查看详情查看运行方式
mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed- 许可证
- apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
本档靠
lmstudio-community/Ornith-1.0-9B-MLX-4bit(4bit)- 显存
- ~5.4GB 4-bit(估算)
下方显存与命令都属于这个配置
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/Ornith-1.0-9B-MLX-4bit- 许可证
- mit
- 上下文
- 256k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF·deepreinforce-ai · GGUF·lmstudio · 4bit · 8bit · GGUF·protolabsai
当前运行配置
prism-ml/Bonsai-8B-mlx-1bit- 显存
- ~1.2GB 1-bit(估算)
查看详情查看运行方式
pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit')- 许可证
- Apache-2.0
- 上下文
- 65k
- 国内可达
- 需代理
当前运行配置
Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed- 显存
- ~16GB 4-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
EschaLabs/Qwen3.8-27B-Escha-W2- 显存
- ~9.2GB 2-bit(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
zak-raindog/gear-manual-qwen3-4b- 显存
- ~2.4GB 4-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model zak-raindog/gear-manual-qwen3-4b --prompt "如何使用EP-133?"- 许可证
- cc-by-nc-4.0
- 国内可达
- 需代理
当前运行配置
nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX- 显存
- ~12GB 2-bit(估算)
查看详情查看运行方式
uvx --from git+https://github.com/nathansutton/mlxcc chad- 国内可达
- 需代理
当前运行配置
deepgrove/maple-preview- 显存
- ~5.4GB ternary(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- MIT
- 上下文
- 131k
- 国内可达
- 需代理
本档靠
Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q4-mlx(MLX·mihai-leanzero)- 显存
- ~16GB 4-bit(估算)
下方显存与命令都属于这个配置
查看详情查看运行方式
mlx_lm.generate --model Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q4-mlx --prompt "Which Forge module adds a panel to the Jira issue view?"- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- MLX·mihai-leanzero · MLX·mihai-leanzero
当前运行配置
lmstudio-community/granite-4.2-3b-MLX-8bit- 显存
- ~3.3GB 8-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/granite-4.2-3b-MLX-8bit- 许可证
- apache-2.0
- 国内可达
- 需代理
- 其它形态
- 8bit · GGUF · 4bit
当前运行配置
Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx- 显存
- ~5.4GB 4-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx --prompt "Which Forge module adds a panel to the Jira issue view?"- 许可证
- Apache-2.0
- 上下文
- 32k
- 国内可达
- 需代理
- 其它形态
- MLX·mihai-leanzero · MLX·mihai-leanzero
当前运行配置
EschaLabs/Qwen3.6-35B-A3B-Escha-W2- 显存
- ~12GB 2-bit(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
prism-ml/Bonsai-27B-mlx-1bit- 显存
- ~4.1GB 1-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model prism-ml/Bonsai-27B-mlx-1bit- 许可证
- apache-2.0
- 上下文
- 262K
- 国内可达
- 需代理
当前运行配置
FINAL-Bench/POCKET-KR-MLX- 显存
- ~12GB 2-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model FINAL-Bench/POCKET-KR-MLX- 许可证
- Apache-2.0
- 国内可达
- 需代理
常见坑
- 独立编码任务稳定性不如 Qwen 3.5/3.6,容易出现 flaky 行为 —— deepreinforce-ai/Ornith-1.0-9B
- 实际 bug 发现能力弱于同等规模模型,与基准评测表现有落差 —— deepreinforce-ai/Ornith-1.0-9B
- 无工具支持的纯对话场景下幻觉倾向明显 —— deepreinforce-ai/Ornith-1.0-9B
- 在某些配置下会无限重复输出,难以正常完成代码编辑 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 遇到不熟悉的代码容易出 eager error,几次调用就能破坏企业级代码库 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 不擅长探索代码库和制定计划,需搭配能消化全量上下文的模型 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 比 Claude 更挑剔/不稳定,需要较多人工引导 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 输出非常冗长(very verbose) —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 在同尺寸开源模型中价格偏高 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 存在使用错误版本(未固定 layers)导致体验差的情况 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- benchmark 在知识和技能维度上明显弱于部分竞品 —— EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- 非 Google 官方发布,为个人社区微调,无官方维护承诺 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 24GB 统一内存为最低舒适门槛,推荐 32GB+ —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 基准测试数据来自创作者自己的模型卡,需独立验证,不宜全信 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 仅支持文本任务,不具备多模态能力 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- 需要自行配置 MLX-LM 或 llama.cpp 等本地推理框架 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
- LM Studio 的 MLX 后端在反复加载/卸载模型后可能出现性能下降,需重启解决 (1) —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
- LM Studio 的 MLX 后端偶有生成时进入无限循环的问题 (1) —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
- 不擅长精确理解和修改已有代码,容易偏离预期改动 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 在代码移植/对齐场景下可能出现幻觉式修改,把正确的代码改坏 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 部分用户反馈其调试能力(找 bug)表现一般,虽然基准评测分数高 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 基准测试分数随模型规模或量化位宽降低而递减,1.58bit量化在部分任务上相比全精度仍有能力损失 —— openbmb/BitCPM-CANN-8B
- 日常对话质量不及同内存占用的 Qwen 3.6 27B 和 Gemma 4 —— prism-ml/Bonsai-27B-gguf
- 手机端实际运行速度偏慢 —— prism-ml/Bonsai-27B-mlx-1bit
- 底模是 Qwen,核心创新在压缩效率而非模型本身 —— prism-ml/Bonsai-27B-mlx-1bit
- 三元版本在质量对比中不敌同体量传统量化 Q2_K_XL —— prism-ml/Bonsai-27B-mlx-1bit
- 部分用户实测认为其回答质量明显不如 Gemma-4-E2B 等传统精度的 8B 模型 —— prism-ml/Bonsai-8B-mlx-1bit
- MLX 版本的每权重实际比特数为 1.25 bits,高于官方宣称的 1.125 bits,存在额外打包开销 —— prism-ml/Bonsai-8B-mlx-1bit
- 官方声称的「end-to-end 1-bit,无高精度 escape hatch」表述容易引起误解 —— prism-ml/Bonsai-8B-mlx-1bit
- 受 llama.cpp MTP 机制限制:不支持 -np > 1 并行,不支持 --mmproj —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 依赖 llama.cpp PR #22673,对推理框架版本有硬性要求 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- agentic 编码强但探索/理解整个代码库、制定计划偏弱,这类任务需要搭配能吞下全上下文的模型 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 使用体验比 Claude 更「较劲」,需要逐步人工引导才出彩 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 多模态与 grounded 任务排名靠后:34 个候选模型里排第 24,54.1/100 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- IQ4_XS 量化有已知坑:此前 llama.cpp 的 bug 让 IQ4_XS 量化体积偏大,16GB 显存场景建议用 llama-quantize 默认参数、不要加 --pure —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 表中配置通过本站的 16GB 估算筛选,并非运行保证。估算按参数量和权重格式粗算,不是实测;实际需求还受运行方式、上下文和系统占用影响,请按卡上的建议显存留余量。
- 独显显存和 Mac 统一内存不是同一预算:Mac 的 16GB 要同时供系统、其它应用和模型使用,MLX 包的估算只描述权重本身,不能单独推出「16GB Mac 能跑」。
- 不在表里的模型有两种情况:本站对它的权重格式没有可信资料(卡上显示「显存 暂无估算」),或者估算超过 16GB。两种都不是「跑不动」。仓库另有更低位量化包而本站未收录的,这里也不会替它猜。
常见问题
- 16GB 内存的 Mac 算不算 16GB 显存?
- 不算同一件事。这张表按本站估算 ≤ 16GB 筛选,数字描述的是把权重放进独显显存的粗略需求;Mac 的统一内存要同时给系统、其它应用和模型上下文用,能给模型的部分明显小于 16GB。带 MLX 的行说明有为 Apple Silicon 准备的权重包,但同一个数字不等于 16GB Mac 能跑,请按建议显存留余量自己试。
- 为什么有些熟悉的模型不在表里?
- 只有两种原因:本站对它的权重格式没有可信资料(详情页显示「显存 暂无估算」),或者本站估算超过 16GB。两种都不是「跑不动」的结论。想看全部文本生成模型(含暂无估算、超预算的)去 /guide/text/;只看 16GB 档的筛选去 /guide/text/16gb/。
- 卡上「本档靠」后面写着另一个仓库名是什么意思?
- 表示原生仓库自己没有通过筛选(暂无估算或超预算),是那个具体的量化包(GGUF / MLX)通过了本站的 16GB 估算筛选。此时名称、显存估算和运行命令都属于该包,下载时请认准这个 ID,不要拿原生仓库的权重去套这个数字。
- 我用的是 NVIDIA / AMD 独显,表里能选什么?
- 跳过配置 ID 带 MLX 的行(那是 Apple Silicon 专用权重;运行命令是 mlx_lm、mtplx 一类的行也是),看 GGUF 或原生权重的行,再展开「查看运行方式」确认有没有收录命令;「暂无收录命令」的行要去详情页或模型仓库找运行方法。目前表里多数是 MLX 包,独显能直接用的行比 Mac 少,不是独显跑不了,而是不少 GGUF 包本站还没有估算(一个仓库里有多档量化,本站不挑一个猜)。