指南 / 16GB 显存/内存能跑什么本地大模型(2026-07)

16GB 显存/内存能跑什么本地大模型(2026-07)

先按「Q4 估算明显超 16GB 且库内没有更低位形态」筛掉 11 个不现实的选项,再按用途挑几个能直接上手的。

编辑推荐

这页覆盖站内全部纯文本 LLM 卡(pipeline_tag 为 text-generation)。已剔除 11 个 Q4 估算明确超过 16GB、且库内没有更低位量化形态的模型(如 753B 且标注 cloud_only 的 GLM-5.2,以及几个已是 mlx 4bit/8bit 仍超标的量化包),名单见尾注。约三分之一行显存字段为空,这是数据缺口不是"塞不进"的信号,请按需实测。

  • 编码代理首选 Ornith-1.0-9B (DeepReinforce)

    key_info.vram 为 Q4 约 5GB、license MIT,key_info.agent.tool_calling 标注 OpenAI-style(Qwen3 XML);why_trust 写明"自改进 RL 训练,SWE-bench Verified 69.4%,支持 OpenAI 兼容工具调用",good_for 明确列出编码代理与工具调用/终端任务。

  • 长上下文仓库探索(配合主 agent 使用) FastContext-1.0-4B-RL (Microsoft)

    key_info.vram 为 Q4 约 2.7GB、context 262k、license MIT;community.solves 写明"FP16 仅需约 8.8GB 显存,INT4 仅需约 2.2GB,消费级 GPU 即可部署"且"主 agent token 消耗降低最多 60%";但 watch_outs 提醒它是子 agent,需配合主 coding agent 使用,卡片 not_for 也写明"独立解决编码任务或通用对话"不适用。

  • 端侧通用助理/工具调用 LFM2.5-8B-A1B (LiquidAI)

    key_info.vram 为 Q4 约 5.6GB,支持 GGUF/MLX 等多种部署;community.solves 提到"低配硬件可运行(社区称'any potato'即可跑 A1B 版本)"、"支持原生工具调用与 Agent 工作流,可离线运行";但 watch_outs 也明确"编码能力弱(社区实测 4/5 编码任务未通过)",不适合当编程模型用。

  • 通用对话/编程速度与质量折中 Qwen3.6-35B-A3B-NVFP4 (NVIDIA)

    key_info.vram 为 Q4 约 12GB,在 16GB 预算内;community.consensus 称其"是本地编程场景下速度与质量的最佳折中选择",solves 提到"在消费级 NVIDIA 硬件(RTX 5090、DGX Spark)上可流畅运行";watch_outs 也提醒"NVFP4 量化存在质量损失,可能出现失控生成和退化循环"。

  • 轻量数学/代码推理 VibeThinker-3B (WeiboAI)

    key_info.vram 仅 Q4 约 2GB、license MIT 可商用;why_trust 给出 IMO-AnswerBench 76.4、LeetCode 周赛通过率 96.1% 等基准;但 community.consensus 也直言"基准分数亮眼但实际编程体验分化明显",watch_outs 提到有用户实测"远逊于 Qwen 3.5 4B",基准分数和真实编码能力有落差,别只看分数。

全部候选对比

模型参数量显存门槛上下文许可证商用国内可达部署
SuperGemma4-26B-Uncensored (Jiunsong) 26Bgemma限制商用需代理ollama run hf.co/Jiunsong/supergemma4-26b-uncensored-gguf-v2 / huggingface-cli download Jiunsong/supergemma4-26b-uncensored-gguf-v2 --include '*.gguf' --local-dir . / llama-cli -m supergemma4-26b-uncensored-fast-v2-Q4_K_M.gguf
Qwen3.6-35B-A3B-NVFP4 (NVIDIA) 35B (激活3B)Q4 ~12GB / FP16 ~45GB262kApache 2.0可商用需代理vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt
Dolphin3-Cyber-8B (RavichandranJ) 8BQ4 ~5.3GB / FP16 ~19GB2kllama3.1需自查需代理ollama run hf.co/RavichandranJ/Dolphin3-Cyber-8B-GGUF
DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA) 25.2B (3.8B活跃)Q4 ~9.5GB / FP16 ~35GB256kApache 2.0 (Gemma Terms)可商用需代理VLLM_USE_V2_MODEL_RUNNER=1 vllm serve nvidia/diffusiongemma-26B-A4B-IT-NVFP4 --trust-remote-code --max-num-seqs 4 --attention-backend TRITON_ATTN --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 --override-generation-config '{"max_new_tokens": null}' --default-chat-template-kwargs '{"enable_thinking":true}' (需H100/B100)
Qwen3.6-27B-MTPLX (Youssofal) 27BQ4 ~3.1GB / FP16 ~11GBApache-2.0可商用需代理brew install youssofal/mtplx/mtplx / mtplx pull Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed / mtplx serve --model Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed --port 8000
Ornith-1.0-35B (DeepReinforce)
原生 · FP8 · GGUF
35B-MoEQ4 ~23GB / FP16 ~84GB256kMIT需自查需代理vllm serve deepreinforce-ai/Ornith-1.0-35B --served-model-name Ornith-1.0-35B --tensor-parallel-size 8 --host 0.0.0.0 --port 8000 --max-model-len 262144 --gpu-memory-utilization 0.90 --enable-prefix-caching --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code / python -m sglang.launch_server --model-path deepreinforce-ai/Ornith-1.0-35B --served-model-name Ornith-1.0-35B --tp 8 --host 0.0.0.0 --port 8000 --context-length 262144 --mem-fraction-static 0.85 --tool-call-parser qwen3_coder --reasoning-parser qwen3 / llama-server -hf deepreinforce-ai/Ornith-1.0-35B-GGUF --port 8000 -c 262144
Huihui-Qwythos-9B-1M (huihui-ai) 9B1Mapache-2.0需自查需代理llama-cli -hf huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF --model Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-Q4_K.gguf -ngl 99 -c 262144 -fa on -np 1 --spec-type draft-mtp --spec-draft-n-max 2
LFM2.5-8B-A1B (LiquidAI)
原生 · GGUF·liquidai · GGUF·unsloth
8.3B (1.5B active)Q4 ~5.6GB / FP16 ~20GB128kLFM1.0需自查需代理transformers >= 5.0.0: AutoModelForCausalLM.from_pretrained('LiquidAI/LFM2.5-8B-A1B')
Qwen-AgentWorld-35B-A3B (Qwen)
原生 · GGUF
35B (3B激活)Q4 ~23GB / FP16 ~83GB262kApache-2.0需自查魔搭可用python -m sglang.launch_server --model-path Qwen/Qwen-AgentWorld-35B-A3B --port 8000 --tp-size 4 --context-length 262144 --reasoning-parser qwen3 / vllm serve Qwen/Qwen-AgentWorld-35B-A3B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --trust-remote-code
Qwythos-9B-v2 (Empero AI)
原生 · GGUF
9BQ4 ~6.4GB / FP16 ~23GB1048kApache-2.0需自查需代理vllm serve empero-ai/Qwythos-9B-v2 --trust-remote-code
Ternary-Bonsai-8B (Prism ML) 8BQ4 ~0.4GB / FP16 ~1.5GB65kApache-2.0可商用需代理mlx_lm.load('prism-ml/Ternary-Bonsai-8B-mlx-2bit') / mlx-lm generate --model prism-ml/Ternary-Bonsai-8B-mlx-2bit
Ornith-1.0-9B (DeepReinforce)
原生 · GGUF·deepreinforce-ai · GGUF·protolabsai
9BQ4 ~5GB / FP16 ~18GB256kMIT需自查需代理vllm serve deepreinforce-ai/Ornith-1.0-9B --served-model-name Ornith-1.0-9B --host 0.0.0.0 --port 8000 --max-model-len 262144 --gpu-memory-utilization 0.90 --enable-prefix-caching --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code / llama-server -hf deepreinforce-ai/Ornith-1.0-9B-GGUF --port 8000 -c 262144 / AutoModelForCausalLM.from_pretrained("deepreinforce-ai/Ornith-1.0-9B", device_map="auto")
LFM2.5-230M (LiquidAI)
原生 · GGUF
230MQ4 ~0.2GB / FP16 ~0.6GB32768LFM1.0需自查需代理vllm serve LiquidAI/LFM2.5-230M / llama-server -hf LiquidAI/LFM2.5-230M-GGUF / python -c 'from transformers import AutoModelForCausalLM, AutoTokenizer; model=AutoModelForCausalLM.from_pretrained("LiquidAI/LFM2.5-230M", device_map="auto", dtype="bfloat16"); tokenizer=AutoTokenizer.from_pretrained("LiquidAI/LFM2.5-230M")'
Bonsai-8B-mlx-1bit (PrismML) 8BQ4 ~0.3GB / FP16 ~0.9GB65kApache-2.0可商用需代理pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit')
North-Mini-Code-1.0 (CohereLabs)
原生 · GGUF
30B总 / 3B激活Q4 ~20GB / FP16 ~73GB256KApache-2.0可商用需代理transformers.from_pretrained() / vllm serve CohereLabs/North-Mini-Code-1.0
Qwopus3.5-9B-Coder-MTP (Jackrong)
GGUF·jackrong·MTP · GGUF·jackrong
9B128kapache-2.0可商用需代理ollama run hf.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF:Q4_K_M / llama.cpp: ./llama-cli -m qwopus3.5-9b-coder-mtp.Q4_K_M.gguf -ngl 99 / llama-cpp-python: Llama(model_path='<gguf-path>')
Qwen3.5-9B-OptiQ-4bit (mlx-community) 9BQ4 ~5.9GB / FP16 ~21GB128kapache-2.0需自查需代理mlx_lm.generate --model mlx-community/Qwen3.5-9B-OptiQ-4bit
Meta-Llama-3-8B-Instruct-4bit (mlx-community) 8BQ4 ~1.1GB / FP16 ~4.1GB8kllama3需自查需代理pip install mlx-lm && mlx_lm.generate --model mlx-community/Meta-Llama-3-8B-Instruct-4bit --prompt "hello" / from mlx_lm import load, generate; model, tokenizer = load('mlx-community/Meta-Llama-3-8B-Instruct-4bit'); generate(model, tokenizer, prompt='hello')
Nandi-Mini-600M (FrontiersMind) 600MQ4 ~0.4GB / FP16 ~1.5GB2048apache-2.0可商用需代理transformers.from_pretrained('FrontiersMind/Nandi-Mini-600M-Early-Checkpoint')
Gemma-4-12B-OBLITERATED (OBLITERATUS) 12BQ4 ~7.9GB / FP16 ~29GBgemma限制商用需代理ollama run hf.co/OBLITERATUS/Gemma-4-12B-OBLITERATED / transformers from_pretrained('OBLITERATUS/Gemma-4-12B-OBLITERATED')
Nemotron-Labs-TwoTower-30B-A3B (NVIDIA) 30B (3B 激活)128kNVIDIA Nemotron Open Model License需自查需代理python3 -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16',trust_remote_code=True,torch_dtype='bfloat16').cuda()" (单GPU AR模式,约59GB显存) / python3 -c "from transformers import AutoModelForCausalLM; m=AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16',trust_remote_code=True,torch_dtype='bfloat16'); m.place_towers_on_devices('cuda:0','cuda:1')" (双GPU扩散模式,每卡约59GB显存)
Mythos-nano (squ11z1) 3BQ4 ~2GB / FP16 ~7.4GBMIT需自查需代理ollama run hf.co/squ11z1/Mythos-nano / vllm serve squ11z1/Mythos-nano / AutoModelForCausalLM.from_pretrained("squ11z1/Mythos-nano", torch_dtype="auto", device_map="auto") / llama-server -m hf://squ11z1/Mythos-nano:mythos-nano-Q4_K_M.gguf
Qwopus3.6-27B-v2-MTP-GGUF (Jackrong)
GGUF·jackrong·MTP · GGUF·jackrong
27B128kApache 2.0可商用需代理huggingface-cli download Jackrong/Qwopus3.6-27B-v2-MTP-GGUF qwopus3.6-27b-v2-mtp.Q4_K_M.gguf / llama.cpp server -m qwopus3.6-27b-v2-mtp.Q4_K_M.gguf -ngl 99
Qwen3.5-9B (Qwen) 9B32kMIT可商用需代理ollama run hf.co/w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP / llama.cpp: ./llama-cli -m Qwen3.5-9B-MoQ-4.85.gguf
MiniCPM5-1B-Thinking (OpenBMB)
原生 · GGUF
1BQ4 ~0.7GB / FP16 ~2.6GB128kApache-2.0需自查需代理ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF
Qwen3.5-0.8B-OptiQ-4bit (mlx-community) 0.8BQ4 ~0.1GB / FP16 ~0.4GBApache 2.0可商用需代理pip install mlx-lm; mlx_lm.generate --model mlx-community/Qwen3.5-0.8B-OptiQ-4bit --prompt '...' / pip install mlx-optiq; optiq serve --model mlx-community/Qwen3.5-0.8B-OptiQ-4bit --mtp
Llama-2-7b-chat-mlx (mlx-community) 7B4096llama2限制商用需代理git clone https://github.com/ml-explore/mlx-examples && pip install mlx huggingface_hub && huggingface-cli download mlx-community/Llama-2-7b-chat-mlx --local-dir model / python mlx-examples/llama/llama.py --prompt 'Hi' model/
MaralGPT-Mythos-9B (MaralGPT) 9BQ4 ~5.9GB / FP16 ~22GB1Mapache-2.0需自查需代理ollama run hf.co/MaralGPT/MaralGPT-Mythos-9B-2606-GGUF
Qwen3.5-2B-OptiQ-4bit (mlx-community) 2BQ4 ~0.3GB / FP16 ~1GBapache-2.0可商用需代理mlx-lm generate --model mlx-community/Qwen3.5-2B-OptiQ-4bit / optiq serve --model mlx-community/Qwen3.5-2B-OptiQ-4bit --mtp
LFM2.5-1.2B-JP (LiquidAI) 1.2BQ4 ~0.8GB / FP16 ~2.8GB32kLFM1.0需自查需代理transformers AutoModelForCausalLM.from_pretrained('LiquidAI/LFM2.5-1.2B-JP-202606') / vllm serve LiquidAI/LFM2.5-1.2B-JP-202606 / llama-server -hf LiquidAI/LFM2.5-1.2B-JP-202606-GGUF
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking (GnLOLot) 1BQ4 ~0.7GB / FP16 ~2.4GB128kApache-2.0需自查需代理ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF / llama-server -hf GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF -m MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-Q8_0.gguf -c 8192
FastContext-1.0-4B-RL (Microsoft) 4BQ4 ~2.7GB / FP16 ~9.7GB262kMIT需自查需代理python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-RL --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8 / from transformers import AutoModelForCausalLM; model = AutoModelForCausalLM.from_pretrained('microsoft/FastContext-1.0-4B-RL', trust_remote_code=True)
Qwen3.6-27B-NVFP4 (NVIDIA) 27B262kApache-2.0需自查需代理vllm serve nvidia/Qwen3.6-27B-NVFP4 --port 8000 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3
Gemma4-12B-Coder (yuxinlu1) 12B131kgemma可商用需代理ollama run hf.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF / llama-server -hf yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF -m gemma4-coding-Q4_K_M.gguf --ctx-size 16384 (需 llama.cpp 最新版,支持 gemma4_unified)
Gemma-4-12B Agentic v2 (yuxinlu1)
原生 · GGUF
12BQ4 ~7.9GB / FP16 ~29GB16k(示例命令)Apache-2.0需自查需代理llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -ngl 99 --jinja
Huihui-gemma-4-12B-coder-abliterated (huihui-ai) 12BQ4 ~7.9GB / FP16 ~29GBapache-2.0需自查需代理python3 -c 'from transformers import AutoModelForCausalLM; model = AutoModelForCausalLM.from_pretrained("huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated")' / vllm serve huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
MiniCPM5-1B (OpenBMB)
原生 · GGUF
1BQ4 ~0.7GB / FP16 ~2.6GB128kapache-2.0可商用魔搭可用vllm serve openbmb/MiniCPM5-1B --port 8000 / sglang --model-path openbmb/MiniCPM5-1B --port 30000 / transformers AutoModelForCausalLM.from_pretrained('openbmb/MiniCPM5-1B')
Qwen3.6-27B-MTP-pi-tune (bytkim) 27B256kApache-2.0可商用需代理ollama run hf.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF / llama-server -hf bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF:Q4_K_M --jinja -ngl 99 -fa -c 131072 --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0 --presence-penalty 1.5 / hf download bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF Qwen3.6-27B-MTP-pi-tune-Q4_K_M.gguf --local-dir .
Qwythos-9B (Empero)
原生 · GGUF
9BQ4 ~6.2GB / FP16 ~23GB1MApache 2.0需自查需代理vllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000 / AutoModelForImageTextToText.from_pretrained('empero-ai/Qwythos-9B-Claude-Mythos-5-1M', dtype='bfloat16', device_map='auto')
Gemma-4-12B-it-LWQ6 (wepiqx) 12BApache-2.0需自查需代理llama-server -hf wepiqx/gemma-4-12B-it-LWQ6-GGUF:gemma-4-12b-it-LWQ6-IQ4_XS.gguf --jinja --flash-attn on -c 55555 -ngl 99 / llama-cli -hf wepiqx/gemma-4-12B-it-LWQ6-GGUF:gemma-4-12b-it-LWQ6-IQ4_XS.gguf -p "Your prompt" -ngl 99
Mellum2-12B-A2.5B-Instruct (JetBrains) 12B (2.5B active)Q4 ~8GB / FP16 ~29GB131kapache-2.0可商用需代理vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072 / transformers.from_pretrained('JetBrains/Mellum2-12B-A2.5B-Instruct')
SIQ-1-35B (AlexWortega) 35B (3B激活)131kApache-2.0需自查需代理python -m sglang.launch_server --model-path AlexWortega/SIQ-1-35B --tp 2 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3 --port 8080 / AutoModelForCausalLM.from_pretrained('AlexWortega/SIQ-1-35B', device_map='auto', torch_dtype='auto') / huggingface-cli download AlexWortega/SIQ-1-35B gguf/Q4_K_M.gguf --local-dir ./siq && docker run -d --gpus all -v ./siq:/m -p 8080:8080 ghcr.io/ggml-org/llama.cpp:server-cuda -m /m/gguf/Q4_K_M.gguf -ngl 99 -c 131072 -np 4 --jinja
BitCPM-CANN-8B (OpenBMB) 8Bapache-2.0可商用需代理transformers: AutoModelForCausalLM.from_pretrained('openbmb/BitCPM-CANN-8B') / ollama create 从 https://huggingface.co/openbmb/BitCPM-CANN-8B-gguf 导入
Nemotron-Labs-Audex-2B (NVIDIA) 2BQ4 ~1.3GB / FP16 ~4.8GB128kNVIDIA OneWay Noncommercial License需自查需代理python -c "from transformers import AutoModel; AutoModel.from_pretrained('nvidia/Nemotron-Labs-Audex-2B', trust_remote_code=True)"
Harness-1 (pat-jj) 20BQ4 ~14GB / FP16 ~50GB需自查需代理transformers from_pretrained('pat-jj/harness-1')
Huihui-GLM-5.2-GGUF (huihui-ai) MIT需自查需代理huggingface-cli download huihui-ai/Huihui-GLM-5.2-abliterated-GGUF --local-dir ./glm52(需huggingface-cli) / llama-server -m ./glm52/GLM-5.2-UD-IQ1_M.gguf -c 4096(需编译llama.cpp)
HRM-Text-1B (sapientinc) 1BQ4 ~0.8GB / FP16 ~2.8GB4096Apache-2.0可商用需代理pip install git+https://github.com/huggingface/transformers.git@main / AutoModelForCausalLM.from_pretrained('sapientinc/HRM-Text-1B', trust_remote_code=True)
Nova-1-Standard-1.3B (Smilyai Labs) 1.27BQ4 ~0.9GB / FP16 ~3.2GB2048apache-2.0需自查需代理pipeline('text-generation', model='Smilyai-labs/Nova-1-Standard-1.3B-Preview', trust_remote_code=True, device_map='auto')
Nemotron-3-Nano-30B-A3B (NVIDIA) 30B (3B 激活)Q4 ~20GB / FP16 ~72GBnvidia-open-model-license需自查需代理mlx_lm.generate --model mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
gear-manual-qwen3-4b (Raindog) 4BQ4 ~2.6GB / FP16 ~9.6GBcc-by-nc-4.0需自查需代理mlx_lm.generate --model zak-raindog/gear-manual-qwen3-4b --prompt "如何使用EP-133?"
Ornith-1.0-35B-MLX (deepreinforce-ai) 35B (3B 活跃)Q4 ~23GB / FP16 ~83GB需自查需代理uvx --from git+https://github.com/nathansutton/mlxcc chad
Mellum2-12B-A2.5B-Thinking (JetBrains) 12BQ4 ~8GB / FP16 ~29GB131kApache 2.0可商用需代理vllm serve JetBrains/Mellum2-12B-A2.5B-Thinking --max-model-len 131072 --reasoning-parser qwen3 / transformers.AutoModelForCausalLM.from_pretrained("JetBrains/Mellum2-12B-A2.5B-Thinking")
Grug-12B (kai-os) 12BQ4 ~7.9GB / FP16 ~29GBother需自查需代理ollama run hf.co/kai-os/Grug-12B
Qwen3.5-35B-A3B (Qwen) 35B (3B 激活)Q4 ~23GB / FP16 ~84GB128kapache-2.0需自查需代理mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200
Qwen3.6-35B-A3B-VQ (aquaman164) 35B (3B激活)Q4 ~23GB / FP16 ~84GB128kApache-2.0需自查需代理huggingface-cli download aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw --local-dir qwen-vq && python qwen-vq/code/vq_serve.py --model qwen-vq
Bonsai-27B (Prism ML) 27BQ4 ~18GB / FP16 ~65GB262KApache 2.0需自查需代理ollama run hf.co/prism-ml/Bonsai-27B-gguf / llama-server -hf prism-ml/Bonsai-27B-gguf -ngl 99 --jinja
Z-Image-Engineer-V6 (BennyDaBall) 4BQ4 ~2.7GB / FP16 ~9.7GBApache-2.0可商用需代理AutoModelForCausalLM.from_pretrained('BennyDaBall/Z-Image-Engineer-V6') / llama-server -hf BennyDaBall/Z-Image-Engineer-V6-GGUF
Minimalism (salakash) 0.5B32kApache-2.0可商用需代理mlx_lm.server --model mlx-community/Qwen2.5-Coder-0.5B-Instruct-4bit --adapter-path salakash/Minimalism --port 8080 / python -c "from peft import PeftModel; PeftModel.from_pretrained('Qwen/Qwen2.5-Coder-0.5B-Instruct', 'salakash/Minimalism')"
Qwen3.6-35B-A3B (Qwen) 35B (3B 激活)Q4 ~19GB / FP16 ~69GBApache-2.0需自查需代理pip install 'turboquant-mlx-full>=0.12.3' && python -m turboquant_mlx.generate --model manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
Qwen3.6-27b-Fable5 (hotdogs) 27B (基座) + LoRA需自查需代理vllm serve Qwen/Qwen3.6-27B --enable-lora --lora-modules fable=hotdogs/qwen3.6-27b-fable5-lora
aro-coder-4bit (ARO-Lang) 30B (3B active)Q4 ~0.8GB / FP16 ~3.1GBMIT可商用需代理mlx_lm.load('ARO-Lang/aro-coder-4bit') / python -m mlx_lm.server --model ARO-Lang/aro-coder-4bit --port 8080 / ollama run aro-coder
GPT-OSS-20B (OpenAI) 20B (MoE)Q4 ~14GB / FP16 ~50GBApache 2.0需自查需代理mlx_lm.generate --model majentik/gpt-oss-20b-TurboQuant-MLX-2bit --prompt '你的提示'
Supra-Router-51M (SupraLabs) 51MQ4 ~0GB / FP16 ~0.1GB3840需自查需代理AutoModelForCausalLM.from_pretrained('SupraLabs/Supra-Router-51M')
Delphi-25B (Marin Community) 25BQ4 ~16GB / FP16 ~60GB4kapache-2.0可商用需代理transformers.from_pretrained('marin-community/delphi-1e23-25Bparams-628Btokens')
Quasar-Preview (silx-ai) 18B (2B active)Q4 ~11GB / FP16 ~40GB5M (实验性配置)MIT可商用需代理python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('silx-ai/Quasar-Preview', trust_remote_code=True)"
HelixLM-40M-ep1 (david-thrower) 40.1MQ4 ~0GB / FP16 ~0.1GB1024Modified Apache 2.0需自查需代理transformers pipeline with trust_remote_code=True / transformers from_pretrained(trust_remote_code=True)
Qwen3.6-35B-A3B (andreaborio) 35B (3B 激活)Q4 ~23GB / FP16 ~84GBapache-2.0需自查需代理ollama run hf.co/andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF / llama-server -hf andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF
Nemotron-Labs-Diffusion-14B (NVIDIA) 14BQ4 ~8.9GB / FP16 ~32GBNVIDIA Nemotron Open Model License需代理transformers from_pretrained()
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA) 75B (9.3B active)Q4 ~29GB / FP16 ~107GB1MOpenMDW-1.1需自查需代理vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer
Bonsai-27B-mlx-1bit (Prism ML) 27BQ4 ~18GB / FP16 ~65GB262Kapache-2.0需自查需代理mlx_lm.generate --model prism-ml/Bonsai-27B-mlx-1bit
Ternary-Bonsai-27B (Prism ML) 27BQ4 ~18GB / FP16 ~65GB262KApache-2.0需自查需代理ollama run hf.co/prism-ml/Ternary-Bonsai-27B-gguf / llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf -ngl 99
FastContext-1.0-4B-SFT (Microsoft) 4BQ4 ~2.7GB / FP16 ~9.7GB262kMIT可商用需代理python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-SFT --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8 / AutoModelForCausalLM.from_pretrained('microsoft/FastContext-1.0-4B-SFT')
Ternary Bonsai 27B (prism-ml) 27BQ4 ~18GB / FP16 ~65GB262kapache-2.0需自查需代理llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf
Hy3-GGUF (腾讯) 65536apache-2.0需自查魔搭可用ollama run hf.co/AngelSlim/Hy3-GGUF
VibeThinker-3B (WeiboAI) 3BQ4 ~2GB / FP16 ~7.4GB64kMIT可商用魔搭可用vllm serve WeiboAI/VibeThinker-3B / AutoModelForCausalLM.from_pretrained('WeiboAI/VibeThinker-3B')
Nemotron-Labs-Audex-30B-A3B (NVIDIA) 30B MoE (3B激活)Q4 ~20GB / FP16 ~72GB1MNVIDIA Oneway Noncommercial License需自查需代理python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-Audex-30B-A3B', trust_remote_code=True)"

常见坑

  • 长上下文提示处理延迟突出,38K token 的 prompt 处理耗时 17.3 秒 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 对 prompt 格式异常敏感,会在与上下文冲突时强行将示例塞入回答 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 嵌套 JSON 输出不可靠,改用 XML 格式后表现正常 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 部分用户在 OpenCode 中遇到重复循环和空字符串函数调用问题,后自行归因于参数配置 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • Q6_K 量化版本在编码规划和组织逻辑上被社区报告优于 Q8_0,大不一定更好 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • BenchLM 综合评分仅 51.47/100,排名 #104/200 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 物理合理性图像生成弱于 Claude Opus 4.7(flamingo 骑独轮车测试中 Opus 更接近物理真实) —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 需要耐心调参,非开箱即用的完美体验 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
  • 图像生成本身复杂度高,对显存/内存需求较大 —— BennyDaBall/Z-Image-Engineer-V6
  • 社区对其能否替代现有主流模型尚无定论 —— BennyDaBall/Z-Image-Engineer-V6
  • MTP 在 max-token 设置较低时,代码质量可能不如搭配 Qwen3.5-0.8B 做 draft model 的方案 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 在部分基准测试上仍落后于 Qwen3.5 27B 和 Gemma 4 31B,并非全面领先 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • SVG/图像生成质量不稳定,社区测试中与 GLM 5.1 等模型对比有明显差距 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 日常快速响应场景下比 35B-A3B MoE 慢,不适合追求即时速度的轻量任务 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • FP8 精度下消费级 GPU 吞吐仍受限,缺乏 NVFP4 支持时理论速度约 38 tok/s —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 开启 thinking/reasoning 模式会增加延迟和 token 消耗 —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 22K token 上下文下首 token 延迟约 115 秒,长上下文下实际可用性差 —— CohereLabs/North-Mini-Code-1.0
  • 综合 benchmark 得分(28)明显弱于 Qwen 3.6 35B(43),非编码任务表现一般 —— CohereLabs/North-Mini-Code-1.0
  • 在已有代码库上修改/协作时效果急剧下降,社区反馈'失败得很惨' —— deepreinforce-ai/Ornith-1.0-35B
  • 实际编码任务中表现不佳,仅发现几乎所有模型都能发现的bug —— deepreinforce-ai/Ornith-1.0-9B
  • 无工具环境的对话中幻觉严重 —— deepreinforce-ai/Ornith-1.0-9B
  • 会幻觉工具调用及其输出 —— deepreinforce-ai/Ornith-1.0-9B
  • 上下文窗口增大后出现循环和错误操作,可能与采样参数设置有关 —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
  • 非通用聊天模型,是推理模型,需严格按模型卡指定采样参数使用 —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
  • v1 在 gpqa_diamond 上比基座 Qwen3.5-9B 低 5 分,v2 声称与 v1 持平而非提升,基准测试退化的问题可能仍在 —— empero-ai/Qwythos-9B-v2
  • 该模型基于从闭源 Claude 模型蒸馏的合成数据训练,存在版权/合规争议 —— empero-ai/Qwythos-9B-v2
  • 当前仍处于早期/中间检查点阶段,非最终稳定版本,生产使用需谨慎 —— FrontiersMind/Nandi-Mini-600M-Early-Checkpoint
  • 对复杂问题倾向于拒绝回答,实际可用范围受限 —— GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking
  • 并非 Claude 替代品,声称能平替 Claude 的说法被社区认为夸大 —— hotdogs/qwen3.6-27b-fable5-lora
  • 将 opencode 调通为 CLI agent 需要大量调参,远不如 Claude Code 开箱即用 —— hotdogs/qwen3.6-27b-fable5-lora
  • 在部分基准上 Qwen3.6 反而不如 Qwen3.5 和 Gemma 4 —— hotdogs/qwen3.6-27b-fable5-lora
  • 因内置思考与规划机制,响应速度比 35B-A3B 慢 —— hotdogs/qwen3.6-27b-fable5-lora
  • hotdogs LoRA 仓库要求同意联系方式共享才能访问模型文件 —— hotdogs/qwen3.6-27b-fable5-lora
  • abliteration 被描述为「粗糙的概念验证实现」,并非成熟方案 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • 有社区用户反馈 huihui 的去审查模型整体上「失去的比得到的多」 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • Gemma 4 12B 缺乏专用视觉编码器,视觉理解能力受限 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • 模型卡片明确声明不适合生产环境或面向公众的应用 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • 内容过滤极其有限,可能生成不适宜的输出 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • FP16 全精度推理需约 26GB 显存,多数消费级 GPU 无法承载 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • 使用者需自行承担法律和伦理风险 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
  • 有社区用户评价 abliterated 版本「pretty useless」,实际可用性受质疑 —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
  • 长上下文精确检索落后 Opus 4.8 约 3.4-3.6 分 —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
  • 原版审查极严,必须依赖 abliteration 才能解锁无审查能力 —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
  • Sonnet 5 在 50K 上下文下推理速度更快,检索质量则参差不齐 —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
  • 首批样本生成存在部分错误,官方已对两个失败模式进行复测 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
  • 训练数据来自 Claude 会话日志合成的 CoT,非原生人类标注数据 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
  • 有用户报告模型在测试中不到20分钟即陷入循环,输出重复内容 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
  • 社区独立评测数据有限,缺乏大规模验证 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
  • 非编码类通用能力弱于 Qwen 3.5 4B —— JetBrains/Mellum2-12B-A2.5B-Instruct
  • 部分任务仅获中等结果 —— JetBrains/Mellum2-12B-A2.5B-Instruct
  • 编码以外的通用任务表现弱于 Qwen 3.5 4B —— JetBrains/Mellum2-12B-A2.5B-Thinking
  • 至少需要 24GB 统一内存,推荐 32GB 以上,部署门槛较高 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • 暂无 2B-4B 小参数版本支持工具调用,社区有此类需求 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • 工具调用功能在 v2 之前存在问题(v2 已修复) —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • 当前状态不佳,业务挣扎导致技术侧妥协 —— kai-os/Grug-12B
  • 几乎无人为平台开发应用,生态萎缩 —— kai-os/Grug-12B
  • 安全方面存在明显短板 —— kai-os/Grug-12B
  • 复杂推理能力不足,处理编程重构等任务会出错 —— LiquidAI/LFM2.5-1.2B-JP-202606
  • 不适合编程和知识密集型任务 —— LiquidAI/LFM2.5-1.2B-JP-202606
  • 工具调用(如自动判断是否需要网页搜索)不可靠 —— LiquidAI/LFM2.5-1.2B-JP-202606
  • 当前原生行为/能力尚简单,需自行微调才能适配具体生产任务 —— LiquidAI/LFM2.5-230M
  • 通用对话与复杂推理能力有限,不适合直接作为日常聊天模型使用 —— LiquidAI/LFM2.5-230M
  • 编程能力较弱,在社区实测中多数编程任务未通过(4/5 coding tests failed) —— LiquidAI/LFM2.5-8B-A1B
  • 对量化精度和推理参数极其敏感,参数不对时表现明显下降 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • MoE 的专家激活机制并不像社区预期那样能「解锁」更多模型能力 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • Power Ranking 编码任务仅比上代 Qwen 3.5 同尺寸略好(11/98 vs 10/98),提升有限 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • 在编码任务上被 Qwen 3.5 27B 密集模型大幅超越(26/98 vs 11/98),不属同一级别 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • 知识和技能类基准表现明显弱于其他维度,存在「刷榜」嫌疑 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • SVG 生成在物理合理性/遵循约束方面不如 Claude Opus 4.7 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • 表现不稳定,属于「碰对了参数就很好用」的类型 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
  • 证据仅涉及缩放定律预测精度,无社区讨论涉及模型实际生成质量、推理吞吐或日常使用体验 —— marin-community/delphi-1e23-25Bparams-628Btokens
  • 当前讨论集中在训练效率与损失预测,缺乏下游任务评估(benchmark 表现、人类偏好等)的证据 —— marin-community/delphi-1e23-25Bparams-628Btokens
  • 社区讨论度很低,Reddit 帖子直言"Why is NO one talking about" —— microsoft/FastContext-1.0-4B-RL
  • 作为子 agent 而非独立模型,需要配合主 coding agent 使用,不能单独完成编码任务 —— microsoft/FastContext-1.0-4B-RL
  • 与现有 agent 工作流的实际集成仍处于早期阶段,社区自行添加支持 —— microsoft/FastContext-1.0-4B-RL
  • 官方仅提及"边际开销很小",但缺乏子 agent 本身的详细性能基准 —— microsoft/FastContext-1.0-4B-RL
  • 端到端解决率提升仅最高5.5%,并非颠覆性改进 —— microsoft/FastContext-1.0-4B-SFT
  • 仅支持只读工具(READ/GLOB/GREP),不能写代码或修改文件 —— microsoft/FastContext-1.0-4B-SFT
  • FP16推理仍需约8.8GB VRAM,低配GPU需量化才能运行 —— microsoft/FastContext-1.0-4B-SFT
  • 必须配合主编码代理使用,不能独立完成编码任务 —— microsoft/FastContext-1.0-4B-SFT
  • 目前仅验证在Mini-SWE-Agent框架下的效果,其他代理框架兼容性未知 —— microsoft/FastContext-1.0-4B-SFT
  • RL版本(4B-RL)也已发布但社区讨论极少,实际效果待验证 —— microsoft/FastContext-1.0-4B-SFT
  • 模型族跨度4B-30B,但社区关注几乎全集中在4B版本,大版本缺乏实测 —— microsoft/FastContext-1.0-4B-SFT
  • MLX 社区不如 GGUF 活跃,模板修复和量化改进滞后 —— mlx-community/Llama-2-7b-chat-mlx
  • 实际使用可能出现崩溃、prompt 缓存缺失、内存压力问题 —— mlx-community/Llama-2-7b-chat-mlx
  • 宣传的 token 速度在实际场景中可能被夸大 —— mlx-community/Llama-2-7b-chat-mlx
  • mlx-community 模型集合维护不足,部分模型系列只有少量转换 —— mlx-community/Llama-2-7b-chat-mlx
  • 权重从 bfloat16 转为 float16 存储,numpy 兼容性受限 —— mlx-community/Llama-2-7b-chat-mlx
  • 在相同硬件上吞吐量低于 gemma-2-9b,尽管参数量更少 —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
  • MMLU Pro 评测结果存在一定的随机波动,单次跑分需谨慎解读 —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
  • 风格偏机械/生硬,不适合创意写作和对话场景 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
  • 官方宣称的4倍速提升存在夸大,实际提速明显但未达宣称水平 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
  • 合成数据训练可能影响回答质量 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
  • 部分基准测试不及GLM 4.7 Flash —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
  • 能力评分仅 27.0%,官方定位为玩具代理和提示词重写器,不适合复杂推理或生产级应用 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
  • omlx v0.2.20 升级后曾出现 Internal server error,社区工具链稳定性有待观察 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
  • 0.8B 参数规模天然受限,仅适合极轻量场景 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
  • Capability Score 仅 48%,远低于同系列 4B(81.5%)和 9B(90%),能力上限有限 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
  • MLX 模型在 LM Studio 中 prompt caching 目前存在已知 bug —— mlx-community/Qwen3.5-2B-OptiQ-4bit
  • 部分 MLX 版 Qwen3.5 存在崩溃和无视设置强行注入 thinking 标签的社区反馈 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
  • 在需要独立决策时表现糟糕,3B 激活参数的限制明显暴露 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
  • 硬核编程任务上表现崩溃,在 70 个真实仓库测试中不合格 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
  • 整体能力明确低于 Claude Sonnet,复杂任务差距明显 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
  • 执行过程中倾向于中途偏离用户给出的详细指令 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
  • 对量化精度和推理参数非常敏感,需要高量化精度和正确的参数设置 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
  • 在某些对比测试中处理任务质量不如对比模型 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
  • 速度虽快,但任务完成质量下降(以质量换速度) —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
  • 相比 GGUF 4-bit 同量化,生成推理 token 量约翻倍,较为冗长 —— mlx-community/Qwen3.5-9B-OptiQ-4bit
  • MLX 多轮对话性能明显低于单轮 —— mlx-community/Qwen3.5-9B-OptiQ-4bit
  • 推理能力基准测试仅 60%,相对薄弱 —— mlx-community/Qwen3.5-9B-OptiQ-4bit
  • 编程能力基准测试 70%,表现中等 —— mlx-community/Qwen3.5-9B-OptiQ-4bit
  • 在无工具对话中容易产生幻觉 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
  • 实际代码修复表现可能不如基准测试的分数 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
  • MLX 转换需要额外 monkeypatch 处理未融合的 MoE experts —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
  • 事实性错误率远高于自回归版本,同一任务实测错误多出约 6 倍 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 话题越冷门/长尾,生成质量下降越明显(热门话题 4 处错误 vs 冷门话题 12 处错误) —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • Google 官方建议当质量优先时仍应使用 Gemma 4 自回归版本 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 本地模型能力远不及商业 API,社区提醒需将预期降至十分之一 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 当前阶段更适合作为快速初稿生成器,需搭配精修模型做二次修正 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 扩散架构在低并发单用户场景下优势最明显,高并发下相对优势缩小 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
  • 社区讨论热度和实际使用量远低于 Qwen 和 Gemma 系列 —— nvidia/Nemotron-Labs-Audex-2B
  • 有用户反映 Nemotron 模型在实际使用中始终不如其基于的 Qwen 模型 —— nvidia/Nemotron-Labs-Audex-2B
  • 社区实际使用案例稀少,有用户直接质疑是否有人真正在用 —— nvidia/Nemotron-Labs-Diffusion-14B
  • 部分讨论将其与图像生成模型(eDiffi/DALL-E)混淆,存在认知偏差 —— nvidia/Nemotron-Labs-Diffusion-14B
  • 社区实测反馈极少,除个别用户外缺乏广泛真实使用验证 —— nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16
  • Arena-Hard-V2 (-4.2) 和 SWE-Bench (-2.6) 是压缩的主要能力代价 —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
  • 需要 PIECEWISE CUDA graphs 等精细配置才能达到高 decode 速度,FULL graphs 无法在 24GB 卡上运行 —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
  • Prefill 密集型场景下吞吐提升仅 1.60x,收益明显低于 decode 密集型场景 —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
  • NVFP4 相比 FP8 的质量损失尚未被充分验证 —— nvidia/Qwen3.6-27B-NVFP4
  • 需要约 40 GB VRAM,最低需 L40S 48GB 或双卡方案 —— nvidia/Qwen3.6-27B-NVFP4
  • 双 3090 方案占用空间大、发热高 —— nvidia/Qwen3.6-27B-NVFP4
  • DGX Spark 上 35B MoE NVFP4 加推测解码实际仅约 50 tok/s,远低于宣传的 110 tok/s —— nvidia/Qwen3.6-27B-NVFP4
  • NVFP4 在 Blackwell (SM120) 上并不比 FP8 更快 —— nvidia/Qwen3.6-27B-NVFP4
  • 作为 CLI 编码代理配置(opencode)需要额外调校,不如 Claude Code 开箱即用 —— nvidia/Qwen3.6-27B-NVFP4
  • NVIDIA 版本的 NVFP4 部分不使用 NVFP4 激活,仅做权重量化 —— nvidia/Qwen3.6-27B-NVFP4
  • vLLM 在 16GB 消费卡上内存上限为 16K,长上下文受限 —— nvidia/Qwen3.6-27B-NVFP4
  • NVFP4 量化存在质量损失,可能出现失控生成和退化循环 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 在架构写作等非编程任务上,同系 27B 稠密模型可能更优 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • DGX Spark 上更新 vLLM 会遇到依赖冲突,部署有坑 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • 稠密模型(27B)在某些任务上质量更好,只是速度不及 MoE —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • NVFP4 格式依赖 NVIDIA 硬件和 vLLM,通用性受限 —— nvidia/Qwen3.6-35B-A3B-NVFP4
  • GGUF 格式转换存在问题,unsloth 和 bartowski 已确认正在调查,llama.cpp 加载报错 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
  • 关闭 thinking 模式后可能不需要 abliteration 即可绕过拒绝 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
  • 社区反馈 safetensors 格式变体尚未提供 —— openbmb/BitCPM-CANN-8B
  • 模型卡缺少 base_model 元数据标注 —— openbmb/BitCPM-CANN-8B
  • 基准测试表现可能属于典型 hype,实际使用中未必复现 —— pat-jj/harness-1
  • 在测试的搜索模型中仍落后于 Opus-4.6 —— pat-jj/harness-1
  • 指令跟随和对细节的把控弱,常忽略 system prompt 中的关键要求,不如 Gemma 4 12B QAT 和 Qwen 3.6 35B A3B 可靠 —— prism-ml/Bonsai-27B-gguf
  • 不适合复杂编程或多步自主工作流,输出常被截断且不返回完整结果,官方也声明 agentic coding 不是当前版本的重点目标 —— prism-ml/Bonsai-27B-gguf
  • KV 缓存占用仍偏高,全精度下仅约 100k 上下文,Q8_0 下约 150k,限制了长上下文场景 —— prism-ml/Bonsai-27B-gguf
  • dspark 投机解码与当前 PrismML 的 llama.cpp 分支存在兼容问题,预测长度被错误绑定到主模型上下文,导致 CUDA 内存分配暴涨 —— prism-ml/Bonsai-27B-gguf
  • 在同显存条件下,实际表现不如 Qwen 3.6 27B Q2_K_XL 和 Gemma 4 12B QAT,预填充和解码速度也未达预期 —— prism-ml/Bonsai-27B-gguf
  • 训练时在高难度类别上存在质量差距,二元版保留 89.5%、三元版保留 94.6% 的全精度基准平均水平 —— prism-ml/Bonsai-27B-gguf
  • 需使用 llama.cpp 定制分支,该分支已落后上游版本 —— prism-ml/Bonsai-27B-mlx-1bit
  • 语言能力测试中不及 Qwen3.5-2B 4-bit 量化版 —— prism-ml/Bonsai-27B-mlx-1bit
  • 愚人节发布导致初期可信度受影响 —— prism-ml/Bonsai-27B-mlx-1bit
  • 实际问答质量远不如 Gemma 4-E2B,被社区用户评价为「远比 Gemma 4 笨」 —— prism-ml/Bonsai-8B-mlx-1bit
  • 三元量化版本表现比 1-bit 版本更差,且体积反而比 Gemma 4 Q4_K_M 更大 —— prism-ml/Bonsai-8B-mlx-1bit
  • 与 Gemma 4 Q4_K_M 相比体积仅小约 29%,优势有限 —— prism-ml/Bonsai-8B-mlx-1bit
  • GGUF 版本加载失败,llama.cpp 兼容性存在问题 —— prism-ml/Ternary-Bonsai-27B-gguf
  • 指令遵循能力弱,经常忽略细节要求,不按预设流程激活技能(约 10 次中仅 1 次自动执行) —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
  • 实际工作流体验不如同尺寸 Qwen 3.6 27B Q2_K_XL 量化版,也不如 Gemma 4 12B QAT —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
  • 三元版约 7.2GB 超出手机每应用 6GB iOS 内存限制,无法在手机上部署 —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
  • 长程多文件 agentic coding 工作流暂不支持,官方明确标注为当前版本不擅长 —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
  • 视觉能力显著弱于同尺寸竞品 —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
  • 实际智能远弱于 Gemma-4-E2B 等常规 2B 模型 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
  • Ternary(1.58-bit)版本回答甚至比 1-bit 版本更差 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
  • 在 benchmark 上被 Ministral 3B 略微超过,8B 体量未转化为对应能力 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
  • 不适合需要强推理能力的实际任务 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
  • 定位模糊,官方未清晰说明其与通用聊天/指令模型的区别,导致社区困惑 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 从专家级难度起频繁输出空白,复杂任务上崩溃 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 不适合作为代码生成器使用 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 非标准聊天/指令模型,不能当作通用对话助手 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 推理过程较长 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 社区成员自身指出 Reddit 不适合作为新闻来源 —— salakash/Minimalism
  • 极简主义有时被指出隐含经济阶层门槛 —— salakash/Minimalism
  • 非标准模型架构:使用自定义 hrm_text 模型类,非 Llama/Qwen 等主流 decoder,生态兼容性受限 —— sapientinc/HRM-Text-1B
  • 非最终版模型,仅为预训练基础模型,不追求 SOTA —— silx-ai/Quasar-Preview
  • 仍处于早期预训练阶段,仅为checkpoint而非成品模型 —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
  • 合规性与行为表现评级为F- —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
  • 无特定功能特性 —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
  • 基于 Qwen 2.5 的 3B 模型声称对标前沿模型,benchmark 宣称缺乏独立复现和社区背书 —— squ11z1/Mythos-nano
  • 社区关注度极低,缺乏实际使用反馈和第三方评测 —— squ11z1/Mythos-nano
  • 对自定义工具调用格式(如 <call>...</call>)遵循能力差 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 部分 prompt 字符串会破坏输出逻辑 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 在多语言交流中逻辑有问题,英语场景也偶有出现 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 事实性任务中存在明显幻觉 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • benchmark 高分与实际使用可靠性之间存在落差 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 不能替代 Opus 等大模型用于专业日常工作 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 纯编码能力上 Gemma-4-12B 可能略优 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
  • 无法可靠用于代码工程与 agentic coding 场景 —— WeiboAI/VibeThinker-3B
  • 工具调用不可靠:反复无法正确指定 grep 的 pattern 参数,调用被拒绝 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
  • Qwen3.5-9B 在 8 项 benchmark 中赢了 5 项,尽管参数量更小 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
  • Q8_0 量化生成速度仅 25.2 t/s,远低于 Q4_K_M 的 72.3 t/s —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
  • MTP/assistant model 的 GGUF 量化尚未就绪,llama.cpp 支持仍在开发中 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
  • 官方模型存在拒答问题,需使用 heretic 等去审查版本 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
  • 受显存限制时需关闭 thinking mode 才能运行 12B 模型 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
  • Q5 量化下仍可能出现大量语法错误(一个文件需 23 次编辑) —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
  • MoE 变体(26B-A4B)运行速度显著慢于 Qwen 3.5 同类模型 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
  • 上下文超过约 65k 时出现 OOM —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • MTP 模式下代码质量可能不如使用独立 draft model (Qwen3.5-0.8B) —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • SVG 生成效果不佳,与 GLM 5.1 相比明显偏弱 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 数学能力弱于 35B-A3B (AIME 87.8 vs 92.7) —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • MTPLX v0.1.0-preview 仅支持 Qwen3-Next-MTP,兼容范围有限 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 即使是 4-bit 量化仍需约 20GB 内存,对 16GB 设备仍有门槛 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
  • 量化低于 Q4 时模型性能严重退化 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 实际 agentic 工具调用场景中简单工具调用仍不可靠 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 同尺寸竞品 Qwen 3.5 9B 在 5/8 项基准测试中胜出,且参数量更小 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • encoder-free 架构较新,社区适配和调试存在一定门槛 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 该微调为社区实验性产物,非官方发布 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 定性/创意类任务的实际表现可能不同于基准分数 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • OpenCode 下工具调用极差,Q8 量化连一次工具调用都无法完成,只回复"Okay."(evidence 4、7) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 工具调用时反复无法正确指定参数(如 grep 的 pattern),调用被拒绝(evidence 7) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 有用户明确表示不会用它做编程调试,倾向 Gemma-4-31B 或 Qwen3.6-27B(evidence 1) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 该 Fable-5 微调被质疑为噱头,认为 12B 模型无法承载更大模型的推理能力(evidence 2) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 官方 8Q 模型存在拒答问题,需 heretic 版本才能正常生成(evidence 6) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • Q8 量化生成速度骤降至 25.2 t/s,相比 Q4 的 72.3 t/s 大幅下降(evidence 5) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 尚无 assistant 模型的 GGUF 量化版本(evidence 5) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • MTP(多 token 预测)支持仍在开发中(evidence 5) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
  • 表内约三分之一的卡片 vram 字段为空(未知),不代表能塞进 16GB,需要在具体推理框架里实测确认——本表默认不剔除未知项以免削薄表格,数据口径见 docs/research/2026-07-guide-inventory.md §2。
  • 表内保留的部分 30B+ 模型(如 deepreinforce-ai/Ornith-1.0-35B、Qwen/Qwen-AgentWorld-35B-A3B、CohereLabs/North-Mini-Code-1.0)原生 Q4 估算已超过 16GB,虽然库里有对应的 GGUF 量化形态,但该形态具体显存数字未收录,下载前请自行查看对应仓库的量化说明。

常见问题

16GB 统一内存的 Mac 算不算?
算,但要认准 MLX/GGUF 形态。表内 mlx-community 系列(如 mlx-community/Meta-Llama-3-8B-Instruct-4bit 约 1.1GB、mlx-community/Qwen3.5-2B-OptiQ-4bit 约 0.3GB)本身就是为 Apple Silicon 统一内存优化的量化形态;16GB 统一内存要同时供系统和其他 App 用,量化后的显存数字只是模型权重本身,建议预留冗余而不是刚好卡线。
vram 显示未知的卡能直接排除吗?
不建议。表内约三分之一的行 vram 为空,这是数据缺口而非"用不了"的信号——多数是已发布但未回填显存估算的卡,实际能否塞进 16GB 请在 llama.cpp/vLLM 里按量化档位实测。
被排除的大模型是不是完全没法本地跑?
本页 exclude 的 11 个模型是"Q4 估算已明确超过 16GB 且库内没有更低位形态"才排除,像 zai-org/GLM-5.2(753B,卡片本身标注 cloud_only:true 且 not_for 明确写"本地消费级硬件部署")基本没有 16GB 方案;但也有部分表内保留的 30B+ 模型(如 Ornith-1.0-35B)原生估算超 16GB 却已有 GGUF 版本,只是具体量化后显存数字未收录,想尝试请自行查看该仓库的量化说明。

对比表数据更新于 2026-07-21

收藏本页,或 订阅 RSS 追踪每日更新。

Read in English →