Guides / What local large models can run on 16GB VRAM/RAM (2026-07) · 中文版
What local large models can run on 16GB VRAM/RAM (2026-07)
First eliminate 11 unrealistic options where Q4 estimate clearly exceeds 16GB and the library has no lower-bit quant form, then pick a few ready-to-use ones by purpose.
Editorial picks
This page covers all text-only LLM cards on the site (pipeline_tag is text-generation). We have eliminated 11 models whose Q4 estimates clearly exceed 16GB and for which the library has no lower-bit quant forms (such as the 753B cloud_only GLM-5.2, and several quant packages that are already mlx 4bit/8bit yet still exceed the limit); see the endnotes for the list. About one-third of the rows have empty vram fields—this is a data gap, not a signal that they can't fit—please test as needed.
- Top pick for coding agent Ornith-1.0-9B (DeepReinforce)
key_info.vram is Q4 ~5GB, license MIT; key_info.agent.tool_calling marked OpenAI-style (Qwen3 XML); why_trust states "self-improving RL training, SWE-bench Verified 69.4%, supports OpenAI-compatible tool calling"; good_for explicitly lists coding agent and tool-calling/terminal tasks.
- Long-context repository exploration (used with the main agent) FastContext-1.0-4B-RL (Microsoft)
key_info.vram is Q4 ~2.7GB, context 262k, license MIT; community.solves notes "FP16 needs only ~8.8GB VRAM, INT4 ~2.2GB, deployable on consumer GPUs" and "reduces main agent token consumption by up to 60%"; but watch_outs reminds it's a sub-agent, must be used with a main coding agent, and the card's not_for states not suitable for "solving coding tasks independently or general conversation".
- On-device general assistant / tool calling LFM2.5-8B-A1B (LiquidAI)
key_info.vram is Q4 ~5.6GB, supports GGUF/MLX and other deployments; community.solves mentions "runs on low-spec hardware (community says 'any potato' can run the A1B version)", "native tool calling and Agent workflow, can run offline"; but watch_outs also notes "weak coding ability (community tested 4/5 coding tasks failed)", not suitable as a programming model.
- General conversation / coding speed vs quality compromise Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
key_info.vram is Q4 ~12GB, within 16GB budget; community.consensus says it's "the best compromise of speed and quality for local coding scenarios", solves mentions "runs smoothly on consumer NVIDIA hardware (RTX 5090, DGX Spark)"; watch_outs also warns "NVFP4 quantization has quality loss, may cause runaway generation and degenerated loops".
- Lightweight math / code reasoning VibeThinker-3B (WeiboAI)
key_info.vram only Q4 ~2GB, license MIT commercially usable; why_trust gives IMO-AnswerBench 76.4, LeetCode weekly contest pass rate 96.1% etc.; but community.consensus bluntly says "benchmark scores are eye-catching but actual coding experience varies dramatically", watch_outs mentions users tested "far worse than Qwen 3.5 4B", there is a gap between benchmark scores and real coding ability, don't just look at scores.
Full comparison
| Model | Params | VRAM | Context | License | Commercial use | China access | Deploy |
|---|---|---|---|---|---|---|---|
| SuperGemma4-26B-Uncensored (Jiunsong) | 26B | ~16GB 4-bit | — | gemma | 限制商用 | 需代理 | ollama run hf.co/Jiunsong/supergemma4-26b-uncensored-gguf-v2 / huggingface-cli download Jiunsong/supergemma4-26b-uncensored-gguf-v2 --include '*.gguf' --local-dir . / llama-cli -m supergemma4-26b-uncensored-fast-v2-Q4_K_M.gguf |
| Qwen3.6-35B-A3B-NVFP4 (NVIDIA) | 35B (激活3B) | ~21GB 8-bit | 262k | Apache 2.0 | 可商用 | 需代理 | vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt |
| Dolphin3-Cyber-8B (RavichandranJ) | 8B | ~4.8GB 4-bit | 2k | llama3.1 | 需自查 | 需代理 | ollama run hf.co/RavichandranJ/Dolphin3-Cyber-8B-GGUF |
| DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA) | 25.2B (3.8B活跃) | ~16GB 8-bit | 256k | Apache 2.0 (Gemma Terms) | 可商用 | 需代理 | VLLM_USE_V2_MODEL_RUNNER=1 vllm serve nvidia/diffusiongemma-26B-A4B-IT-NVFP4 --trust-remote-code --max-num-seqs 4 --attention-backend TRITON_ATTN --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 --override-generation-config '{"max_new_tokens": null}' --default-chat-template-kwargs '{"enable_thinking":true}' (需H100/B100) |
| Qwen3.6-27B-MTPLX (Youssofal) | 27B | ~16GB 4-bit | — | Apache-2.0 | 可商用 | 需代理 | brew install youssofal/mtplx/mtplx / mtplx pull Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed / mtplx serve --model Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed --port 8000 |
| Ornith-1.0-35B (DeepReinforce) 原生 · FP8 · GGUF | 35B-MoE | ~39GB FP8 | 256k | MIT | 需自查 | 需代理 | vllm serve deepreinforce-ai/Ornith-1.0-35B --served-model-name Ornith-1.0-35B --tensor-parallel-size 8 --host 0.0.0.0 --port 8000 --max-model-len 262144 --gpu-memory-utilization 0.90 --enable-prefix-caching --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code / python -m sglang.launch_server --model-path deepreinforce-ai/Ornith-1.0-35B --served-model-name Ornith-1.0-35B --tp 8 --host 0.0.0.0 --port 8000 --context-length 262144 --mem-fraction-static 0.85 --tool-call-parser qwen3_coder --reasoning-parser qwen3 / llama-server -hf deepreinforce-ai/Ornith-1.0-35B-GGUF --port 8000 -c 262144 |
| Huihui-Qwythos-9B-1M (huihui-ai) | 9B | ~5.4GB 4-bit | 1M | apache-2.0 | 需自查 | 需代理 | llama-cli -hf huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF --model Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-Q4_K.gguf -ngl 99 -c 262144 -fa on -np 1 --spec-type draft-mtp --spec-draft-n-max 2 |
| LFM2.5-8B-A1B (LiquidAI) 原生 · GGUF·liquidai · GGUF·unsloth | 8.3B (1.5B active) | ~5.1GB 4-bit | 128k | LFM1.0 | 需自查 | 需代理 | transformers >= 5.0.0: AutoModelForCausalLM.from_pretrained('LiquidAI/LFM2.5-8B-A1B') |
| Qwen-AgentWorld-35B-A3B (Qwen) 原生 · GGUF | 35B (3B激活) | ~21GB 4-bit | 262k | Apache-2.0 | 需自查 | 魔搭可用 | python -m sglang.launch_server --model-path Qwen/Qwen-AgentWorld-35B-A3B --port 8000 --tp-size 4 --context-length 262144 --reasoning-parser qwen3 / vllm serve Qwen/Qwen-AgentWorld-35B-A3B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --trust-remote-code |
| Qwythos-9B-v2 (Empero AI) 原生 · GGUF | 9B | ~5.8GB 4-bit | 1048k | Apache-2.0 | 需自查 | 需代理 | vllm serve empero-ai/Qwythos-9B-v2 --trust-remote-code |
| Ternary-Bonsai-8B (Prism ML) | 8B | ~2.2GB ternary | 65k | Apache-2.0 | 可商用 | 需代理 | mlx_lm.load('prism-ml/Ternary-Bonsai-8B-mlx-2bit') / mlx-lm generate --model prism-ml/Ternary-Bonsai-8B-mlx-2bit |
| Ornith-1.0-9B (DeepReinforce) 原生 · GGUF·deepreinforce-ai · GGUF·protolabsai | 9B | ~5.4GB 4-bit | 256k | MIT | 需自查 | 需代理 | vllm serve deepreinforce-ai/Ornith-1.0-9B --served-model-name Ornith-1.0-9B --host 0.0.0.0 --port 8000 --max-model-len 262144 --gpu-memory-utilization 0.90 --enable-prefix-caching --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code / llama-server -hf deepreinforce-ai/Ornith-1.0-9B-GGUF --port 8000 -c 262144 / AutoModelForCausalLM.from_pretrained("deepreinforce-ai/Ornith-1.0-9B", device_map="auto") |
| LFM2.5-230M (LiquidAI) 原生 · GGUF | 230M | ~0.1GB 4-bit | 32768 | LFM1.0 | 需自查 | 需代理 | vllm serve LiquidAI/LFM2.5-230M / llama-server -hf LiquidAI/LFM2.5-230M-GGUF / python -c 'from transformers import AutoModelForCausalLM, AutoTokenizer; model=AutoModelForCausalLM.from_pretrained("LiquidAI/LFM2.5-230M", device_map="auto", dtype="bfloat16"); tokenizer=AutoTokenizer.from_pretrained("LiquidAI/LFM2.5-230M")' |
| Bonsai-8B-mlx-1bit (PrismML) | 8B | ~1.2GB 1-bit | 65k | Apache-2.0 | 可商用 | 需代理 | pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit') |
| North-Mini-Code-1.0 (CohereLabs) 原生 · GGUF | 30B总 / 3B激活 | ~18GB 4-bit | 256K | Apache-2.0 | 可商用 | 需代理 | transformers.from_pretrained() / vllm serve CohereLabs/North-Mini-Code-1.0 |
| Qwopus3.5-9B-Coder-MTP (Jackrong) GGUF·jackrong·MTP · GGUF·jackrong | 9B | ~5.4GB 4-bit | 128k | apache-2.0 | 可商用 | 需代理 | ollama run hf.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF:Q4_K_M / llama.cpp: ./llama-cli -m qwopus3.5-9b-coder-mtp.Q4_K_M.gguf -ngl 99 / llama-cpp-python: Llama(model_path='<gguf-path>') |
| Qwen3.5-9B-OptiQ-4bit (mlx-community) | 9B | ~9.8GB 8-bit | 128k | apache-2.0 | 需自查 | 需代理 | mlx_lm.generate --model mlx-community/Qwen3.5-9B-OptiQ-4bit |
| Meta-Llama-3-8B-Instruct-4bit (mlx-community) | 8B | ~4.8GB 4-bit | 8k | llama3 | 需自查 | 需代理 | pip install mlx-lm && mlx_lm.generate --model mlx-community/Meta-Llama-3-8B-Instruct-4bit --prompt "hello" / from mlx_lm import load, generate; model, tokenizer = load('mlx-community/Meta-Llama-3-8B-Instruct-4bit'); generate(model, tokenizer, prompt='hello') |
| Nandi-Mini-600M (FrontiersMind) | 600M | ~0.4GB 4-bit | 2048 | apache-2.0 | 可商用 | 需代理 | transformers.from_pretrained('FrontiersMind/Nandi-Mini-600M-Early-Checkpoint') |
| Gemma-4-12B-OBLITERATED (OBLITERATUS) | 12B | ~7.2GB 4-bit | — | gemma | 限制商用 | 需代理 | ollama run hf.co/OBLITERATUS/Gemma-4-12B-OBLITERATED / transformers from_pretrained('OBLITERATUS/Gemma-4-12B-OBLITERATED') |
| Nemotron-Labs-TwoTower-30B-A3B (NVIDIA) | 30B (3B 激活) | ~18GB 4-bit | 128k | NVIDIA Nemotron Open Model License | 需自查 | 需代理 | python3 -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16',trust_remote_code=True,torch_dtype='bfloat16').cuda()" (单GPU AR模式,约59GB显存) / python3 -c "from transformers import AutoModelForCausalLM; m=AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16',trust_remote_code=True,torch_dtype='bfloat16'); m.place_towers_on_devices('cuda:0','cuda:1')" (双GPU扩散模式,每卡约59GB显存) |
| Mythos-nano (squ11z1) | 3B | ~1.9GB 4-bit | — | MIT | 需自查 | 需代理 | ollama run hf.co/squ11z1/Mythos-nano / vllm serve squ11z1/Mythos-nano / AutoModelForCausalLM.from_pretrained("squ11z1/Mythos-nano", torch_dtype="auto", device_map="auto") / llama-server -m hf://squ11z1/Mythos-nano:mythos-nano-Q4_K_M.gguf |
| Qwopus3.6-27B-v2-MTP-GGUF (Jackrong) GGUF·jackrong·MTP · GGUF·jackrong | 27B | ~16GB 4-bit | 128k | Apache 2.0 | 可商用 | 需代理 | huggingface-cli download Jackrong/Qwopus3.6-27B-v2-MTP-GGUF qwopus3.6-27b-v2-mtp.Q4_K_M.gguf / llama.cpp server -m qwopus3.6-27b-v2-mtp.Q4_K_M.gguf -ngl 99 |
| Qwen3.5-9B (Qwen) | 9B | ~5.4GB 4-bit | 32k | MIT | 可商用 | 需代理 | ollama run hf.co/w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP / llama.cpp: ./llama-cli -m Qwen3.5-9B-MoQ-4.85.gguf |
| MiniCPM5-1B-Thinking (OpenBMB) 原生 · GGUF | 1B | ~0.6GB 4-bit | 128k | Apache-2.0 | 需自查 | 需代理 | ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF |
| Qwen3.5-0.8B-OptiQ-4bit (mlx-community) | 0.8B | ~0.9GB 8-bit | — | Apache 2.0 | 可商用 | 需代理 | pip install mlx-lm; mlx_lm.generate --model mlx-community/Qwen3.5-0.8B-OptiQ-4bit --prompt '...' / pip install mlx-optiq; optiq serve --model mlx-community/Qwen3.5-0.8B-OptiQ-4bit --mtp |
| Llama-2-7b-chat-mlx (mlx-community) | 7B | ~4.2GB 4-bit | 4096 | llama2 | 限制商用 | 需代理 | git clone https://github.com/ml-explore/mlx-examples && pip install mlx huggingface_hub && huggingface-cli download mlx-community/Llama-2-7b-chat-mlx --local-dir model / python mlx-examples/llama/llama.py --prompt 'Hi' model/ |
| MaralGPT-Mythos-9B (MaralGPT) | 9B | ~5.4GB 4-bit | 1M | apache-2.0 | 需自查 | 需代理 | ollama run hf.co/MaralGPT/MaralGPT-Mythos-9B-2606-GGUF |
| Qwen3.5-2B-OptiQ-4bit (mlx-community) | 2B | ~2.2GB 8-bit | — | apache-2.0 | 可商用 | 需代理 | mlx-lm generate --model mlx-community/Qwen3.5-2B-OptiQ-4bit / optiq serve --model mlx-community/Qwen3.5-2B-OptiQ-4bit --mtp |
| LFM2.5-1.2B-JP (LiquidAI) | 1.2B | ~0.7GB 4-bit | 32k | LFM1.0 | 需自查 | 需代理 | transformers AutoModelForCausalLM.from_pretrained('LiquidAI/LFM2.5-1.2B-JP-202606') / vllm serve LiquidAI/LFM2.5-1.2B-JP-202606 / llama-server -hf LiquidAI/LFM2.5-1.2B-JP-202606-GGUF |
| MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking (GnLOLot) | 1B | ~0.6GB 4-bit | 128k | Apache-2.0 | 需自查 | 需代理 | ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF / llama-server -hf GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF -m MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-Q8_0.gguf -c 8192 |
| FastContext-1.0-4B-RL (Microsoft) | 4B | ~2.4GB 4-bit | 262k | MIT | 需自查 | 需代理 | python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-RL --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8 / from transformers import AutoModelForCausalLM; model = AutoModelForCausalLM.from_pretrained('microsoft/FastContext-1.0-4B-RL', trust_remote_code=True) |
| Qwen3.6-27B-NVFP4 (NVIDIA) | 27B | ~30GB 8-bit | 262k | Apache-2.0 | 需自查 | 需代理 | vllm serve nvidia/Qwen3.6-27B-NVFP4 --port 8000 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3 |
| Gemma4-12B-Coder (yuxinlu1) | 12B | ~7.2GB 4-bit | 131k | gemma | 可商用 | 需代理 | ollama run hf.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF / llama-server -hf yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF -m gemma4-coding-Q4_K_M.gguf --ctx-size 16384 (需 llama.cpp 最新版,支持 gemma4_unified) |
| Gemma-4-12B Agentic v2 (yuxinlu1) 原生 · GGUF | 12B | ~7.2GB 4-bit | 16k(示例命令) | Apache-2.0 | 需自查 | 需代理 | llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -ngl 99 --jinja |
| Huihui-gemma-4-12B-coder-abliterated (huihui-ai) | 12B | ~7.2GB 4-bit | — | apache-2.0 | 需自查 | 需代理 | python3 -c 'from transformers import AutoModelForCausalLM; model = AutoModelForCausalLM.from_pretrained("huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated")' / vllm serve huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated |
| MiniCPM5-1B (OpenBMB) 原生 · GGUF | 1B | ~0.6GB 4-bit | 128k | apache-2.0 | 可商用 | 魔搭可用 | vllm serve openbmb/MiniCPM5-1B --port 8000 / sglang --model-path openbmb/MiniCPM5-1B --port 30000 / transformers AutoModelForCausalLM.from_pretrained('openbmb/MiniCPM5-1B') |
| Qwen3.6-27B-MTP-pi-tune (bytkim) | 27B | ~16GB 4-bit | 256k | Apache-2.0 | 可商用 | 需代理 | ollama run hf.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF / llama-server -hf bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF:Q4_K_M --jinja -ngl 99 -fa -c 131072 --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0 --presence-penalty 1.5 / hf download bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF Qwen3.6-27B-MTP-pi-tune-Q4_K_M.gguf --local-dir . |
| Qwythos-9B (Empero) 原生 · GGUF | 9B | ~5.6GB 4-bit | 1M | Apache 2.0 | 需自查 | 需代理 | vllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000 / AutoModelForImageTextToText.from_pretrained('empero-ai/Qwythos-9B-Claude-Mythos-5-1M', dtype='bfloat16', device_map='auto') |
| Gemma-4-12B-it-LWQ6 (wepiqx) | 12B | ~13GB 8-bit | — | Apache-2.0 | 需自查 | 需代理 | llama-server -hf wepiqx/gemma-4-12B-it-LWQ6-GGUF:gemma-4-12b-it-LWQ6-IQ4_XS.gguf --jinja --flash-attn on -c 55555 -ngl 99 / llama-cli -hf wepiqx/gemma-4-12B-it-LWQ6-GGUF:gemma-4-12b-it-LWQ6-IQ4_XS.gguf -p "Your prompt" -ngl 99 |
| Mellum2-12B-A2.5B-Instruct (JetBrains) | 12B (2.5B active) | ~7.3GB 4-bit | 131k | apache-2.0 | 可商用 | 需代理 | vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072 / transformers.from_pretrained('JetBrains/Mellum2-12B-A2.5B-Instruct') |
| SIQ-1-35B (AlexWortega) | 35B (3B激活) | ~21GB 4-bit | 131k | Apache-2.0 | 需自查 | 需代理 | python -m sglang.launch_server --model-path AlexWortega/SIQ-1-35B --tp 2 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3 --port 8080 / AutoModelForCausalLM.from_pretrained('AlexWortega/SIQ-1-35B', device_map='auto', torch_dtype='auto') / huggingface-cli download AlexWortega/SIQ-1-35B gguf/Q4_K_M.gguf --local-dir ./siq && docker run -d --gpus all -v ./siq:/m -p 8080:8080 ghcr.io/ggml-org/llama.cpp:server-cuda -m /m/gguf/Q4_K_M.gguf -ngl 99 -c 131072 -np 4 --jinja |
| BitCPM-CANN-8B (OpenBMB) | 8B | ~2.2GB ternary | — | apache-2.0 | 可商用 | 需代理 | transformers: AutoModelForCausalLM.from_pretrained('openbmb/BitCPM-CANN-8B') / ollama create 从 https://huggingface.co/openbmb/BitCPM-CANN-8B-gguf 导入 |
| Nemotron-Labs-Audex-2B (NVIDIA) | 2B | ~1.2GB 4-bit | 128k | NVIDIA OneWay Noncommercial License | 需自查 | 需代理 | python -c "from transformers import AutoModel; AutoModel.from_pretrained('nvidia/Nemotron-Labs-Audex-2B', trust_remote_code=True)" |
| Harness-1 (pat-jj) | 20B | ~13GB 4-bit | — | — | 需自查 | 需代理 | transformers from_pretrained('pat-jj/harness-1') |
| Huihui-GLM-5.2-GGUF (huihui-ai) | — | — | — | MIT | 需自查 | 需代理 | huggingface-cli download huihui-ai/Huihui-GLM-5.2-abliterated-GGUF --local-dir ./glm52(需huggingface-cli) / llama-server -m ./glm52/GLM-5.2-UD-IQ1_M.gguf -c 4096(需编译llama.cpp) |
| HRM-Text-1B (sapientinc) | 1B | ~0.7GB 4-bit | 4096 | Apache-2.0 | 可商用 | 需代理 | pip install git+https://github.com/huggingface/transformers.git@main / AutoModelForCausalLM.from_pretrained('sapientinc/HRM-Text-1B', trust_remote_code=True) |
| Nova-1-Standard-1.3B (Smilyai Labs) | 1.27B | ~0.8GB 4-bit | 2048 | apache-2.0 | 需自查 | 需代理 | pipeline('text-generation', model='Smilyai-labs/Nova-1-Standard-1.3B-Preview', trust_remote_code=True, device_map='auto') |
| Nemotron-3-Nano-30B-A3B (NVIDIA) | 30B (3B 激活) | ~33GB 8-bit | — | nvidia-open-model-license | 需自查 | 需代理 | mlx_lm.generate --model mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit |
| gear-manual-qwen3-4b (Raindog) | 4B | ~2.4GB 4-bit | — | cc-by-nc-4.0 | 需自查 | 需代理 | mlx_lm.generate --model zak-raindog/gear-manual-qwen3-4b --prompt "如何使用EP-133?" |
| Ornith-1.0-35B-MLX (deepreinforce-ai) | 35B (3B 活跃) | ~12GB 2-bit | — | — | 需自查 | 需代理 | uvx --from git+https://github.com/nathansutton/mlxcc chad |
| Mellum2-12B-A2.5B-Thinking (JetBrains) | 12B | ~7.3GB 4-bit | 131k | Apache 2.0 | 可商用 | 需代理 | vllm serve JetBrains/Mellum2-12B-A2.5B-Thinking --max-model-len 131072 --reasoning-parser qwen3 / transformers.AutoModelForCausalLM.from_pretrained("JetBrains/Mellum2-12B-A2.5B-Thinking") |
| Grug-12B (kai-os) | 12B | ~7.2GB 4-bit | — | other | 需自查 | 需代理 | ollama run hf.co/kai-os/Grug-12B |
| Qwen3.5-35B-A3B (Qwen) | 35B (3B 激活) | ~39GB 8-bit | 128k | apache-2.0 | 需自查 | 需代理 | mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200 |
| Qwen3.6-35B-A3B-VQ (aquaman164) | 35B (3B激活) | ~21GB 4-bit | 128k | Apache-2.0 | 需自查 | 需代理 | huggingface-cli download aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw --local-dir qwen-vq && python qwen-vq/code/vq_serve.py --model qwen-vq |
| Bonsai-27B (Prism ML) | 27B | ~4.1GB 1-bit | 262K | Apache 2.0 | 需自查 | 需代理 | ollama run hf.co/prism-ml/Bonsai-27B-gguf / llama-server -hf prism-ml/Bonsai-27B-gguf -ngl 99 --jinja |
| Z-Image-Engineer-V6 (BennyDaBall) | 4B | ~2.4GB 4-bit | — | Apache-2.0 | 可商用 | 需代理 | AutoModelForCausalLM.from_pretrained('BennyDaBall/Z-Image-Engineer-V6') / llama-server -hf BennyDaBall/Z-Image-Engineer-V6-GGUF |
| Minimalism (salakash) | 0.5B | ~0.3GB 4-bit | 32k | Apache-2.0 | 可商用 | 需代理 | mlx_lm.server --model mlx-community/Qwen2.5-Coder-0.5B-Instruct-4bit --adapter-path salakash/Minimalism --port 8080 / python -c "from peft import PeftModel; PeftModel.from_pretrained('Qwen/Qwen2.5-Coder-0.5B-Instruct', 'salakash/Minimalism')" |
| Qwen3.6-35B-A3B (Qwen) | 35B (3B 激活) | ~7.7GB ternary | — | Apache-2.0 | 需自查 | 需代理 | pip install 'turboquant-mlx-full>=0.12.3' && python -m turboquant_mlx.generate --model manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64 |
| Qwen3.6-27b-Fable5 (hotdogs) | 27B (基座) + LoRA | ~16GB 4-bit | — | — | 需自查 | 需代理 | vllm serve Qwen/Qwen3.6-27B --enable-lora --lora-modules fable=hotdogs/qwen3.6-27b-fable5-lora |
| aro-coder-4bit (ARO-Lang) | 30B (3B active) | ~18GB 4-bit | — | MIT | 可商用 | 需代理 | mlx_lm.load('ARO-Lang/aro-coder-4bit') / python -m mlx_lm.server --model ARO-Lang/aro-coder-4bit --port 8080 / ollama run aro-coder |
| GPT-OSS-20B (OpenAI) | 20B (MoE) | ~7.1GB 2-bit | — | Apache 2.0 | 需自查 | 需代理 | mlx_lm.generate --model majentik/gpt-oss-20b-TurboQuant-MLX-2bit --prompt '你的提示' |
| Supra-Router-51M (SupraLabs) | 51M | ~0.1GB 4-bit | 3840 | — | 需自查 | 需代理 | AutoModelForCausalLM.from_pretrained('SupraLabs/Supra-Router-51M') |
| Delphi-25B (Marin Community) | 25B | ~15GB 4-bit | 4k | apache-2.0 | 可商用 | 需代理 | transformers.from_pretrained('marin-community/delphi-1e23-25Bparams-628Btokens') |
| Quasar-Preview (silx-ai) | 18B (2B active) | ~9.9GB 4-bit | 5M (实验性配置) | MIT | 可商用 | 需代理 | python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('silx-ai/Quasar-Preview', trust_remote_code=True)" |
| HelixLM-40M-ep1 (david-thrower) | 40.1M | ~0.1GB 4-bit | 1024 | Modified Apache 2.0 | 需自查 | 需代理 | transformers pipeline with trust_remote_code=True / transformers from_pretrained(trust_remote_code=True) |
| Qwen3.6-35B-A3B (andreaborio) | 35B (3B 激活) | ~21GB 4-bit | — | apache-2.0 | 需自查 | 需代理 | ollama run hf.co/andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF / llama-server -hf andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF |
| Nemotron-Labs-Diffusion-14B (NVIDIA) | 14B | ~8.1GB 4-bit | — | NVIDIA Nemotron Open Model License | — | 需代理 | transformers from_pretrained() |
| NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA) | 75B (9.3B active) | ~49GB 8-bit | 1M | OpenMDW-1.1 | 需自查 | 需代理 | vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer |
| Bonsai-27B-mlx-1bit (Prism ML) | 27B | ~4.1GB 1-bit | 262K | apache-2.0 | 需自查 | 需代理 | mlx_lm.generate --model prism-ml/Bonsai-27B-mlx-1bit |
| Ternary-Bonsai-27B (Prism ML) | 27B | ~7.3GB ternary | 262K | Apache-2.0 | 需自查 | 需代理 | ollama run hf.co/prism-ml/Ternary-Bonsai-27B-gguf / llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf -ngl 99 |
| FastContext-1.0-4B-SFT (Microsoft) | 4B | ~2.4GB 4-bit | 262k | MIT | 可商用 | 需代理 | python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-SFT --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8 / AutoModelForCausalLM.from_pretrained('microsoft/FastContext-1.0-4B-SFT') |
| Ternary Bonsai 27B (prism-ml) | 27B | ~7.3GB ternary | 262k | apache-2.0 | 需自查 | 需代理 | llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf |
| Hy3-GGUF (腾讯) | — | — | 65536 | apache-2.0 | 需自查 | 魔搭可用 | ollama run hf.co/AngelSlim/Hy3-GGUF |
| VibeThinker-3B (WeiboAI) | 3B | ~1.9GB 4-bit | 64k | MIT | 可商用 | 魔搭可用 | vllm serve WeiboAI/VibeThinker-3B / AutoModelForCausalLM.from_pretrained('WeiboAI/VibeThinker-3B') |
| Nemotron-Labs-Audex-30B-A3B (NVIDIA) | 30B MoE (3B激活) | ~18GB 4-bit | 1M | NVIDIA Oneway Noncommercial License | 需自查 | 需代理 | python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-Audex-30B-A3B', trust_remote_code=True)" |
Common pitfalls
- 长上下文提示处理延迟突出,38K token 的 prompt 处理耗时 17.3 秒 — aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 对 prompt 格式异常敏感,会在与上下文冲突时强行将示例塞入回答 — aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 嵌套 JSON 输出不可靠,改用 XML 格式后表现正常 — aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 部分用户在 OpenCode 中遇到重复循环和空字符串函数调用问题,后自行归因于参数配置 — aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- Q6_K 量化版本在编码规划和组织逻辑上被社区报告优于 Q8_0,大不一定更好 — aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- BenchLM 综合评分仅 51.47/100,排名 #104/200 — aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 物理合理性图像生成弱于 Claude Opus 4.7(flamingo 骑独轮车测试中 Opus 更接近物理真实) — aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 需要耐心调参,非开箱即用的完美体验 — aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 图像生成本身复杂度高,对显存/内存需求较大 — BennyDaBall/Z-Image-Engineer-V6
- 社区对其能否替代现有主流模型尚无定论 — BennyDaBall/Z-Image-Engineer-V6
- 22K token 上下文下首 token 延迟约 115 秒,长上下文下实际可用性差 — CohereLabs/North-Mini-Code-1.0
- 综合 benchmark 得分(28)明显弱于 Qwen 3.6 35B(43),非编码任务表现一般 — CohereLabs/North-Mini-Code-1.0
- MTP 在 max-token 设置较低时,代码质量可能不如搭配 Qwen3.5-0.8B 做 draft model 的方案 — bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 在部分基准测试上仍落后于 Qwen3.5 27B 和 Gemma 4 31B,并非全面领先 — bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- SVG/图像生成质量不稳定,社区测试中与 GLM 5.1 等模型对比有明显差距 — bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 日常快速响应场景下比 35B-A3B MoE 慢,不适合追求即时速度的轻量任务 — bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- FP8 精度下消费级 GPU 吞吐仍受限,缺乏 NVFP4 支持时理论速度约 38 tok/s — bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 开启 thinking/reasoning 模式会增加延迟和 token 消耗 — bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
- 在已有代码库上修改/协作时效果急剧下降,社区反馈'失败得很惨' — deepreinforce-ai/Ornith-1.0-35B
- 实际编码任务中表现不佳,仅发现几乎所有模型都能发现的bug — deepreinforce-ai/Ornith-1.0-9B
- 无工具环境的对话中幻觉严重 — deepreinforce-ai/Ornith-1.0-9B
- 会幻觉工具调用及其输出 — deepreinforce-ai/Ornith-1.0-9B
- 上下文窗口增大后出现循环和错误操作,可能与采样参数设置有关 — empero-ai/Qwythos-9B-Claude-Mythos-5-1M
- 非通用聊天模型,是推理模型,需严格按模型卡指定采样参数使用 — empero-ai/Qwythos-9B-Claude-Mythos-5-1M
- v1 在 gpqa_diamond 上比基座 Qwen3.5-9B 低 5 分,v2 声称与 v1 持平而非提升,基准测试退化的问题可能仍在 — empero-ai/Qwythos-9B-v2
- 该模型基于从闭源 Claude 模型蒸馏的合成数据训练,存在版权/合规争议 — empero-ai/Qwythos-9B-v2
- 当前仍处于早期/中间检查点阶段,非最终稳定版本,生产使用需谨慎 — FrontiersMind/Nandi-Mini-600M-Early-Checkpoint
- 对复杂问题倾向于拒绝回答,实际可用范围受限 — GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking
- abliteration 被描述为「粗糙的概念验证实现」,并非成熟方案 — huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 有社区用户反馈 huihui 的去审查模型整体上「失去的比得到的多」 — huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- Gemma 4 12B 缺乏专用视觉编码器,视觉理解能力受限 — huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 模型卡片明确声明不适合生产环境或面向公众的应用 — huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 内容过滤极其有限,可能生成不适宜的输出 — huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- FP16 全精度推理需约 26GB 显存,多数消费级 GPU 无法承载 — huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 使用者需自行承担法律和伦理风险 — huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 有社区用户评价 abliterated 版本「pretty useless」,实际可用性受质疑 — huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 长上下文精确检索落后 Opus 4.8 约 3.4-3.6 分 — huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 原版审查极严,必须依赖 abliteration 才能解锁无审查能力 — huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- Sonnet 5 在 50K 上下文下推理速度更快,检索质量则参差不齐 — huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 并非 Claude 替代品,声称能平替 Claude 的说法被社区认为夸大 — hotdogs/qwen3.6-27b-fable5-lora
- 将 opencode 调通为 CLI agent 需要大量调参,远不如 Claude Code 开箱即用 — hotdogs/qwen3.6-27b-fable5-lora
- 在部分基准上 Qwen3.6 反而不如 Qwen3.5 和 Gemma 4 — hotdogs/qwen3.6-27b-fable5-lora
- 因内置思考与规划机制,响应速度比 35B-A3B 慢 — hotdogs/qwen3.6-27b-fable5-lora
- hotdogs LoRA 仓库要求同意联系方式共享才能访问模型文件 — hotdogs/qwen3.6-27b-fable5-lora
- 首批样本生成存在部分错误,官方已对两个失败模式进行复测 — huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
- 训练数据来自 Claude 会话日志合成的 CoT,非原生人类标注数据 — huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
- 有用户报告模型在测试中不到20分钟即陷入循环,输出重复内容 — Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
- 社区独立评测数据有限,缺乏大规模验证 — Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
- 编码以外的通用任务表现弱于 Qwen 3.5 4B — JetBrains/Mellum2-12B-A2.5B-Thinking
- 至少需要 24GB 统一内存,推荐 32GB 以上,部署门槛较高 — Jiunsong/supergemma4-26b-uncensored-gguf-v2
- 暂无 2B-4B 小参数版本支持工具调用,社区有此类需求 — Jiunsong/supergemma4-26b-uncensored-gguf-v2
- 工具调用功能在 v2 之前存在问题(v2 已修复) — Jiunsong/supergemma4-26b-uncensored-gguf-v2
- 非编码类通用能力弱于 Qwen 3.5 4B — JetBrains/Mellum2-12B-A2.5B-Instruct
- 部分任务仅获中等结果 — JetBrains/Mellum2-12B-A2.5B-Instruct
- 当前状态不佳,业务挣扎导致技术侧妥协 — kai-os/Grug-12B
- 几乎无人为平台开发应用,生态萎缩 — kai-os/Grug-12B
- 安全方面存在明显短板 — kai-os/Grug-12B
- 复杂推理能力不足,处理编程重构等任务会出错 — LiquidAI/LFM2.5-1.2B-JP-202606
- 不适合编程和知识密集型任务 — LiquidAI/LFM2.5-1.2B-JP-202606
- 工具调用(如自动判断是否需要网页搜索)不可靠 — LiquidAI/LFM2.5-1.2B-JP-202606
- 当前原生行为/能力尚简单,需自行微调才能适配具体生产任务 — LiquidAI/LFM2.5-230M
- 通用对话与复杂推理能力有限,不适合直接作为日常聊天模型使用 — LiquidAI/LFM2.5-230M
- 编程能力较弱,在社区实测中多数编程任务未通过(4/5 coding tests failed) — LiquidAI/LFM2.5-8B-A1B
- 对量化精度和推理参数极其敏感,参数不对时表现明显下降 — manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- MoE 的专家激活机制并不像社区预期那样能「解锁」更多模型能力 — manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- Power Ranking 编码任务仅比上代 Qwen 3.5 同尺寸略好(11/98 vs 10/98),提升有限 — manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 在编码任务上被 Qwen 3.5 27B 密集模型大幅超越(26/98 vs 11/98),不属同一级别 — manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 知识和技能类基准表现明显弱于其他维度,存在「刷榜」嫌疑 — manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- SVG 生成在物理合理性/遵循约束方面不如 Claude Opus 4.7 — manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 表现不稳定,属于「碰对了参数就很好用」的类型 — manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 证据仅涉及缩放定律预测精度,无社区讨论涉及模型实际生成质量、推理吞吐或日常使用体验 — marin-community/delphi-1e23-25Bparams-628Btokens
- 当前讨论集中在训练效率与损失预测,缺乏下游任务评估(benchmark 表现、人类偏好等)的证据 — marin-community/delphi-1e23-25Bparams-628Btokens
- 社区讨论度很低,Reddit 帖子直言"Why is NO one talking about" — microsoft/FastContext-1.0-4B-RL
- 作为子 agent 而非独立模型,需要配合主 coding agent 使用,不能单独完成编码任务 — microsoft/FastContext-1.0-4B-RL
- 与现有 agent 工作流的实际集成仍处于早期阶段,社区自行添加支持 — microsoft/FastContext-1.0-4B-RL
- 官方仅提及"边际开销很小",但缺乏子 agent 本身的详细性能基准 — microsoft/FastContext-1.0-4B-RL
- 端到端解决率提升仅最高5.5%,并非颠覆性改进 — microsoft/FastContext-1.0-4B-SFT
- 仅支持只读工具(READ/GLOB/GREP),不能写代码或修改文件 — microsoft/FastContext-1.0-4B-SFT
- FP16推理仍需约8.8GB VRAM,低配GPU需量化才能运行 — microsoft/FastContext-1.0-4B-SFT
- 必须配合主编码代理使用,不能独立完成编码任务 — microsoft/FastContext-1.0-4B-SFT
- 目前仅验证在Mini-SWE-Agent框架下的效果,其他代理框架兼容性未知 — microsoft/FastContext-1.0-4B-SFT
- RL版本(4B-RL)也已发布但社区讨论极少,实际效果待验证 — microsoft/FastContext-1.0-4B-SFT
- 模型族跨度4B-30B,但社区关注几乎全集中在4B版本,大版本缺乏实测 — microsoft/FastContext-1.0-4B-SFT
- MLX 社区不如 GGUF 活跃,模板修复和量化改进滞后 — mlx-community/Llama-2-7b-chat-mlx
- 实际使用可能出现崩溃、prompt 缓存缺失、内存压力问题 — mlx-community/Llama-2-7b-chat-mlx
- 宣传的 token 速度在实际场景中可能被夸大 — mlx-community/Llama-2-7b-chat-mlx
- mlx-community 模型集合维护不足,部分模型系列只有少量转换 — mlx-community/Llama-2-7b-chat-mlx
- 权重从 bfloat16 转为 float16 存储,numpy 兼容性受限 — mlx-community/Llama-2-7b-chat-mlx
- 在相同硬件上吞吐量低于 gemma-2-9b,尽管参数量更少 — mlx-community/Meta-Llama-3-8B-Instruct-4bit
- MMLU Pro 评测结果存在一定的随机波动,单次跑分需谨慎解读 — mlx-community/Meta-Llama-3-8B-Instruct-4bit
- 风格偏机械/生硬,不适合创意写作和对话场景 — mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 官方宣称的4倍速提升存在夸大,实际提速明显但未达宣称水平 — mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 合成数据训练可能影响回答质量 — mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 部分基准测试不及GLM 4.7 Flash — mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 能力评分仅 27.0%,官方定位为玩具代理和提示词重写器,不适合复杂推理或生产级应用 — mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- omlx v0.2.20 升级后曾出现 Internal server error,社区工具链稳定性有待观察 — mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- 0.8B 参数规模天然受限,仅适合极轻量场景 — mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- Capability Score 仅 48%,远低于同系列 4B(81.5%)和 9B(90%),能力上限有限 — mlx-community/Qwen3.5-2B-OptiQ-4bit
- MLX 模型在 LM Studio 中 prompt caching 目前存在已知 bug — mlx-community/Qwen3.5-2B-OptiQ-4bit
- 部分 MLX 版 Qwen3.5 存在崩溃和无视设置强行注入 thinking 标签的社区反馈 — mlx-community/Qwen3.5-2B-OptiQ-4bit
- 在需要独立决策时表现糟糕,3B 激活参数的限制明显暴露 — mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 硬核编程任务上表现崩溃,在 70 个真实仓库测试中不合格 — mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 整体能力明确低于 Claude Sonnet,复杂任务差距明显 — mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 执行过程中倾向于中途偏离用户给出的详细指令 — mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 对量化精度和推理参数非常敏感,需要高量化精度和正确的参数设置 — mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 在某些对比测试中处理任务质量不如对比模型 — mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 速度虽快,但任务完成质量下降(以质量换速度) — mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 相比 GGUF 4-bit 同量化,生成推理 token 量约翻倍,较为冗长 — mlx-community/Qwen3.5-9B-OptiQ-4bit
- MLX 多轮对话性能明显低于单轮 — mlx-community/Qwen3.5-9B-OptiQ-4bit
- 推理能力基准测试仅 60%,相对薄弱 — mlx-community/Qwen3.5-9B-OptiQ-4bit
- 编程能力基准测试 70%,表现中等 — mlx-community/Qwen3.5-9B-OptiQ-4bit
- 在无工具对话中容易产生幻觉 — nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 实际代码修复表现可能不如基准测试的分数 — nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- MLX 转换需要额外 monkeypatch 处理未融合的 MoE experts — nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 事实性错误率远高于自回归版本,同一任务实测错误多出约 6 倍 — nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 话题越冷门/长尾,生成质量下降越明显(热门话题 4 处错误 vs 冷门话题 12 处错误) — nvidia/diffusiongemma-26B-A4B-it-NVFP4
- Google 官方建议当质量优先时仍应使用 Gemma 4 自回归版本 — nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 本地模型能力远不及商业 API,社区提醒需将预期降至十分之一 — nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 当前阶段更适合作为快速初稿生成器,需搭配精修模型做二次修正 — nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 扩散架构在低并发单用户场景下优势最明显,高并发下相对优势缩小 — nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 社区讨论热度和实际使用量远低于 Qwen 和 Gemma 系列 — nvidia/Nemotron-Labs-Audex-2B
- 有用户反映 Nemotron 模型在实际使用中始终不如其基于的 Qwen 模型 — nvidia/Nemotron-Labs-Audex-2B
- 社区实际使用案例稀少,有用户直接质疑是否有人真正在用 — nvidia/Nemotron-Labs-Diffusion-14B
- 部分讨论将其与图像生成模型(eDiffi/DALL-E)混淆,存在认知偏差 — nvidia/Nemotron-Labs-Diffusion-14B
- 社区实测反馈极少,除个别用户外缺乏广泛真实使用验证 — nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16
- Arena-Hard-V2 (-4.2) 和 SWE-Bench (-2.6) 是压缩的主要能力代价 — nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
- 需要 PIECEWISE CUDA graphs 等精细配置才能达到高 decode 速度,FULL graphs 无法在 24GB 卡上运行 — nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
- Prefill 密集型场景下吞吐提升仅 1.60x,收益明显低于 decode 密集型场景 — nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
- NVFP4 相比 FP8 的质量损失尚未被充分验证 — nvidia/Qwen3.6-27B-NVFP4
- 需要约 40 GB VRAM,最低需 L40S 48GB 或双卡方案 — nvidia/Qwen3.6-27B-NVFP4
- 双 3090 方案占用空间大、发热高 — nvidia/Qwen3.6-27B-NVFP4
- DGX Spark 上 35B MoE NVFP4 加推测解码实际仅约 50 tok/s,远低于宣传的 110 tok/s — nvidia/Qwen3.6-27B-NVFP4
- NVFP4 在 Blackwell (SM120) 上并不比 FP8 更快 — nvidia/Qwen3.6-27B-NVFP4
- 作为 CLI 编码代理配置(opencode)需要额外调校,不如 Claude Code 开箱即用 — nvidia/Qwen3.6-27B-NVFP4
- NVIDIA 版本的 NVFP4 部分不使用 NVFP4 激活,仅做权重量化 — nvidia/Qwen3.6-27B-NVFP4
- vLLM 在 16GB 消费卡上内存上限为 16K,长上下文受限 — nvidia/Qwen3.6-27B-NVFP4
- NVFP4 量化存在质量损失,可能出现失控生成和退化循环 — nvidia/Qwen3.6-35B-A3B-NVFP4
- 在架构写作等非编程任务上,同系 27B 稠密模型可能更优 — nvidia/Qwen3.6-35B-A3B-NVFP4
- DGX Spark 上更新 vLLM 会遇到依赖冲突,部署有坑 — nvidia/Qwen3.6-35B-A3B-NVFP4
- 稠密模型(27B)在某些任务上质量更好,只是速度不及 MoE — nvidia/Qwen3.6-35B-A3B-NVFP4
- NVFP4 格式依赖 NVIDIA 硬件和 vLLM,通用性受限 — nvidia/Qwen3.6-35B-A3B-NVFP4
- GGUF 格式转换存在问题,unsloth 和 bartowski 已确认正在调查,llama.cpp 加载报错 — OBLITERATUS/Gemma-4-12B-OBLITERATED
- 关闭 thinking 模式后可能不需要 abliteration 即可绕过拒绝 — OBLITERATUS/Gemma-4-12B-OBLITERATED
- 社区反馈 safetensors 格式变体尚未提供 — openbmb/BitCPM-CANN-8B
- 模型卡缺少 base_model 元数据标注 — openbmb/BitCPM-CANN-8B
- 基准测试表现可能属于典型 hype,实际使用中未必复现 — pat-jj/harness-1
- 在测试的搜索模型中仍落后于 Opus-4.6 — pat-jj/harness-1
- 指令跟随和对细节的把控弱,常忽略 system prompt 中的关键要求,不如 Gemma 4 12B QAT 和 Qwen 3.6 35B A3B 可靠 — prism-ml/Bonsai-27B-gguf
- 不适合复杂编程或多步自主工作流,输出常被截断且不返回完整结果,官方也声明 agentic coding 不是当前版本的重点目标 — prism-ml/Bonsai-27B-gguf
- KV 缓存占用仍偏高,全精度下仅约 100k 上下文,Q8_0 下约 150k,限制了长上下文场景 — prism-ml/Bonsai-27B-gguf
- dspark 投机解码与当前 PrismML 的 llama.cpp 分支存在兼容问题,预测长度被错误绑定到主模型上下文,导致 CUDA 内存分配暴涨 — prism-ml/Bonsai-27B-gguf
- 在同显存条件下,实际表现不如 Qwen 3.6 27B Q2_K_XL 和 Gemma 4 12B QAT,预填充和解码速度也未达预期 — prism-ml/Bonsai-27B-gguf
- 训练时在高难度类别上存在质量差距,二元版保留 89.5%、三元版保留 94.6% 的全精度基准平均水平 — prism-ml/Bonsai-27B-gguf
- 需使用 llama.cpp 定制分支,该分支已落后上游版本 — prism-ml/Bonsai-27B-mlx-1bit
- 语言能力测试中不及 Qwen3.5-2B 4-bit 量化版 — prism-ml/Bonsai-27B-mlx-1bit
- 愚人节发布导致初期可信度受影响 — prism-ml/Bonsai-27B-mlx-1bit
- 实际问答质量远不如 Gemma 4-E2B,被社区用户评价为「远比 Gemma 4 笨」 — prism-ml/Bonsai-8B-mlx-1bit
- 三元量化版本表现比 1-bit 版本更差,且体积反而比 Gemma 4 Q4_K_M 更大 — prism-ml/Bonsai-8B-mlx-1bit
- 与 Gemma 4 Q4_K_M 相比体积仅小约 29%,优势有限 — prism-ml/Bonsai-8B-mlx-1bit
- GGUF 版本加载失败,llama.cpp 兼容性存在问题 — prism-ml/Ternary-Bonsai-27B-gguf
- 指令遵循能力弱,经常忽略细节要求,不按预设流程激活技能(约 10 次中仅 1 次自动执行) — prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 实际工作流体验不如同尺寸 Qwen 3.6 27B Q2_K_XL 量化版,也不如 Gemma 4 12B QAT — prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 三元版约 7.2GB 超出手机每应用 6GB iOS 内存限制,无法在手机上部署 — prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 长程多文件 agentic coding 工作流暂不支持,官方明确标注为当前版本不擅长 — prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 视觉能力显著弱于同尺寸竞品 — prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 实际智能远弱于 Gemma-4-E2B 等常规 2B 模型 — prism-ml/Ternary-Bonsai-8B-mlx-2bit
- Ternary(1.58-bit)版本回答甚至比 1-bit 版本更差 — prism-ml/Ternary-Bonsai-8B-mlx-2bit
- 在 benchmark 上被 Ministral 3B 略微超过,8B 体量未转化为对应能力 — prism-ml/Ternary-Bonsai-8B-mlx-2bit
- 不适合需要强推理能力的实际任务 — prism-ml/Ternary-Bonsai-8B-mlx-2bit
- 定位模糊,官方未清晰说明其与通用聊天/指令模型的区别,导致社区困惑 — Qwen/Qwen-AgentWorld-35B-A3B
- 从专家级难度起频繁输出空白,复杂任务上崩溃 — Qwen/Qwen-AgentWorld-35B-A3B
- 不适合作为代码生成器使用 — Qwen/Qwen-AgentWorld-35B-A3B
- 非标准聊天/指令模型,不能当作通用对话助手 — Qwen/Qwen-AgentWorld-35B-A3B
- 推理过程较长 — Qwen/Qwen-AgentWorld-35B-A3B
- 社区成员自身指出 Reddit 不适合作为新闻来源 — salakash/Minimalism
- 极简主义有时被指出隐含经济阶层门槛 — salakash/Minimalism
- 非标准模型架构:使用自定义 hrm_text 模型类,非 Llama/Qwen 等主流 decoder,生态兼容性受限 — sapientinc/HRM-Text-1B
- 非最终版模型,仅为预训练基础模型,不追求 SOTA — silx-ai/Quasar-Preview
- 基于 Qwen 2.5 的 3B 模型声称对标前沿模型,benchmark 宣称缺乏独立复现和社区背书 — squ11z1/Mythos-nano
- 社区关注度极低,缺乏实际使用反馈和第三方评测 — squ11z1/Mythos-nano
- 仍处于早期预训练阶段,仅为checkpoint而非成品模型 — Smilyai-labs/Nova-1-Standard-1.3B-Preview
- 合规性与行为表现评级为F- — Smilyai-labs/Nova-1-Standard-1.3B-Preview
- 无特定功能特性 — Smilyai-labs/Nova-1-Standard-1.3B-Preview
- 对自定义工具调用格式(如 <call>...</call>)遵循能力差 — w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 部分 prompt 字符串会破坏输出逻辑 — w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 在多语言交流中逻辑有问题,英语场景也偶有出现 — w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 事实性任务中存在明显幻觉 — w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- benchmark 高分与实际使用可靠性之间存在落差 — w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 不能替代 Opus 等大模型用于专业日常工作 — w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 纯编码能力上 Gemma-4-12B 可能略优 — w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 无法可靠用于代码工程与 agentic coding 场景 — WeiboAI/VibeThinker-3B
- 工具调用不可靠:反复无法正确指定 grep 的 pattern 参数,调用被拒绝 — wepiqx/gemma-4-12B-it-LWQ6-GGUF
- Qwen3.5-9B 在 8 项 benchmark 中赢了 5 项,尽管参数量更小 — wepiqx/gemma-4-12B-it-LWQ6-GGUF
- Q8_0 量化生成速度仅 25.2 t/s,远低于 Q4_K_M 的 72.3 t/s — wepiqx/gemma-4-12B-it-LWQ6-GGUF
- MTP/assistant model 的 GGUF 量化尚未就绪,llama.cpp 支持仍在开发中 — wepiqx/gemma-4-12B-it-LWQ6-GGUF
- 官方模型存在拒答问题,需使用 heretic 等去审查版本 — wepiqx/gemma-4-12B-it-LWQ6-GGUF
- 受显存限制时需关闭 thinking mode 才能运行 12B 模型 — wepiqx/gemma-4-12B-it-LWQ6-GGUF
- Q5 量化下仍可能出现大量语法错误(一个文件需 23 次编辑) — wepiqx/gemma-4-12B-it-LWQ6-GGUF
- MoE 变体(26B-A4B)运行速度显著慢于 Qwen 3.5 同类模型 — wepiqx/gemma-4-12B-it-LWQ6-GGUF
- 上下文超过约 65k 时出现 OOM — Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- MTP 模式下代码质量可能不如使用独立 draft model (Qwen3.5-0.8B) — Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- SVG 生成效果不佳,与 GLM 5.1 相比明显偏弱 — Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 数学能力弱于 35B-A3B (AIME 87.8 vs 92.7) — Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- MTPLX v0.1.0-preview 仅支持 Qwen3-Next-MTP,兼容范围有限 — Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 即使是 4-bit 量化仍需约 20GB 内存,对 16GB 设备仍有门槛 — Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 量化低于 Q4 时模型性能严重退化 — yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 实际 agentic 工具调用场景中简单工具调用仍不可靠 — yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 同尺寸竞品 Qwen 3.5 9B 在 5/8 项基准测试中胜出,且参数量更小 — yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- encoder-free 架构较新,社区适配和调试存在一定门槛 — yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 该微调为社区实验性产物,非官方发布 — yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- 定性/创意类任务的实际表现可能不同于基准分数 — yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
- OpenCode 下工具调用极差,Q8 量化连一次工具调用都无法完成,只回复"Okay."(evidence 4、7) — yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 工具调用时反复无法正确指定参数(如 grep 的 pattern),调用被拒绝(evidence 7) — yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 有用户明确表示不会用它做编程调试,倾向 Gemma-4-31B 或 Qwen3.6-27B(evidence 1) — yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 该 Fable-5 微调被质疑为噱头,认为 12B 模型无法承载更大模型的推理能力(evidence 2) — yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 官方 8Q 模型存在拒答问题,需 heretic 版本才能正常生成(evidence 6) — yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- Q8 量化生成速度骤降至 25.2 t/s,相比 Q4 的 72.3 t/s 大幅下降(evidence 5) — yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 尚无 assistant 模型的 GGUF 量化版本(evidence 5) — yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- MTP(多 token 预测)支持仍在开发中(evidence 5) — yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- About one-third of the cards in the table have empty (unknown) vram fields, which does not mean they can fit into 16GB; actual measurement in a specific inference framework is required—by default we do not exclude unknowns to avoid thinning the table, see docs/research/2026-07-guide-inventory.md §2 for data scope.
- Some 30B+ models kept in the table (e.g., deepreinforce-ai/Ornith-1.0-35B, Qwen/Qwen-AgentWorld-35B-A3B, CohereLabs/North-Mini-Code-1.0) have native Q4 estimates already exceeding 16GB; although there are corresponding GGUF quant forms in the library, the specific VRAM numbers for those quant forms are not recorded—please check the quant notes in the respective repository before downloading.
FAQ
- Does a Mac with 16GB unified memory count?
- Yes, but stick to MLX/GGUF forms. The mlx-community series in the table (e.g., mlx-community/Meta-Llama-3-8B-Instruct-4bit ~1.1GB, mlx-community/Qwen3.5-2B-OptiQ-4bit ~0.3GB) are quant forms optimized for Apple Silicon unified memory; 16GB unified memory is shared with the system and other apps, and the quantized VRAM number is only the model weights themselves—we recommend leaving headroom rather than hitting the exact limit.
- Can cards with unknown vram be excluded outright?
- Not recommended. About one-third of the rows have empty vram; this is a data gap, not a signal of 'unusable'—most are cards that have been released but haven't had VRAM estimates backfilled. Whether they actually fit in 16GB should be tested in llama.cpp/vLLM according to the quant level.
- Are the excluded large models completely impossible to run locally?
- The 11 models excluded on this page were excluded because 'Q4 estimates clearly exceed 16GB and the library has no lower-bit forms'. For example, zai-org/GLM-5.2 (753B, the card itself notes cloud_only:true and not_for explicitly states 'local consumer hardware deployment') essentially has no 16GB solution. However, some 30B+ models kept in the table (like Ornith-1.0-35B) have native estimates over 16GB but already have GGUF versions—just that the specific quantized VRAM numbers are not recorded; if you want to try, check the quant notes in that repository yourself.