指南 / 文本生成模型
文本生成模型
共 71 个 · 数据更新于 2026-07-21
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
16GB 显存/内存能跑什么本地大模型(2026-07)
先按「Q4 估算明显超 16GB 且库内没有更低位形态」筛掉 11 个不现实的选项,再按用途挑几个能直接上手的。
- 编码代理首选 Ornith-1.0-9B (DeepReinforce)
- 长上下文仓库探索(配合主 agent 使用) FastContext-1.0-4B-RL (Microsoft)
- 端侧通用助理/工具调用 LFM2.5-8B-A1B (LiquidAI)
- 通用对话/编程速度与质量折中 Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
- 轻量数学/代码推理 VibeThinker-3B (WeiboAI)
| 模型 | 参数量 | 显存门槛 | 上下文 | 许可证 | 商用 | 语言 | 国内可达 | 部署 |
|---|---|---|---|---|---|---|---|---|
| GPT-OSS-20B (OpenAI) 量化自 gpt-oss-20b | 20B (MoE) | Q4 ~14GB / FP16 ~50GB | — | Apache 2.0 | 需自查 | — | 需代理 | mlx_lm.generate --model majentik/gpt-oss-20b-TurboQuant-MLX-2bit --prompt '你的提示' |
| gear-manual-qwen3-4b (Raindog) 量化自 Qwen3-4B | 4B | Q4 ~2.6GB / FP16 ~9.6GB | — | cc-by-nc-4.0 | 需自查 | — | 需代理 | mlx_lm.generate --model zak-raindog/gear-manual-qwen3-4b --prompt "如何使用EP-133?" |
| Qwen3.6-35B-A3B (andreaborio) 量化自 Qwen3.6-35B-A3B | 35B (3B 激活) | Q4 ~23GB / FP16 ~84GB | — | apache-2.0 | 需自查 | — | 需代理 | ollama run hf.co/andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF 等 2 种 |
| Bonsai-27B-mlx-1bit (Prism ML) 量化自 Qwen3.6-27B | 27B | Q4 ~18GB / FP16 ~65GB | 262K | apache-2.0 | 需自查 | — | 需代理 | mlx_lm.generate --model prism-ml/Bonsai-27B-mlx-1bit |
| Dolphin3-Cyber-8B (RavichandranJ) 量化自 Dolphin3.0-Llama3.1-8B-abliterated | 8B | Q4 ~5.3GB / FP16 ~19GB | 2k | llama3.1 | 需自查 | — | 需代理 | ollama run hf.co/RavichandranJ/Dolphin3-Cyber-8B-GGUF |
| Hy3-GGUF (腾讯) 量化自 Hy3 | — | — | 65536 | apache-2.0 | 需自查 | — | 魔搭可用 | ollama run hf.co/AngelSlim/Hy3-GGUF |
| MiniCPM5-1B-Thinking (OpenBMB) 微调自 MiniCPM5-1B 原生 · GGUF | 1B | Q4 ~0.7GB / FP16 ~2.6GB | 128k | Apache-2.0 | 需自查 | — | 需代理 | ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF |
| Bonsai-27B (Prism ML) 量化自 Qwen3.6-27B | 27B | Q4 ~18GB / FP16 ~65GB | 262K | Apache 2.0 | 需自查 | — | 需代理 | ollama run hf.co/prism-ml/Bonsai-27B-gguf 等 2 种 |
| Nemotron-3-Nano-30B-A3B (NVIDIA) | 30B (3B 激活) | Q4 ~20GB / FP16 ~72GB | — | nvidia-open-model-license | 需自查 | — | 需代理 | mlx_lm.generate --model mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit |
| Qwen3.5-35B-A3B (Qwen) | 35B (3B 激活) | Q4 ~23GB / FP16 ~84GB | 128k | apache-2.0 | 需自查 | — | 需代理 | mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200 |
| Ternary Bonsai 27B (prism-ml) | 27B | Q4 ~18GB / FP16 ~65GB | 262k | apache-2.0 | 需自查 | — | 需代理 | llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf |
| Ternary-Bonsai-27B (Prism ML) 量化自 Qwen3.6-27B | 27B | Q4 ~18GB / FP16 ~65GB | 262K | Apache-2.0 | 需自查 | — | 需代理 | ollama run hf.co/prism-ml/Ternary-Bonsai-27B-gguf 等 2 种 |
| Qwen3.6-35B-A3B-VQ (aquaman164) 量化自 Qwen3.6-35B-A3B | 35B (3B激活) | Q4 ~23GB / FP16 ~84GB | 128k | Apache-2.0 | 需自查 | — | 需代理 | huggingface-cli download aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw --local-dir qwen-vq && python qwen-vq/code/vq_serve.py --model qwen-vq |
| Ornith-1.0-35B-MLX (deepreinforce-ai) 量化自 Ornith-1.0-35B | 35B (3B 活跃) | Q4 ~23GB / FP16 ~83GB | — | — | 需自查 | — | 需代理 | uvx --from git+https://github.com/nathansutton/mlxcc chad |
| Qwen3.5-9B-OptiQ-4bit (mlx-community) 量化自 Qwen3.5-9B | 9B | Q4 ~5.9GB / FP16 ~21GB | 128k | apache-2.0 | 需自查 | — | 需代理 | mlx_lm.generate --model mlx-community/Qwen3.5-9B-OptiQ-4bit |
| Qwythos-9B-v2 (Empero AI) 微调自 Qwythos-9B-Claude-Mythos-5-1M 原生 · GGUF | 9B | Q4 ~6.4GB / FP16 ~23GB | 1048k | Apache-2.0 | 需自查 | — | 需代理 | vllm serve empero-ai/Qwythos-9B-v2 --trust-remote-code |
| Nemotron-Labs-Audex-2B (NVIDIA) | 2B | Q4 ~1.3GB / FP16 ~4.8GB | 128k | NVIDIA OneWay Noncommercial License | 需自查 | — | 需代理 | python -c "from transformers import AutoModel; AutoModel.from_pretrained('nvidia/Nemotron-Labs-Audex-2B', trust_remote_code=True)" |
| Nemotron-Labs-Audex-30B-A3B (NVIDIA) | 30B MoE (3B激活) | Q4 ~20GB / FP16 ~72GB | 1M | NVIDIA Oneway Noncommercial License | 需自查 | — | 需代理 | python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-Audex-30B-A3B', trust_remote_code=True)" |
| NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA) 量化自 NVIDIA-Nemotron-3-Super-120B-A12B-BF16 | 75B (9.3B active) | Q4 ~29GB / FP16 ~107GB | 1M | OpenMDW-1.1 | 需自查 | — | 需代理 | vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer |
| Supra-Router-51M (SupraLabs) 微调自 Supra-1.5-50M-Base-exp | 51M | Q4 ~0GB / FP16 ~0.1GB | 3840 | — | 需自查 | — | 需代理 | AutoModelForCausalLM.from_pretrained('SupraLabs/Supra-Router-51M') |
| Grug-12B (kai-os) 微调自 gemma-4-12B-it | 12B | Q4 ~7.9GB / FP16 ~29GB | — | other | 需自查 | — | 需代理 | ollama run hf.co/kai-os/Grug-12B |
| Agents-A1 (InternScience) 量化自 Agents-A1 原生 · GGUF | 35B MoE | Q4 ~23GB / FP16 ~84GB | 262k | Apache 2.0 | 需自查 | — | 魔搭可用 | vllm serve InternScience/Agents-A1 --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 等 2 种 |
| Nova-1-Standard-1.3B (Smilyai Labs) | 1.27B | Q4 ~0.9GB / FP16 ~3.2GB | 2048 | apache-2.0 | 需自查 | — | 需代理 | pipeline('text-generation', model='Smilyai-labs/Nova-1-Standard-1.3B-Preview', trust_remote_code=True, device_map='auto') |
| Qwen3.6-35B-A3B (Qwen) 量化自 Qwen3.6-35B-A3B | 35B (3B 激活) | Q4 ~19GB / FP16 ~69GB | — | Apache-2.0 | 需自查 | — | 需代理 | pip install 'turboquant-mlx-full>=0.12.3' && python -m turboquant_mlx.generate --model manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64 |
| Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon) 量化自 Gemma4-Gutenberg-31B-Heretic | 31B | Q4 ~20GB / FP16 ~74GB | — | apache-2.0 | 需自查 | — | 需代理 | mlx_lm.generate --model ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit --prompt 'hello' |
| Laguna XS 2.1 (poolside) | 33B (3B 激活) | Q4 ~22GB / FP16 ~80GB | 262k | OpenMDW-1.1 | 需自查 | — | 需代理 | ollama run laguna-xs-2.1 |
| Ornith-1.0-35B (DeepReinforce) 微调自 Qwen3.5-35B-A3B 原生 · FP8 · GGUF | 35B-MoE | Q4 ~23GB / FP16 ~84GB | 256k | MIT | 需自查 | — | 需代理 | llama-server -hf deepreinforce-ai/Ornith-1.0-35B-GGUF --port 8000 -c 262144 等 3 种 |
| Ornith-1.0-9B (DeepReinforce) 量化自 Ornith-1.0-9B 原生 · GGUF·deepreinforce-ai · GGUF·protolabsai | 9B | Q4 ~5GB / FP16 ~18GB | 256k | MIT | 需自查 | — | 需代理 | llama-server -hf deepreinforce-ai/Ornith-1.0-9B-GGUF --port 8000 -c 262144 等 3 种 |
| Huihui-GLM-5.2-GGUF (huihui-ai) | — | — | — | MIT | 需自查 | — | 需代理 | llama-server -m ./glm52/GLM-5.2-UD-IQ1_M.gguf -c 4096(需编译llama.cpp) 等 2 种 |
| Nemotron-Labs-TwoTower-30B-A3B (NVIDIA) | 30B (3B 激活) | — | 128k | NVIDIA Nemotron Open Model License | 需自查 | — | 需代理 | python3 -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16',trust_remote_code=True,torch_dtype='bfloat16').cuda()" (单GPU AR模式,约59GB显存) 等 2 种 |
| Qwen3.6-27B-NVFP4 (NVIDIA) | 27B | — | 262k | Apache-2.0 | 需自查 | — | 需代理 | vllm serve nvidia/Qwen3.6-27B-NVFP4 --port 8000 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3 |
| LFM2.5-230M (LiquidAI) 量化自 LFM2.5-230M 原生 · GGUF | 230M | Q4 ~0.2GB / FP16 ~0.6GB | 32768 | LFM1.0 | 需自查 | — | 需代理 | llama-server -hf LiquidAI/LFM2.5-230M-GGUF 等 3 种 |
| Mythos-nano (squ11z1) 量化自 VibeThinker-3B | 3B | Q4 ~2GB / FP16 ~7.4GB | — | MIT | 需自查 | — | 需代理 | ollama run hf.co/squ11z1/Mythos-nano 等 4 种 |
| Qwen3.6-27b-Fable5 (hotdogs) LoRA · 基于 Qwen3.6-27B | 27B (基座) + LoRA | — | — | — | 需自查 | — | 需代理 | vllm serve Qwen/Qwen3.6-27B --enable-lora --lora-modules fable=hotdogs/qwen3.6-27b-fable5-lora |
| FastContext-1.0-4B-RL (Microsoft) 微调自 Qwen3-4B-Instruct-2507 | 4B | Q4 ~2.7GB / FP16 ~9.7GB | 262k | MIT | 需自查 | — | 需代理 | python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-RL --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8 等 2 种 |
| Huihui-gemma-4-12B-coder-abliterated (huihui-ai) 微调自 gemma-4-12B-coder-fable5-composer2.5-v1 | 12B | Q4 ~7.9GB / FP16 ~29GB | — | apache-2.0 | 需自查 | — | 需代理 | vllm serve huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated 等 2 种 |
| Gemma-4-12B-it-LWQ6 (wepiqx) | 12B | — | — | Apache-2.0 | 需自查 | — | 需代理 | llama-server -hf wepiqx/gemma-4-12B-it-LWQ6-GGUF:gemma-4-12b-it-LWQ6-IQ4_XS.gguf --jinja --flash-attn on -c 55555 -ngl 99 等 2 种 |
| Gemma-4-31B-StyleTune (Gryphe) 微调自 gemma-4-31B-it | 31B | Q4 ~22GB / FP16 ~78GB | — | apache-2.0 | 可商用 | — | 需代理 | python -c "from transformers import AutoModelForCausalLM; model = AutoModelForCausalLM.from_pretrained('Gryphe/Gemma-4-31B-StyleTune')" |
| VibeThinker-3B (WeiboAI) 微调自 Qwen2.5-Coder-3B | 3B | Q4 ~2GB / FP16 ~7.4GB | 64k | MIT | 可商用 | — | 魔搭可用 | vllm serve WeiboAI/VibeThinker-3B 等 2 种 |
| FastContext-1.0-4B-SFT (Microsoft) 微调自 Qwen3-4B-Instruct-2507 | 4B | Q4 ~2.7GB / FP16 ~9.7GB | 262k | MIT | 可商用 | — | 需代理 | python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-SFT --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8 等 2 种 |
| DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA) 量化自 diffusiongemma-26B-A4B-it | 25.2B (3.8B活跃) | Q4 ~9.5GB / FP16 ~35GB | 256k | Apache 2.0 (Gemma Terms) | 可商用 | — | 需代理 | VLLM_USE_V2_MODEL_RUNNER=1 vllm serve nvidia/diffusiongemma-26B-A4B-IT-NVFP4 --trust-remote-code --max-num-seqs 4 --attention-backend TRITON_ATTN --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 --override-generation-config '{"max_new_tokens": null}' --default-chat-template-kwargs '{"enable_thinking":true}' (需H100/B100) |
| Z-Image-Engineer-V6 (BennyDaBall) 微调自 Z-Image-Turbo | 4B | Q4 ~2.7GB / FP16 ~9.7GB | — | Apache-2.0 | 可商用 | — | 需代理 | llama-server -hf BennyDaBall/Z-Image-Engineer-V6-GGUF 等 2 种 |
| Gemma4-12B-Coder (yuxinlu1) 量化自 gemma-4-12B-it | 12B | — | 131k | gemma | 可商用 | — | 需代理 | ollama run hf.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF 等 2 种 |
| Quasar-Preview (silx-ai) | 18B (2B active) | Q4 ~11GB / FP16 ~40GB | 5M (实验性配置) | MIT | 可商用 | — | 需代理 | python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('silx-ai/Quasar-Preview', trust_remote_code=True)" |
| Delphi-25B (Marin Community) | 25B | Q4 ~16GB / FP16 ~60GB | 4k | apache-2.0 | 可商用 | — | 需代理 | transformers.from_pretrained('marin-community/delphi-1e23-25Bparams-628Btokens') |
| LFM2.5-1.2B-JP (LiquidAI) 微调自 LFM2.5-1.2B-Base | 1.2B | Q4 ~0.8GB / FP16 ~2.8GB | 32k | LFM1.0 | 需自查 | — | 需代理 | llama-server -hf LiquidAI/LFM2.5-1.2B-JP-202606-GGUF 等 3 种 |
| Harness-1 (pat-jj) 微调自 gpt-oss-20b | 20B | Q4 ~14GB / FP16 ~50GB | — | — | 需自查 | — | 需代理 | transformers from_pretrained('pat-jj/harness-1') |
| Gemma-4-12B-OBLITERATED (OBLITERATUS) 量化自 gemma-4-12B-it | 12B | Q4 ~7.9GB / FP16 ~29GB | — | gemma | 限制商用 | — | 需代理 | ollama run hf.co/OBLITERATUS/Gemma-4-12B-OBLITERATED 等 2 种 |
| Nex-N2-mini (nex-agi) | 35B (A3B) | Q4 ~23GB / FP16 ~84GB | — | apache-2.0 | 可商用 | — | 魔搭可用 | python -m sglang.launch_server --model-path ./model --tp 2 --reasoning-parser qwen3 --tool-call-parser qwen3_coder 等 2 种 |
| Qwen3.5-0.8B-OptiQ-4bit (mlx-community) 量化自 Qwen3.5-0.8B | 0.8B | Q4 ~0.1GB / FP16 ~0.4GB | — | Apache 2.0 | 可商用 | — | 需代理 | pip install mlx-lm; mlx_lm.generate --model mlx-community/Qwen3.5-0.8B-OptiQ-4bit --prompt '...' 等 2 种 |
| Qwen3.5-2B-OptiQ-4bit (mlx-community) 量化自 Qwen3.5-2B | 2B | Q4 ~0.3GB / FP16 ~1GB | — | apache-2.0 | 可商用 | — | 需代理 | mlx-lm generate --model mlx-community/Qwen3.5-2B-OptiQ-4bit 等 2 种 |
| Qwen3.6-27B-MTPLX (Youssofal) | 27B | Q4 ~3.1GB / FP16 ~11GB | — | Apache-2.0 | 可商用 | — | 需代理 | brew install youssofal/mtplx/mtplx 等 3 种 |
| Qwen3.6-27B-OptiQ-4bit (mlx-community) 量化自 Qwen3.6-27B | 27B | Q4 ~18GB / FP16 ~65GB | — | Apache-2.0 | 可商用 | — | 需代理 | mlx_lm.load('mlx-community/Qwen3.6-27B-OptiQ-4bit') 等 2 种 |
| Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community) 量化自 Qwen3.6-35B-A3B | 35B-A3B | Q4 ~23GB / FP16 ~83GB | — | Apache-2.0 | 可商用 | — | 需代理 | optiq serve --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit --mtp 等 2 种 |
| Mellum2-12B-A2.5B-Instruct (JetBrains) | 12B (2.5B active) | Q4 ~8GB / FP16 ~29GB | 131k | apache-2.0 | 可商用 | — | 需代理 | vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072 等 2 种 |
| HelixLM-40M-ep1 (david-thrower) | 40.1M | Q4 ~0GB / FP16 ~0.1GB | 1024 | Modified Apache 2.0 | 需自查 | — | 需代理 | transformers from_pretrained(trust_remote_code=True) 等 2 种 |
| LFM2.5-8B-A1B (LiquidAI) 量化自 LFM2.5-8B-A1B 原生 · GGUF·liquidai · GGUF·unsloth | 8.3B (1.5B active) | Q4 ~5.6GB / FP16 ~20GB | 128k | LFM1.0 | 需自查 | — | 需代理 | transformers >= 5.0.0: AutoModelForCausalLM.from_pretrained('LiquidAI/LFM2.5-8B-A1B') |
| Mellum2-12B-A2.5B-Thinking (JetBrains) | 12B | Q4 ~8GB / FP16 ~29GB | 131k | Apache 2.0 | 可商用 | — | 需代理 | vllm serve JetBrains/Mellum2-12B-A2.5B-Thinking --max-model-len 131072 --reasoning-parser qwen3 等 2 种 |
| Qwen3.5-9B (Qwen) 量化自 Qwen3.5-9B | 9B | — | 32k | MIT | 可商用 | — | 需代理 | ollama run hf.co/w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP 等 2 种 |
| Qwen3.6-35B-A3B-NVFP4 (NVIDIA) 量化自 Qwen3.6-35B-A3B | 35B (激活3B) | Q4 ~12GB / FP16 ~45GB | 262k | Apache 2.0 | 可商用 | — | 需代理 | vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt |
| BitCPM-CANN-8B (OpenBMB) | 8B | — | — | apache-2.0 | 可商用 | — | 需代理 | ollama create 从 https://huggingface.co/openbmb/BitCPM-CANN-8B-gguf 导入 等 2 种 |
| aro-coder-4bit (ARO-Lang) LoRA · 基于 Qwen3-Coder-30B-A3B-Instruct-4bit | 30B (3B active) | Q4 ~0.8GB / FP16 ~3.1GB | — | MIT | 可商用 | — | 需代理 | ollama run aro-coder 等 3 种 |
| Qwen3.6-27B (OBLITERATUS) 量化自 Qwen3.6-27B | 26.9B | Q4 ~18GB / FP16 ~65GB | 8192 | apache-2.0 | 可商用 | — | 需代理 | ollama run hf.co/OBLITERATUS/Qwen3.6-27B-OBLITERATED 等 3 种 |
| Meta-Llama-3-8B-Instruct-4bit (mlx-community) | 8B | Q4 ~1.1GB / FP16 ~4.1GB | 8k | llama3 | 需自查 | — | 需代理 | pip install mlx-lm && mlx_lm.generate --model mlx-community/Meta-Llama-3-8B-Instruct-4bit --prompt "hello" 等 2 种 |
| Ternary-Bonsai-8B (Prism ML) 量化自 Ternary-Bonsai-8B-unpacked | 8B | Q4 ~0.4GB / FP16 ~1.5GB | 65k | Apache-2.0 | 可商用 | — | 需代理 | mlx_lm.load('prism-ml/Ternary-Bonsai-8B-mlx-2bit') 等 2 种 |
| Llama-2-7b-chat-mlx (mlx-community) | 7B | — | 4096 | llama2 | 限制商用 | — | 需代理 | python mlx-examples/llama/llama.py --prompt 'Hi' model/ 等 2 种 |
| Nemotron-Labs-Diffusion-14B (NVIDIA) | 14B | Q4 ~8.9GB / FP16 ~32GB | — | NVIDIA Nemotron Open Model License | — | — | 需代理 | transformers from_pretrained() |
| Bonsai-8B-mlx-1bit (PrismML) 量化自 Bonsai-8B-unpacked | 8B | Q4 ~0.3GB / FP16 ~0.9GB | 65k | Apache-2.0 | 可商用 | — | 需代理 | pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit') |
| HRM-Text-1B (sapientinc) | 1B | Q4 ~0.8GB / FP16 ~2.8GB | 4096 | Apache-2.0 | 可商用 | — | 需代理 | AutoModelForCausalLM.from_pretrained('sapientinc/HRM-Text-1B', trust_remote_code=True) 等 2 种 |
| Minimalism (salakash) LoRA · 基于 Qwen2.5-Coder-0.5B-Instruct | 0.5B | — | 32k | Apache-2.0 | 可商用 | — | 需代理 | mlx_lm.server --model mlx-community/Qwen2.5-Coder-0.5B-Instruct-4bit --adapter-path salakash/Minimalism --port 8080 等 2 种 |
| Nandi-Mini-600M (FrontiersMind) | 600M | Q4 ~0.4GB / FP16 ~1.5GB | 2048 | apache-2.0 | 可商用 | — | 需代理 | transformers.from_pretrained('FrontiersMind/Nandi-Mini-600M-Early-Checkpoint') |
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 需使用 llama.cpp 定制分支,该分支已落后上游版本 —— prism-ml/Bonsai-27B-mlx-1bit
- 语言能力测试中不及 Qwen3.5-2B 4-bit 量化版 —— prism-ml/Bonsai-27B-mlx-1bit
- 愚人节发布导致初期可信度受影响 —— prism-ml/Bonsai-27B-mlx-1bit
- 对复杂问题倾向于拒绝回答,实际可用范围受限 —— GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking
- 指令跟随和对细节的把控弱,常忽略 system prompt 中的关键要求,不如 Gemma 4 12B QAT 和 Qwen 3.6 35B A3B 可靠 —— prism-ml/Bonsai-27B-gguf
- 不适合复杂编程或多步自主工作流,输出常被截断且不返回完整结果,官方也声明 agentic coding 不是当前版本的重点目标 —— prism-ml/Bonsai-27B-gguf
- KV 缓存占用仍偏高,全精度下仅约 100k 上下文,Q8_0 下约 150k,限制了长上下文场景 —— prism-ml/Bonsai-27B-gguf
- dspark 投机解码与当前 PrismML 的 llama.cpp 分支存在兼容问题,预测长度被错误绑定到主模型上下文,导致 CUDA 内存分配暴涨 —— prism-ml/Bonsai-27B-gguf
展开其余 215 条
- 在同显存条件下,实际表现不如 Qwen 3.6 27B Q2_K_XL 和 Gemma 4 12B QAT,预填充和解码速度也未达预期 —— prism-ml/Bonsai-27B-gguf
- 训练时在高难度类别上存在质量差距,二元版保留 89.5%、三元版保留 94.6% 的全精度基准平均水平 —— prism-ml/Bonsai-27B-gguf
- 风格偏机械/生硬,不适合创意写作和对话场景 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 官方宣称的4倍速提升存在夸大,实际提速明显但未达宣称水平 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 合成数据训练可能影响回答质量 —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 部分基准测试不及GLM 4.7 Flash —— mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit
- 在需要独立决策时表现糟糕,3B 激活参数的限制明显暴露 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 硬核编程任务上表现崩溃,在 70 个真实仓库测试中不合格 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 整体能力明确低于 Claude Sonnet,复杂任务差距明显 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 执行过程中倾向于中途偏离用户给出的详细指令 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 对量化精度和推理参数非常敏感,需要高量化精度和正确的参数设置 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 在某些对比测试中处理任务质量不如对比模型 —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 速度虽快,但任务完成质量下降(以质量换速度) —— mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit
- 指令遵循能力弱,经常忽略细节要求,不按预设流程激活技能(约 10 次中仅 1 次自动执行) —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 实际工作流体验不如同尺寸 Qwen 3.6 27B Q2_K_XL 量化版,也不如 Gemma 4 12B QAT —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 三元版约 7.2GB 超出手机每应用 6GB iOS 内存限制,无法在手机上部署 —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 长程多文件 agentic coding 工作流暂不支持,官方明确标注为当前版本不擅长 —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
- 视觉能力显著弱于同尺寸竞品 —— prism-ml/Ternary-Bonsai-27B-mlx-2bit
- GGUF 版本加载失败,llama.cpp 兼容性存在问题 —— prism-ml/Ternary-Bonsai-27B-gguf
- 长上下文提示处理延迟突出,38K token 的 prompt 处理耗时 17.3 秒 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 对 prompt 格式异常敏感,会在与上下文冲突时强行将示例塞入回答 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 嵌套 JSON 输出不可靠,改用 XML 格式后表现正常 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 部分用户在 OpenCode 中遇到重复循环和空字符串函数调用问题,后自行归因于参数配置 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- Q6_K 量化版本在编码规划和组织逻辑上被社区报告优于 Q8_0,大不一定更好 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- BenchLM 综合评分仅 51.47/100,排名 #104/200 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 物理合理性图像生成弱于 Claude Opus 4.7(flamingo 骑独轮车测试中 Opus 更接近物理真实) —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 需要耐心调参,非开箱即用的完美体验 —— aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw
- 在无工具对话中容易产生幻觉 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 实际代码修复表现可能不如基准测试的分数 —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- MLX 转换需要额外 monkeypatch 处理未融合的 MoE experts —— nathansutton/Ornith-1.0-35B-UD-Q2_K_XL-MLX
- 相比 GGUF 4-bit 同量化,生成推理 token 量约翻倍,较为冗长 —— mlx-community/Qwen3.5-9B-OptiQ-4bit
- MLX 多轮对话性能明显低于单轮 —— mlx-community/Qwen3.5-9B-OptiQ-4bit
- 推理能力基准测试仅 60%,相对薄弱 —— mlx-community/Qwen3.5-9B-OptiQ-4bit
- 编程能力基准测试 70%,表现中等 —— mlx-community/Qwen3.5-9B-OptiQ-4bit
- v1 在 gpqa_diamond 上比基座 Qwen3.5-9B 低 5 分,v2 声称与 v1 持平而非提升,基准测试退化的问题可能仍在 —— empero-ai/Qwythos-9B-v2
- 该模型基于从闭源 Claude 模型蒸馏的合成数据训练,存在版权/合规争议 —— empero-ai/Qwythos-9B-v2
- 社区讨论热度和实际使用量远低于 Qwen 和 Gemma 系列 —— nvidia/Nemotron-Labs-Audex-2B
- 有用户反映 Nemotron 模型在实际使用中始终不如其基于的 Qwen 模型 —— nvidia/Nemotron-Labs-Audex-2B
- Arena-Hard-V2 (-4.2) 和 SWE-Bench (-2.6) 是压缩的主要能力代价 —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
- 需要 PIECEWISE CUDA graphs 等精细配置才能达到高 decode 速度,FULL graphs 无法在 24GB 卡上运行 —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
- Prefill 密集型场景下吞吐提升仅 1.60x,收益明显低于 decode 密集型场景 —— nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
- 当前状态不佳,业务挣扎导致技术侧妥协 —— kai-os/Grug-12B
- 几乎无人为平台开发应用,生态萎缩 —— kai-os/Grug-12B
- 安全方面存在明显短板 —— kai-os/Grug-12B
- 编码能力不如 Ornith,尤其是仓库级长程编码和补丁任务 —— InternScience/Agents-A1
- 不适合短程多样化任务,Ornith 在这方面更优 —— InternScience/Agents-A1
- 仍处于早期预训练阶段,仅为checkpoint而非成品模型 —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
- 合规性与行为表现评级为F- —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
- 无特定功能特性 —— Smilyai-labs/Nova-1-Standard-1.3B-Preview
- 对量化精度和推理参数极其敏感,参数不对时表现明显下降 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- MoE 的专家激活机制并不像社区预期那样能「解锁」更多模型能力 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- Power Ranking 编码任务仅比上代 Qwen 3.5 同尺寸略好(11/98 vs 10/98),提升有限 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 在编码任务上被 Qwen 3.5 27B 密集模型大幅超越(26/98 vs 11/98),不属同一级别 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 知识和技能类基准表现明显弱于其他维度,存在「刷榜」嫌疑 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- SVG 生成在物理合理性/遵循约束方面不如 Claude Opus 4.7 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 表现不稳定,属于「碰对了参数就很好用」的类型 —— manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64
- 8-bit 量化质量存疑:有测试显示 4-bit 得分与 16-bit 持平(21/23),而 8-bit 反而更低(20/23) —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- 推理速度远慢于 Qwen 3.5:同硬件下仅 11 t/s,Qwen 3.5 可达 60 t/s —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- KV 缓存占用巨大:完整 260K 上下文 fp16 需约 22GB 显存,远不如 Qwen 3.5 紧凑 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- 同等显存下可用上下文远少于 Qwen 3.5(约 20K vs 190K) —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- Google AI Studio 托管的 Gemma 4 版本被社区评价为体验很差 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- 有用户认为 Gemma 4 在非编程任务上完全无用 —— ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
- 社区对比指出 Qwen3.6-35B-A3B 在同量级中表现更强,甚至超过其更大的 M.1 —— poolside/Laguna-XS-2.1
- 有用户反馈在 shimmer 平台上体验不如 Gemma4-E2B —— poolside/Laguna-XS-2.1
- 有用户认为 North Mini Code 作为编码 agent「way better」 —— poolside/Laguna-XS-2.1
- 在已有代码库上修改/协作时效果急剧下降,社区反馈'失败得很惨' —— deepreinforce-ai/Ornith-1.0-35B
- 实际编码任务中表现不佳,仅发现几乎所有模型都能发现的bug —— deepreinforce-ai/Ornith-1.0-9B
- 无工具环境的对话中幻觉严重 —— deepreinforce-ai/Ornith-1.0-9B
- 会幻觉工具调用及其输出 —— deepreinforce-ai/Ornith-1.0-9B
- 有社区用户评价 abliterated 版本「pretty useless」,实际可用性受质疑 —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 长上下文精确检索落后 Opus 4.8 约 3.4-3.6 分 —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 原版审查极严,必须依赖 abliteration 才能解锁无审查能力 —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- Sonnet 5 在 50K 上下文下推理速度更快,检索质量则参差不齐 —— huihui-ai/Huihui-GLM-5.2-abliterated-GGUF
- 社区实测反馈极少,除个别用户外缺乏广泛真实使用验证 —— nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16
- NVFP4 相比 FP8 的质量损失尚未被充分验证 —— nvidia/Qwen3.6-27B-NVFP4
- 需要约 40 GB VRAM,最低需 L40S 48GB 或双卡方案 —— nvidia/Qwen3.6-27B-NVFP4
- 双 3090 方案占用空间大、发热高 —— nvidia/Qwen3.6-27B-NVFP4
- DGX Spark 上 35B MoE NVFP4 加推测解码实际仅约 50 tok/s,远低于宣传的 110 tok/s —— nvidia/Qwen3.6-27B-NVFP4
- NVFP4 在 Blackwell (SM120) 上并不比 FP8 更快 —— nvidia/Qwen3.6-27B-NVFP4
- 作为 CLI 编码代理配置(opencode)需要额外调校,不如 Claude Code 开箱即用 —— nvidia/Qwen3.6-27B-NVFP4
- NVIDIA 版本的 NVFP4 部分不使用 NVFP4 激活,仅做权重量化 —— nvidia/Qwen3.6-27B-NVFP4
- vLLM 在 16GB 消费卡上内存上限为 16K,长上下文受限 —— nvidia/Qwen3.6-27B-NVFP4
- 当前原生行为/能力尚简单,需自行微调才能适配具体生产任务 —— LiquidAI/LFM2.5-230M
- 通用对话与复杂推理能力有限,不适合直接作为日常聊天模型使用 —— LiquidAI/LFM2.5-230M
- 基于 Qwen 2.5 的 3B 模型声称对标前沿模型,benchmark 宣称缺乏独立复现和社区背书 —— squ11z1/Mythos-nano
- 社区关注度极低,缺乏实际使用反馈和第三方评测 —— squ11z1/Mythos-nano
- 并非 Claude 替代品,声称能平替 Claude 的说法被社区认为夸大 —— hotdogs/qwen3.6-27b-fable5-lora
- 将 opencode 调通为 CLI agent 需要大量调参,远不如 Claude Code 开箱即用 —— hotdogs/qwen3.6-27b-fable5-lora
- 在部分基准上 Qwen3.6 反而不如 Qwen3.5 和 Gemma 4 —— hotdogs/qwen3.6-27b-fable5-lora
- 因内置思考与规划机制,响应速度比 35B-A3B 慢 —— hotdogs/qwen3.6-27b-fable5-lora
- hotdogs LoRA 仓库要求同意联系方式共享才能访问模型文件 —— hotdogs/qwen3.6-27b-fable5-lora
- 社区讨论度很低,Reddit 帖子直言"Why is NO one talking about" —— microsoft/FastContext-1.0-4B-RL
- 作为子 agent 而非独立模型,需要配合主 coding agent 使用,不能单独完成编码任务 —— microsoft/FastContext-1.0-4B-RL
- 与现有 agent 工作流的实际集成仍处于早期阶段,社区自行添加支持 —— microsoft/FastContext-1.0-4B-RL
- 官方仅提及"边际开销很小",但缺乏子 agent 本身的详细性能基准 —— microsoft/FastContext-1.0-4B-RL
- abliteration 被描述为「粗糙的概念验证实现」,并非成熟方案 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 有社区用户反馈 huihui 的去审查模型整体上「失去的比得到的多」 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- Gemma 4 12B 缺乏专用视觉编码器,视觉理解能力受限 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 模型卡片明确声明不适合生产环境或面向公众的应用 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 内容过滤极其有限,可能生成不适宜的输出 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- FP16 全精度推理需约 26GB 显存,多数消费级 GPU 无法承载 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 使用者需自行承担法律和伦理风险 —— huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
- 工具调用不可靠:反复无法正确指定 grep 的 pattern 参数,调用被拒绝 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
- Qwen3.5-9B 在 8 项 benchmark 中赢了 5 项,尽管参数量更小 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
- Q8_0 量化生成速度仅 25.2 t/s,远低于 Q4_K_M 的 72.3 t/s —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
- MTP/assistant model 的 GGUF 量化尚未就绪,llama.cpp 支持仍在开发中 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
- 官方模型存在拒答问题,需使用 heretic 等去审查版本 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
- 受显存限制时需关闭 thinking mode 才能运行 12B 模型 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
- Q5 量化下仍可能出现大量语法错误(一个文件需 23 次编辑) —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
- MoE 变体(26B-A4B)运行速度显著慢于 Qwen 3.5 同类模型 —— wepiqx/gemma-4-12B-it-LWQ6-GGUF
- 编程不是强项:社区明确反馈 Gemma 4 在编程方面不突出,不如同尺寸其他模型 —— Gryphe/Gemma-4-31B-StyleTune
- 31B 推理速度有代价:有用户因速度损失更偏好 26B 版本,26B-A4B 在纯 CPU 上速度极快 —— Gryphe/Gemma-4-31B-StyleTune
- 本地部署可能遇到问题:有实测视频记录了 31B 本地运行时的具体问题 —— Gryphe/Gemma-4-31B-StyleTune
- 版本选择容易混淆:Google 发布了四个版本(E2B/E4B/26B/31B),选错版本会严重影响体验 —— Gryphe/Gemma-4-31B-StyleTune
- 实际运行速度可能低于 benchmark 预期:视频指出本地速度可能比纸面数据慢 —— Gryphe/Gemma-4-31B-StyleTune
- 社区对编程能力评价两极分化:有人称其编程接近 Sonnet,有人则认为不如此前模型 —— Gryphe/Gemma-4-31B-StyleTune
- 无法可靠用于代码工程与 agentic coding 场景 —— WeiboAI/VibeThinker-3B
- 端到端解决率提升仅最高5.5%,并非颠覆性改进 —— microsoft/FastContext-1.0-4B-SFT
- 仅支持只读工具(READ/GLOB/GREP),不能写代码或修改文件 —— microsoft/FastContext-1.0-4B-SFT
- FP16推理仍需约8.8GB VRAM,低配GPU需量化才能运行 —— microsoft/FastContext-1.0-4B-SFT
- 必须配合主编码代理使用,不能独立完成编码任务 —— microsoft/FastContext-1.0-4B-SFT
- 目前仅验证在Mini-SWE-Agent框架下的效果,其他代理框架兼容性未知 —— microsoft/FastContext-1.0-4B-SFT
- RL版本(4B-RL)也已发布但社区讨论极少,实际效果待验证 —— microsoft/FastContext-1.0-4B-SFT
- 模型族跨度4B-30B,但社区关注几乎全集中在4B版本,大版本缺乏实测 —— microsoft/FastContext-1.0-4B-SFT
- 事实性错误率远高于自回归版本,同一任务实测错误多出约 6 倍 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 话题越冷门/长尾,生成质量下降越明显(热门话题 4 处错误 vs 冷门话题 12 处错误) —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- Google 官方建议当质量优先时仍应使用 Gemma 4 自回归版本 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 本地模型能力远不及商业 API,社区提醒需将预期降至十分之一 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 当前阶段更适合作为快速初稿生成器,需搭配精修模型做二次修正 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 扩散架构在低并发单用户场景下优势最明显,高并发下相对优势缩小 —— nvidia/diffusiongemma-26B-A4B-it-NVFP4
- 图像生成本身复杂度高,对显存/内存需求较大 —— BennyDaBall/Z-Image-Engineer-V6
- 社区对其能否替代现有主流模型尚无定论 —— BennyDaBall/Z-Image-Engineer-V6
- OpenCode 下工具调用极差,Q8 量化连一次工具调用都无法完成,只回复"Okay."(evidence 4、7) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 工具调用时反复无法正确指定参数(如 grep 的 pattern),调用被拒绝(evidence 7) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 有用户明确表示不会用它做编程调试,倾向 Gemma-4-31B 或 Qwen3.6-27B(evidence 1) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 该 Fable-5 微调被质疑为噱头,认为 12B 模型无法承载更大模型的推理能力(evidence 2) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 官方 8Q 模型存在拒答问题,需 heretic 版本才能正常生成(evidence 6) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- Q8 量化生成速度骤降至 25.2 t/s,相比 Q4 的 72.3 t/s 大幅下降(evidence 5) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 尚无 assistant 模型的 GGUF 量化版本(evidence 5) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- MTP(多 token 预测)支持仍在开发中(evidence 5) —— yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
- 非最终版模型,仅为预训练基础模型,不追求 SOTA —— silx-ai/Quasar-Preview
- 证据仅涉及缩放定律预测精度,无社区讨论涉及模型实际生成质量、推理吞吐或日常使用体验 —— marin-community/delphi-1e23-25Bparams-628Btokens
- 当前讨论集中在训练效率与损失预测,缺乏下游任务评估(benchmark 表现、人类偏好等)的证据 —— marin-community/delphi-1e23-25Bparams-628Btokens
- 复杂推理能力不足,处理编程重构等任务会出错 —— LiquidAI/LFM2.5-1.2B-JP-202606
- 不适合编程和知识密集型任务 —— LiquidAI/LFM2.5-1.2B-JP-202606
- 工具调用(如自动判断是否需要网页搜索)不可靠 —— LiquidAI/LFM2.5-1.2B-JP-202606
- 基准测试表现可能属于典型 hype,实际使用中未必复现 —— pat-jj/harness-1
- 在测试的搜索模型中仍落后于 Opus-4.6 —— pat-jj/harness-1
- GGUF 格式转换存在问题,unsloth 和 bartowski 已确认正在调查,llama.cpp 加载报错 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
- 关闭 thinking 模式后可能不需要 abliteration 即可绕过拒绝 —— OBLITERATUS/Gemma-4-12B-OBLITERATED
- 能力评分仅 27.0%,官方定位为玩具代理和提示词重写器,不适合复杂推理或生产级应用 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- omlx v0.2.20 升级后曾出现 Internal server error,社区工具链稳定性有待观察 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- 0.8B 参数规模天然受限,仅适合极轻量场景 —— mlx-community/Qwen3.5-0.8B-OptiQ-4bit
- Capability Score 仅 48%,远低于同系列 4B(81.5%)和 9B(90%),能力上限有限 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
- MLX 模型在 LM Studio 中 prompt caching 目前存在已知 bug —— mlx-community/Qwen3.5-2B-OptiQ-4bit
- 部分 MLX 版 Qwen3.5 存在崩溃和无视设置强行注入 thinking 标签的社区反馈 —— mlx-community/Qwen3.5-2B-OptiQ-4bit
- 上下文超过约 65k 时出现 OOM —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- MTP 模式下代码质量可能不如使用独立 draft model (Qwen3.5-0.8B) —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- SVG 生成效果不佳,与 GLM 5.1 相比明显偏弱 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 数学能力弱于 35B-A3B (AIME 87.8 vs 92.7) —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- MTPLX v0.1.0-preview 仅支持 Qwen3-Next-MTP,兼容范围有限 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- 即使是 4-bit 量化仍需约 20GB 内存,对 16GB 设备仍有门槛 —— Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
- mlx-optiq 量化框架的开发者身份不明,社区对其可信度存在疑虑 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- MLX 在 LM Studio 中的提示缓存当前已损坏,与量化来源无关 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- GGUF 格式在高上下文窗口下即使在 M5 上仍可能导致系统冻结 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- 32 GB 统一内存是流畅运行的最低要求 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- SVG/图像生成质量不稳定,某些场景下不如 GLM 5.1 等竞品 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- OptiQ 虽开源但代码仅通过 PyPI 分发,仓库和开发过程不透明 —— mlx-community/Qwen3.6-27B-OptiQ-4bit
- mlx-optiq 的代码仓库与开发者身份不明确,社区对其透明度存疑 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
- MLX 在 LM Studio 中的 prompt caching 目前处于损坏状态 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
- Mac 上流畅运行本地 LLM 需要至少 32GB 内存 —— mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
- 非编码类通用能力弱于 Qwen 3.5 4B —— JetBrains/Mellum2-12B-A2.5B-Instruct
- 部分任务仅获中等结果 —— JetBrains/Mellum2-12B-A2.5B-Instruct
- 编程能力较弱,在社区实测中多数编程任务未通过(4/5 coding tests failed) —— LiquidAI/LFM2.5-8B-A1B
- 编码以外的通用任务表现弱于 Qwen 3.5 4B —— JetBrains/Mellum2-12B-A2.5B-Thinking
- 对自定义工具调用格式(如 <call>...</call>)遵循能力差 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 部分 prompt 字符串会破坏输出逻辑 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 在多语言交流中逻辑有问题,英语场景也偶有出现 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 事实性任务中存在明显幻觉 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- benchmark 高分与实际使用可靠性之间存在落差 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 不能替代 Opus 等大模型用于专业日常工作 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- 纯编码能力上 Gemma-4-12B 可能略优 —— w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP
- NVFP4 量化存在质量损失,可能出现失控生成和退化循环 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 在架构写作等非编程任务上,同系 27B 稠密模型可能更优 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- DGX Spark 上更新 vLLM 会遇到依赖冲突,部署有坑 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 稠密模型(27B)在某些任务上质量更好,只是速度不及 MoE —— nvidia/Qwen3.6-35B-A3B-NVFP4
- NVFP4 格式依赖 NVIDIA 硬件和 vLLM,通用性受限 —— nvidia/Qwen3.6-35B-A3B-NVFP4
- 社区反馈 safetensors 格式变体尚未提供 —— openbmb/BitCPM-CANN-8B
- 模型卡缺少 base_model 元数据标注 —— openbmb/BitCPM-CANN-8B
- abliteration 会降低基准表现,Heretic 方法 GSM8K 无效率达 74.5%(基础模型 68.2%) —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- HauhauCS/Reaper Abliteration 工具被指抄袭 Heretic(AGPL-3.0),剥离署名后重新授权为 PolyForm Noncommercial —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- 部分基准上 Qwen3.6 表现落后于 Qwen3.5 和 Gemma 4 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- vLLM 在测试的消费级 GPU 配置上内存上限仅 16K —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- 高并发请求在 300 秒测试预算下超时 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- 推理模型在 GSM8K 上有 23–75% 的题目在给出答案前耗尽思考预算 —— OBLITERATUS/Qwen3.6-27B-OBLITERATED
- 在相同硬件上吞吐量低于 gemma-2-9b,尽管参数量更少 —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
- MMLU Pro 评测结果存在一定的随机波动,单次跑分需谨慎解读 —— mlx-community/Meta-Llama-3-8B-Instruct-4bit
- 实际智能远弱于 Gemma-4-E2B 等常规 2B 模型 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
- Ternary(1.58-bit)版本回答甚至比 1-bit 版本更差 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
- 在 benchmark 上被 Ministral 3B 略微超过,8B 体量未转化为对应能力 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
- 不适合需要强推理能力的实际任务 —— prism-ml/Ternary-Bonsai-8B-mlx-2bit
- MLX 社区不如 GGUF 活跃,模板修复和量化改进滞后 —— mlx-community/Llama-2-7b-chat-mlx
- 实际使用可能出现崩溃、prompt 缓存缺失、内存压力问题 —— mlx-community/Llama-2-7b-chat-mlx
- 宣传的 token 速度在实际场景中可能被夸大 —— mlx-community/Llama-2-7b-chat-mlx
- mlx-community 模型集合维护不足,部分模型系列只有少量转换 —— mlx-community/Llama-2-7b-chat-mlx
- 权重从 bfloat16 转为 float16 存储,numpy 兼容性受限 —— mlx-community/Llama-2-7b-chat-mlx
- 社区实际使用案例稀少,有用户直接质疑是否有人真正在用 —— nvidia/Nemotron-Labs-Diffusion-14B
- 部分讨论将其与图像生成模型(eDiffi/DALL-E)混淆,存在认知偏差 —— nvidia/Nemotron-Labs-Diffusion-14B
- 实际问答质量远不如 Gemma 4-E2B,被社区用户评价为「远比 Gemma 4 笨」 —— prism-ml/Bonsai-8B-mlx-1bit
- 三元量化版本表现比 1-bit 版本更差,且体积反而比 Gemma 4 Q4_K_M 更大 —— prism-ml/Bonsai-8B-mlx-1bit
- 与 Gemma 4 Q4_K_M 相比体积仅小约 29%,优势有限 —— prism-ml/Bonsai-8B-mlx-1bit
- 非标准模型架构:使用自定义 hrm_text 模型类,非 Llama/Qwen 等主流 decoder,生态兼容性受限 —— sapientinc/HRM-Text-1B
- 社区成员自身指出 Reddit 不适合作为新闻来源 —— salakash/Minimalism
- 极简主义有时被指出隐含经济阶层门槛 —— salakash/Minimalism
- 当前仍处于早期/中间检查点阶段,非最终稳定版本,生产使用需谨慎 —— FrontiersMind/Nandi-Mini-600M-Early-Checkpoint