Qwen3.6-27B-NVFP4 (NVIDIA)
Qwen3.6-27B NVFP4 量化,面向 vLLM 部署与推理
- 已量化
仅 safetensors · 无 pickle 加载风险
社区实测
Qwen3.6-27B-NVFP4 是 NVIDIA 官方量化的 NVFP4 版本,在 DGX Spark 上单卡可跑到 26 tok/s 且多并发至 91.9 tok/s,显著快于 Unsloth 版本;模型体积 21.9 GB 比社区版更小;编码能力被社区验证可在本地替代 Claude Code 进行日常开发。NVFP4 相比 FP8 的质量损失尚待实测评估,且 NVFP4 在 Blackwell 上并不比 FP8 更快。
- 27B 密集模型在本地可替代 Claude Code 完成脚手架、重构、测试生成等实际编码任务
- NVFP4 量化将模型体积压缩至 21.9 GB,比 Unsloth 版小 4.5 GB,比 AutoRound MTP BF16 版小 6.7 GB
- 单卡 DGX Spark 上单会话 26.3 tok/s、4 并发 91.9 tok/s,全面超越 Unsloth 版本
- RTX 5090 上跑相同 NVFP4 模型可达 122 tok/s
- 2× RTX 5060 Ti 16GB 消费卡上可运行,边际成本约 $0.010/百万 token
- 模型在代码生成中解决更多无限循环和输出格式问题
- Apache 2.0 许可证,可自由商用
- 可直接用 vLLM 加载推理,无需额外转换
- NVFP4 相比 FP8 的质量损失尚未被充分验证
- 需要约 40 GB VRAM,最低需 L40S 48GB 或双卡方案
- 双 3090 方案占用空间大、发热高
- DGX Spark 上 35B MoE NVFP4 加推测解码实际仅约 50 tok/s,远低于宣传的 110 tok/s
- NVFP4 在 Blackwell (SM120) 上并不比 FP8 更快
- 作为 CLI 编码代理配置(opencode)需要额外调校,不如 Claude Code 开箱即用
- NVIDIA 版本的 NVFP4 部分不使用 NVFP4 激活,仅做权重量化
- vLLM 在 16GB 消费卡上内存上限为 16K,长上下文受限
nvidia/Qwen3.6-27B-NVFP4 just dropped : r/LocalLLaMA - RedditNVFP4 still isn't faster than FP8 on Blackwell (SM120) - RedditYou can also run Qwen 3.6 27B dense model on DGX Spark with comparable performan... | Hacker Newsr/LocalLLM - RedditDGX Spark performance, vLLM - Qwen3.6 27b (NVFP4, FP8 and Full) : r/LocalLLMQwen3.6:27b is the first local model that actually holds up against ...Md Ismail Sojal - NVIDIA cooked, now smoked Unsloth on...nvidia/Qwen3.6-27B-NVFP4DSpark and NVIDIA's Qwen3.6 NVFP4 ModelsQwen3.6-27B-NVFP4 VRAM Requirements: ~40 GB, Cheapest GPU from $0.58/hr | SpheronWe ran Qwen3.6-27B on $800 of consumer GPUs, day one. Here's ...
截至 2026-07-08
快速上手
vllm serve nvidia/Qwen3.6-27B-NVFP4 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3