SummFlow 2026-07-02 Hugging Face

Qwen3.6-27B-NVFP4 (NVIDIA)

Qwen3.6-27B NVFP4 量化,面向 vLLM 部署与推理

  • 已量化
入选理由
Qwen3.6-27B的4比特量化版,vlLM一行命令部署,精度接近FP8,显存降2.5倍,适合Hopper/Blackwell用户跑262K长上下文。
对位
对位 Qwen3.6-27B FP8 基础版及同规模开源模型
适合
AI Agent 与工具调用 / 聊天机器人与 RAG 系统
不适合
不适用于安全敏感应用
规模
27B · 262k
授权
Apache-2.0 · 需自查
框架
vllm
可信度
下载量 2671,点赞 168,NVIDIA 官方量化,附带 FP8 vs NVFP4 准确率基准

仅 safetensors · 无 pickle 加载风险

社区实测

Qwen3.6-27B-NVFP4 是 NVIDIA 官方量化的 NVFP4 版本,在 DGX Spark 上单卡可跑到 26 tok/s 且多并发至 91.9 tok/s,显著快于 Unsloth 版本;模型体积 21.9 GB 比社区版更小;编码能力被社区验证可在本地替代 Claude Code 进行日常开发。NVFP4 相比 FP8 的质量损失尚待实测评估,且 NVFP4 在 Blackwell 上并不比 FP8 更快。

  • 27B 密集模型在本地可替代 Claude Code 完成脚手架、重构、测试生成等实际编码任务
  • NVFP4 量化将模型体积压缩至 21.9 GB,比 Unsloth 版小 4.5 GB,比 AutoRound MTP BF16 版小 6.7 GB
  • 单卡 DGX Spark 上单会话 26.3 tok/s、4 并发 91.9 tok/s,全面超越 Unsloth 版本
  • RTX 5090 上跑相同 NVFP4 模型可达 122 tok/s
  • 2× RTX 5060 Ti 16GB 消费卡上可运行,边际成本约 $0.010/百万 token
  • 模型在代码生成中解决更多无限循环和输出格式问题
  • Apache 2.0 许可证,可自由商用
  • 可直接用 vLLM 加载推理,无需额外转换
  • NVFP4 相比 FP8 的质量损失尚未被充分验证
  • 需要约 40 GB VRAM,最低需 L40S 48GB 或双卡方案
  • 双 3090 方案占用空间大、发热高
  • DGX Spark 上 35B MoE NVFP4 加推测解码实际仅约 50 tok/s,远低于宣传的 110 tok/s
  • NVFP4 在 Blackwell (SM120) 上并不比 FP8 更快
  • 作为 CLI 编码代理配置(opencode)需要额外调校,不如 Claude Code 开箱即用
  • NVIDIA 版本的 NVFP4 部分不使用 NVFP4 激活,仅做权重量化
  • vLLM 在 16GB 消费卡上内存上限为 16K,长上下文受限

截至 2026-07-08

快速上手

vllm serve nvidia/Qwen3.6-27B-NVFP4 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3