此页是 2026-05-31 的观测快照,查看该模型当前信息 → /m/nvidia__qwen36-35b-a3b-nvfp4/

归档 / 2026-05-31 / Qwen3.6-35B-A3B-NVFP4 (NVIDIA)

Qwen3.6-35B-A3B-NVFP4 (NVIDIA)

Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理

  • 已量化
入选理由
Qwen3.6-35B-A3B的NVFP4量化版,可直接通过vLLM部署,仅为量化重打包,适合有高端GPU的用户。
对位
对位Qwen3.6-35B-A3B BF16
适合
AI Agent系统 / RAG与聊天机器人
不适合
有毒提示或偏见内容生成
规模
35B (激活3B) · 262k · Q4 ~12GB / FP16 ~45GB
授权
Apache 2.0 · 可商用
框架
vllm
血统
量化自 Qwen3.6-35B-A3B
可信度
67020下载,46赞;FP4量化MMLU Pro 85.0,比BF16仅降0.6

仅 safetensors · 无 pickle 加载风险

社区实测

社区普遍认为 Qwen3.6-35B-A3B 是本地编程场景下速度与质量的最佳折中选择,NVFP4 量化版在 NVIDIA 硬件上部署便捷、推理极快,MoE 架构以接近稠密模型的质量换来了显著更高的吞吐,在 RTX 5090 上可达约 205 tok/s。部分用户反馈编程体验已接近 Claude 等云端闭源模型,但 NVFP4 量化存在质量损失和失控生成的风险。

  • 本地编程推理速度极快,RTX 5090 上约 205 tok/s 且支持 125k 上下文
  • NVFP4 量化可直接通过 vLLM 部署,降低使用门槛
  • MoE 架构在保持接近稠密模型质量的同时大幅提升推理速度
  • 在消费级 NVIDIA 硬件(RTX 5090、DGX Spark)上可流畅运行
  • 编程体验接近云端闭源模型,有用户称可与 Claude 媲美
  • 支持大上下文窗口(125k-250k),适合长代码任务
  • 128GB 内存下可容纳模型并留有 256k+ 上下文余量
  • NVFP4 量化存在质量损失,可能出现失控生成和退化循环
  • 在架构写作等非编程任务上,同系 27B 稠密模型可能更优
  • DGX Spark 上更新 vLLM 会遇到依赖冲突,部署有坑
  • 稠密模型(27B)在某些任务上质量更好,只是速度不及 MoE
  • NVFP4 格式依赖 NVIDIA 硬件和 vLLM,通用性受限

截至 2026-06-21

快速上手

vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   1 / 5
总分
7

HuggingFace 原始数据 (抓取于 2026-05-31)

作者
nvidia
任务类型
text-generation
推理库
Model Optimizer
下载
67,020
点赞
46
许可证
Apache 2.0
标签
Model Optimizer, safetensors, qwen3_5_moe, nvidia, ModelOpt, Qwen3.6, quantized, FP4, fp4, text-generation, conversational, base_model:Qwen/Qwen3.6-35B-A3B, base_model:quantized:Qwen/Qwen3.6-35B-A3B, license:apache-2.0, 8-bit, modelopt, region:us

探索

源链接