模型 / Qwen3.8-27B-DFlash2 (z-lab)

Qwen3.8-27B-DFlash2 (z-lab)

为 Qwen3.8-27B 提供投机解码加速的草案模型

作者 z-lab

仓库标识z-lab/Qwen3.8-27B-DFlash2

~1.2GB 4-bit许可 可商用任务 文本生成最近核对 2026-08-24

仅 safetensors · 无 pickle 加载风险

格式
4-bit
文件
~1GB
运行内存
~1.2GB–1.5GB
运行时
VLLM
下载
50,763

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve Qwen/Qwen3.8-27B --speculative-config '{"method":"dflash","model":"z-lab/Qwen3.8-27B-DFlash2","num_speculative_tokens":7}'

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
DFlash2 是 Qwen3.8-27B 的投机解码草稿模型,需搭配 SGLang/vLLM 特殊版本部署,可显著提升推理吞吐,适合追求加速的开发者。
对位
对位 Medusa/EAGLE 等投机草案模型
适合
加速 Qwen3.8-27B 推理 / 高并发低延迟文本生成
不适合
不可独立作为语言模型使用

完整规格

规模
1.9B · 128k · 下载 ~1GB · 显存最低 ~1.2GB · 推荐 ~1.5GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
vllm / sglang
血统
微调自 Qwen3.8-27B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 65k → 187.6k

观测时间线

模型家族

查看全部家族 →