此页是 2026-08-24 的观测快照,查看该模型当前信息 → /m/z-lab__qwen38-27b-dflash2/

归档 / 2026-08-24 / Qwen3.8-27B-DFlash2 (z-lab)

Qwen3.8-27B-DFlash2 (z-lab)

为 Qwen3.8-27B 提供投机解码加速的草案模型

入选理由
DFlash2 是 Qwen3.8-27B 的投机解码草稿模型,需搭配 SGLang/vLLM 特殊版本部署,可显著提升推理吞吐,适合追求加速的开发者。
对位
适合
加速 Qwen3.8-27B 推理 / 高并发低延迟文本生成
不适合
不可独立作为语言模型使用
规模
1.9B · 128k · Q4 ~1.3GB / FP16 ~4.6GB
授权
apache-2.0 · 需自查
框架
vllm / sglang
血统
微调自 Qwen3.8-27B
可信度
HuggingFace 下载 5 万+, vLLM 与 SGLang 均已原生支持

仅 safetensors · 无 pickle 加载风险

快速上手示例

vllm serve Qwen/Qwen3.8-27B --speculative-config '{"method":"dflash","model":"z-lab/Qwen3.8-27B-DFlash2","num_speculative_tokens":7}'

依赖版本和硬件参数请以源仓库说明为准。

评分详情

Q1
今天能接上用吗   3 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   5 / 5
总分
11

HuggingFace 原始数据 (抓取于 2026-08-24)

作者
z-lab
任务类型
text-generation
推理库
transformers
下载
50,763
点赞
211
许可证
apache-2.0
标签
transformers, safetensors, qwen3, dflash2, speculative-decoding, block-diffusion, draft-model, sglang, vllm, text-generation, base_model:Qwen/Qwen3.8-27B, base_model:finetune:Qwen/Qwen3.8-27B, license:apache-2.0, text-generation-inference, region:us

探索

源链接