此页是 2026-08-20 的观测快照,查看该模型当前信息 → /m/z-lab__qwen38-27b-dflash2/

归档 / 2026-08-20 / Qwen3.8-27B-DFlash2 (incoai)

Qwen3.8-27B-DFlash2 (incoai)

Qwen3.8 草稿模型,用于 SGLang/vLLM 投机解码

入选理由
Qwen3.8专用投机解码草稿模型,非独立模型;需源码安装SGLang/vLLM并配合目标模型,可提速2-3倍;适合部署Qwen3.8追求吞吐的开发者。
对位
对位 Qwen3.8 内置 MTP 与 DSpark 草稿
适合
配合 Qwen3.8-27B 做投机解码加速 / SGLang/vLLM 推理吞吐优化
不适合
独立自回归生成
规模
1.9B · 未知 · Q4 ~1.3GB / FP16 ~4.6GB
授权
apache-2.0 · 需自查
框架
sglang / vllm
血统
微调自 Qwen3.8-27B
可信度
HF 1.5k 下载、93 点赞;附 H200 实测吞吐数据

仅 safetensors · 无 pickle 加载风险

快速上手示例

python -m sglang.launch_server --model-path Qwen/Qwen3.8-27B --speculative-algorithm DFLASH --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 --speculative-num-draft-tokens 8

依赖版本和硬件参数请以源仓库说明为准。

评分详情

Q1
今天能接上用吗   3 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   5 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-08-20)

作者
incoai
任务类型
text-generation
推理库
transformers
下载
1,484
点赞
93
许可证
apache-2.0
标签
transformers, safetensors, qwen3, dflash2, speculative-decoding, block-diffusion, draft-model, sglang, vllm, text-generation, base_model:Qwen/Qwen3.8-27B, base_model:finetune:Qwen/Qwen3.8-27B, license:apache-2.0, text-generation-inference, region:us

探索

源链接