此页是 2026-08-31 的观测快照,查看该模型当前信息 → /m/youssofal__qwen38-flash-next-mtplx-optimized-speed/
归档 / 2026-08-31 / Qwen3.8-Flash-Next Optimized Speed (MTPLX)
Qwen3.8-Flash-Next Optimized Speed (MTPLX)
Mac 上 MTPLX 4-bit 量化,MTP 投机加速
- 入选理由
- 基于 Qwen 官方新模型的 MLX 量化版,主打 Apple Silicon 上 2-3 倍加速,利用 MTP 投机采样。适合拥有 96GB+ 内存 Mac 的本地推理用户。
- 对位
- 对位 Mixtral-8x7B / Qwen3-30B-A3B
- 适合
- 苹果芯片 Mac 本地聊天 / 长上下文与代码生成
- 不适合
- 96GB 以下 Mac 或高精度需求
- 规模
- 125B-A6B · 262k · Q4 ~83GB / FP16 ~300GB
- 授权
- qwen-community-1.0 · 需自查
- 框架
- mlx / mtplx
- 血统
- 量化自 Qwen3.8-Flash-Next
- 可信度
- HF 下载 2374,点赞 14;仓库给出 M5 Max 73.5 tok/s 实测
仅 safetensors · 无 pickle 加载风险
快速上手示例
mtplx serve --model Youssofal/Qwen3.8-Flash-Next-MTPLX-Optimized-Speed 点击复制
依赖版本和硬件参数请以源仓库说明为准。
评分详情
- Q1
- 今天能接上用吗 4 / 5
- Q2
- 有可信证据吗 2 / 5
- Q3
- 是新东西吗 1 / 5
- 总分
- 7
HuggingFace 原始数据 (抓取于 2026-08-31)
- 作者
- Youssofal
- 推理库
- mlx
- 下载
- 2,374
- 点赞
- 14
- 许可证
- qwen-community-1.0
- 标签
- mlx, safetensors, qwen4_exp, apple-silicon, macos, speculative-decoding, multi-token-prediction, qwen, qwen3.8-flash-next, moe, mtp, mtplx, local-ai, chat, text-generation, conversational, base_model:Qwen/Qwen3.8-Flash-Next, base_model:quantized:Qwen/Qwen3.8-Flash-Next, license:other, 4-bit, region:us
探索
源链接