此页是 2026-08-31 的观测快照,查看该模型当前信息 → /m/youssofal__qwen38-flash-next-mtplx-optimized-speed/

归档 / 2026-08-31 / Qwen3.8-Flash-Next Optimized Speed (MTPLX)

Qwen3.8-Flash-Next Optimized Speed (MTPLX)

Mac 上 MTPLX 4-bit 量化,MTP 投机加速

  • MLX
  • 已量化
入选理由
基于 Qwen 官方新模型的 MLX 量化版,主打 Apple Silicon 上 2-3 倍加速,利用 MTP 投机采样。适合拥有 96GB+ 内存 Mac 的本地推理用户。
对位
对位 Mixtral-8x7B / Qwen3-30B-A3B
适合
苹果芯片 Mac 本地聊天 / 长上下文与代码生成
不适合
96GB 以下 Mac 或高精度需求
规模
125B-A6B · 262k · Q4 ~83GB / FP16 ~300GB
授权
qwen-community-1.0 · 需自查
框架
mlx / mtplx
血统
量化自 Qwen3.8-Flash-Next
可信度
HF 下载 2374,点赞 14;仓库给出 M5 Max 73.5 tok/s 实测

仅 safetensors · 无 pickle 加载风险

快速上手示例

mtplx serve --model Youssofal/Qwen3.8-Flash-Next-MTPLX-Optimized-Speed

依赖版本和硬件参数请以源仓库说明为准。

评分详情

Q1
今天能接上用吗   4 / 5
Q2
有可信证据吗   2 / 5
Q3
是新东西吗   1 / 5
总分
7

HuggingFace 原始数据 (抓取于 2026-08-31)

作者
Youssofal
任务类型
text-generation
推理库
mlx
下载
2,374
点赞
14
许可证
qwen-community-1.0
标签
mlx, safetensors, qwen4_exp, apple-silicon, macos, speculative-decoding, multi-token-prediction, qwen, qwen3.8-flash-next, moe, mtp, mtplx, local-ai, chat, text-generation, conversational, base_model:Qwen/Qwen3.8-Flash-Next, base_model:quantized:Qwen/Qwen3.8-Flash-Next, license:other, 4-bit, region:us

探索

源链接