Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon)
MLX 8-bit 量化英文创意写作模型,适合故事小说生成
仓库标识ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit
~34GB 8-bit许可 可商用任务 文本生成最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(8bit)。
- 格式
- 8-bit
- 文件
- ~30GB
- 运行内存
- ~34GB–44GB
- 运行时
- MLX_LM
- 下载
- 311
仅 safetensors · 无 pickle 加载风险
快速上手示例
mlx_lm.generate --model ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit --prompt 'hello' 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
Gemma 4 31B 是 Gemma 4 家族的质量天花板,在 Arena 上匹敌 Claude Sonnet 4.5,开源模型中排名第3;8-bit MLX 量化将 VRAM 从 ~62GB 压至 ~34GB,可在 128GB 的 M4 Max 上以 ~14.5 tok/s 运行。abliterated/uncensored 版本将拒绝率从 99/100 降至 15/100,KL 散度仅 0.0434,质量损失极小。
- 拒绝率从 99/100 大幅降至 15/100,几乎无审查限制
- 8-bit MLX 量化将 VRAM 从 BF16 的 ~62GB 降至 ~34GB,可在 M4 Max 128GB 上本地运行
- Q4 量化可进一步压缩至 ~18GB VRAM,降低硬件门槛
- 在 Apple Silicon 上通过 mlx-vlm 实现本地推理,M4 Max 上生成速度约 14.5 tok/s
- 支持多模态(文本+图像),mlx-vlm 可直接调用图像推理
- 推理时自动激活 thinking channel 处理复杂推理任务,无需手动切换
- 可与 Pi (Hermes Agent) 和 OpenClaw 等本地 Agent 工具集成
- 相比 Gemma 3 27B,在 LiveCodeBench 上从 29.1 跃升至 80,GPQA Diamond 从 42.4 升至 84.3
- 标准 mlx-lm 不支持 gemma4 架构,必须使用 mlx-vlm >= 0.4.3
- 加载时出现 mel filter warning,虽无害但可能引起困惑
- DDR4 内存上生成速度仅 3-8 tok/s,低于人类阅读速度(~4-5 tok/s)
- 密集模型每 token 激活全部 31B 参数,FLOP 成本高于同等能力的 MoE 模型
- 多 GPU 纵向扩展效率低,在大多数情况下添加更多 GPU 是浪费钱
- HLE 得分仅 26.5,远低于 GLM-5 (50.4) 和 Kimi K2.5 (50.2)
- 完整下载约需 150GB 磁盘空间
- 26B A4B MoE 版本仅落后 2-3% 但快 2-4 倍,性价比更高
- 独立评测Gemma 4 on Apple Silicon guide
- 独立评测Gemma 4 31B H100 inference benchmark
- 独立评测Gemma 4 31B benchmark analysis
- 独立评测Gemma 4 vs Qwen3.5 local comparison
- 转载/仓库TheCluster README commit
- 转载/仓库TxemAI README commit 7c08e68
- 转载/仓库TxemAI README commit 1300772
- 转载/仓库TxemAI README main
- 转载/仓库TxemAI model page
- 转载/仓库TheCluster model page
- 转载/仓库TheCluster model tree
可信度基于 nbeerbower/Gemma4-Gutenberg-31B-Heretic,Apache 2.0,mlx-lm 0.31.2 转换
完整规格
下载动量
30天下载 135 → 158