模型 / Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon)

Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon)

MLX 8-bit 量化英文创意写作模型,适合故事小说生成

作者 ailexleon

仓库标识ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit

~34GB 8-bit许可 可商用任务 文本生成最近核对 2026-08-05
格式
8-bit
文件
~30GB
运行内存
~34GB–44GB
运行时
MLX_LM
下载
311

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mlx_lm.generate --model ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit --prompt 'hello'

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Gemma4 文学创作模型的 MLX 8bit 量化版,Apple Silicon 用户可用 mlx-lm 直接运行创作任务,示例清晰。
对位
对位 Qwen2.5-32B 同级参数规模
适合
英文小说/创意写作生成 / 文学风格对话与叙事
不适合
事实性问答或精确指令遵循

独立证据与社区反馈

4 个独立来源 · 另 7 官方/转载最近验证 2026-08-05

Gemma 4 31B 是 Gemma 4 家族的质量天花板,在 Arena 上匹敌 Claude Sonnet 4.5,开源模型中排名第3;8-bit MLX 量化将 VRAM 从 ~62GB 压至 ~34GB,可在 128GB 的 M4 Max 上以 ~14.5 tok/s 运行。abliterated/uncensored 版本将拒绝率从 99/100 降至 15/100,KL 散度仅 0.0434,质量损失极小。

  • 拒绝率从 99/100 大幅降至 15/100,几乎无审查限制
  • 8-bit MLX 量化将 VRAM 从 BF16 的 ~62GB 降至 ~34GB,可在 M4 Max 128GB 上本地运行
  • Q4 量化可进一步压缩至 ~18GB VRAM,降低硬件门槛
  • 在 Apple Silicon 上通过 mlx-vlm 实现本地推理,M4 Max 上生成速度约 14.5 tok/s
  • 支持多模态(文本+图像),mlx-vlm 可直接调用图像推理
  • 推理时自动激活 thinking channel 处理复杂推理任务,无需手动切换
  • 可与 Pi (Hermes Agent) 和 OpenClaw 等本地 Agent 工具集成
  • 相比 Gemma 3 27B,在 LiveCodeBench 上从 29.1 跃升至 80,GPQA Diamond 从 42.4 升至 84.3
  • 标准 mlx-lm 不支持 gemma4 架构,必须使用 mlx-vlm >= 0.4.3
  • 加载时出现 mel filter warning,虽无害但可能引起困惑
  • DDR4 内存上生成速度仅 3-8 tok/s,低于人类阅读速度(~4-5 tok/s)
  • 密集模型每 token 激活全部 31B 参数,FLOP 成本高于同等能力的 MoE 模型
  • 多 GPU 纵向扩展效率低,在大多数情况下添加更多 GPU 是浪费钱
  • HLE 得分仅 26.5,远低于 GLM-5 (50.4) 和 Kimi K2.5 (50.2)
  • 完整下载约需 150GB 磁盘空间
  • 26B A4B MoE 版本仅落后 2-3% 但快 2-4 倍,性价比更高

可信度基于 nbeerbower/Gemma4-Gutenberg-31B-Heretic,Apache 2.0,mlx-lm 0.31.2 转换

完整规格

规模
31B · 下载 ~30GB · 显存最低 ~34GB · 推荐 ~44GB · 8-bit(估算)
授权
apache-2.0 · 可商用
框架
mlx
血统
量化自 Gemma4-Gutenberg-31B-Heretic
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 135 → 158

观测时间线