模型 / Ternary Bonsai 27B (prism-ml)

Ternary Bonsai 27B (prism-ml)

三元2-bit 27B开源模型,笔记本本地运行推理

作者 prism-ml

仓库标识prism-ml/Ternary-Bonsai-27B-mlx-2bit

显存未知许可 可商用任务 文本生成最近核对 2026-08-05
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
LLAMA-SERVER
下载
6

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
三元量化使27B模型仅需7GB显存,笔记本上跑出95%全精度性能,适合本地部署大模型、隐私敏感场景和单GPU服务。
对位
对位 Qwen3.6-27B/Gemma-4-31B 低比特量化
适合
笔记本端27B推理(~26 tok/s) / 离线/隐私场景长文本理解
不适合
手机端部署与长链条代理编码

独立证据与社区反馈

3 个独立来源最近验证 2026-08-05

社区认可其压缩效率,让27B模型首次能在消费级设备本地运行,但实际体验上推理质量和CPU速度仍不及传统4bit量化。

  • 让27B级模型能在消费级硬件(笔记本/手机)上运行,此前典型Qwen 27B在同级硬件上无法达到可用速度
  • 明显优于同量级的2bit量化版本(Q2_XXS)
  • 实际质量不如4bit量化(Q4),困惑度显著更高(PPL 13.8 vs 7.3)
  • CPU上三元推理尚未优化,速度极低(0.7-0.8 tok/s),目前仅在GPU上有实用价值

可信度15项基准平均80.49分,MATH-500达99.20,AIME25达90.84

完整规格

规模
27B · 262k · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
apache-2.0 · 可商用
框架
mlx / llama.cpp
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1338.3k → 1047.6k · likes +13

观测时间线