模型 / Ternary Bonsai 27B (prism-ml)

Ternary Bonsai 27B (prism-ml)

三元2-bit 27B开源模型,笔记本本地运行推理

作者
prism-ml
对位
对位 Qwen3.6-27B/Gemma-4-31B 低比特量化
适合
笔记本端27B推理(~26 tok/s) / 离线/隐私场景长文本理解
不适合
手机端部署与长链条代理编码
入选理由
三元量化使27B模型仅需7GB显存,笔记本上跑出95%全精度性能,适合本地部署大模型、隐私敏感场景和单GPU服务。
规模
27B · 262k · Q4 ~18GB / FP16 ~65GB
授权
apache-2.0 · 需自查
框架
mlx / llama.cpp
国内访问
需代理
可信度
15项基准平均80.49分,MATH-500达99.20,AIME25达90.84

社区实测

能在小显存设备上跑起来的 27B 级模型,日常聊天和简单任务可用,但指令遵循和细节理解明显不如同量级常规量化版本,不适合需要精确执行流程的生产力场景。

  • 可在 8GB VRAM 笔记本显卡上运行 27B 级模型,prefill ~600 t/s、decode ~30 t/s
  • 工具调用 JSON 格式不随机出错,遇到障碍能自主寻找替代方案
  • 数学和编程能力在同尺寸模型中表现突出,优于 Gemma 4 12B
  • 指令遵循能力弱,经常忽略细节要求,不按预设流程激活技能(约 10 次中仅 1 次自动执行)
  • 实际工作流体验不如同尺寸 Qwen 3.6 27B Q2_K_XL 量化版,也不如 Gemma 4 12B QAT
  • 三元版约 7.2GB 超出手机每应用 6GB iOS 内存限制,无法在手机上部署
  • 长程多文件 agentic coding 工作流暂不支持,官方明确标注为当前版本不擅长
  • 视觉能力显著弱于同尺寸竞品

截至 2026-07-19

本形态显存 Q4 ~18GB / FP16 ~65GB · 国内 需代理 · 6 下载

仅 safetensors · 无 pickle 加载风险

快速上手

llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf

本形态源 ↗

下载动量

观测时间线