Bonsai-27B (Prism ML)
27B 1-bit 量化模型,面向笔记本与手机本地推理
社区实测
能在小显存上跑得动 27B 量级、基础聊天和简单任务可用,但指令跟随和细节理解明显弱于同显存下的其他量化模型,不适合复杂工作流或编程场景。
- 在 8GB/16GB 显存上加载并运行 27B 量级模型,显存门槛低
- 基础聊天、写作等轻量任务可用,日常使用够用
- 工具调用 JSON 格式基本不出错,不会因参数缺失或格式错误随机失败
- 指令跟随和对细节的把控弱,常忽略 system prompt 中的关键要求,不如 Gemma 4 12B QAT 和 Qwen 3.6 35B A3B 可靠
- 不适合复杂编程或多步自主工作流,输出常被截断且不返回完整结果,官方也声明 agentic coding 不是当前版本的重点目标
- KV 缓存占用仍偏高,全精度下仅约 100k 上下文,Q8_0 下约 150k,限制了长上下文场景
- dspark 投机解码与当前 PrismML 的 llama.cpp 分支存在兼容问题,预测长度被错误绑定到主模型上下文,导致 CUDA 内存分配暴涨
- 在同显存条件下,实际表现不如 Qwen 3.6 27B Q2_K_XL 和 Gemma 4 12B QAT,预填充和解码速度也未达预期
- 训练时在高难度类别上存在质量差距,二元版保留 89.5%、三元版保留 94.6% 的全精度基准平均水平
来源
User experience of Bonsai-Ternary-27B on 4060Ti 16GB ...Bonsai-27B & Ternary-Bonsai-27B - Updates (on PRs) : r/LocalLLaMABonsai 27B - pretty useless for simple tasks - discussion
截至 2026-07-19
下载动量
观测时间线
模型家族
- Qwen3.6-27B
- 量化 Bonsai-27B (Prism ML)
- 量化 Bonsai-27B-mlx-1bit (Prism ML)
- 量化 Qwen3.6-27B (OBLITERATUS)
- LoRA Qwen3.6-27b-Fable5 (hotdogs)
- 量化 Qwen3.6-27B-GGUF (unsloth)
- 量化 Qwen3.6-27B-MTP-pi-tune (bytkim)
- 量化 Qwen3.6-27B-OptiQ-4bit (mlx-community)
- LoRA Qwopus3.6-27B-v2-MTP-GGUF (Jackrong)
- 量化 Ternary-Bonsai-27B (Prism ML)