模型 / Bonsai-27B (Prism ML)

Bonsai-27B (Prism ML)

27B 1-bit 量化模型,面向笔记本与手机本地推理

作者
prism-ml
对位
对位 Qwen3.6-27B 及 Gemma-4-31B 的量化版
适合
本地隐私推理,笔记本/手机可用 / 262K 上下文,数学与编程任务
不适合
长期 agent 编码与多文件重构
入选理由
基于 Qwen3.6-27B 的 1-bit 量化,仅 3.9GB 即可运行 27B 推理,保留 89.5% 性能,适合笔记本和单卡,直接下载 GGUF 运行。
规模
27B · 262K · Q4 ~18GB / FP16 ~65GB
授权
Apache 2.0 · 需自查
框架
llama.cpp
血统
量化自 Qwen3.6-27B
国内访问
需代理
可信度
提供 whitepaper 与 llama.cpp 专用内核,15项 thinking 基准可复现

社区实测

能在小显存上跑得动 27B 量级、基础聊天和简单任务可用,但指令跟随和细节理解明显弱于同显存下的其他量化模型,不适合复杂工作流或编程场景。

  • 在 8GB/16GB 显存上加载并运行 27B 量级模型,显存门槛低
  • 基础聊天、写作等轻量任务可用,日常使用够用
  • 工具调用 JSON 格式基本不出错,不会因参数缺失或格式错误随机失败
  • 指令跟随和对细节的把控弱,常忽略 system prompt 中的关键要求,不如 Gemma 4 12B QAT 和 Qwen 3.6 35B A3B 可靠
  • 不适合复杂编程或多步自主工作流,输出常被截断且不返回完整结果,官方也声明 agentic coding 不是当前版本的重点目标
  • KV 缓存占用仍偏高,全精度下仅约 100k 上下文,Q8_0 下约 150k,限制了长上下文场景
  • dspark 投机解码与当前 PrismML 的 llama.cpp 分支存在兼容问题,预测长度被错误绑定到主模型上下文,导致 CUDA 内存分配暴涨
  • 在同显存条件下,实际表现不如 Qwen 3.6 27B Q2_K_XL 和 Gemma 4 12B QAT,预填充和解码速度也未达预期
  • 训练时在高难度类别上存在质量差距,二元版保留 89.5%、三元版保留 94.6% 的全精度基准平均水平

截至 2026-07-19

本形态显存 Q4 ~18GB / FP16 ~65GB · 国内 需代理 · 513 下载

快速上手

ollama run hf.co/prism-ml/Bonsai-27B-gguf

本形态源 ↗

下载动量

观测时间线

模型家族

查看全部家族 →