Bonsai-8B-mlx-1bit (PrismML)
Apple Silicon 的 1-bit LLM,端侧极低内存推理
社区实测
社区评价两极分化:端侧推理速度确实很快,但实际问答质量明显不如同量级模型,体积优势也有限。
- 推理速度快,在 iPhone 17 Pro Max 上可达 44 tokens/s,适合端侧部署
- 模型体积小,1-bit 量化后约 782 MB–1.15 GB,可在消费级手机和桌面端本地运行
- 实际问答质量远不如 Gemma 4-E2B,被社区用户评价为「远比 Gemma 4 笨」
- 三元量化版本表现比 1-bit 版本更差,且体积反而比 Gemma 4 Q4_K_M 更大
- 与 Gemma 4 Q4_K_M 相比体积仅小约 29%,优势有限
来源
Bonsai 8b, a 1-bit model that killed Google's Gemma 4Show HN: 1-Bit Bonsai, the First Commercially Viable 1-Bit LLMs | Hacker NewsBonsai models are pure hype: Bonsai-8B is MUCH dumber than Gemma-4-E2BBonsai 1-Bit + Turboquant?
截至 2026-07-19
本形态 ~1.2GB 1-bit · 国内 需代理 · 15,022 下载
仅 safetensors · 无 pickle 加载风险
快速上手
pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit') 下载动量
30天下载 6.7k → 14k · likes +5