Bonsai-8B-mlx-1bit (PrismML)
Apple Silicon 的 1-bit LLM,端侧极低内存推理
- Apple Silicon
仅 safetensors · 无 pickle 加载风险
社区实测
社区普遍认为 Bonsai-8B 作为端到端 1-bit 模型的技术验证意义大于实用价值——模型确实能跑且速度极快,但实际能力远逊于同规模常规模型。
- 验证了端到端 1-bit LLM 在 8B 规模上技术可行,模型体积约为 FP16 同等参数的 1/14
- 推理速度极快,在 GPU 上响应延迟显著低于常规量化模型
- 在 CPU 上使用 Q1_0_g128 量化版本输出为乱码,GPU 似乎是必要条件
- 实际能力远低于同规模常规模型(如 Gemma-4-E2B),不适合作为日常实用工具
- 三元(1.58-bit)版本表现甚至比 1-bit 版本更差
来源
1-bit models are here: PrismMLs Bonsai series of models - RedditBonsai-8B is MUCH dumber than Gemma-4-E2B : r/LocalLLaMAPrismML Bonsai-8B (Q1_0_g128) produces garbage output on CPU -- GPU appears to be required : r/LocalLLaMAShow HN: 1-Bit Bonsai, the First Commercially Viable 1-Bit LLMs | Hacker News
截至 2026-06-19
快速上手
pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit')