SummFlow 2026-05-20 Hugging Face

Bonsai-8B-mlx-1bit (PrismML)

Apple Silicon 的 1-bit LLM,端侧极低内存推理

  • Apple Silicon
入选理由
提供Colab在线试用和MLX格式,5分钟可运行;下载量高;端到端1-bit量化,显著降低内存,核心创新。
对位
对位 Qwen3-8B、Llama 3.1 8B 等全精度模型
适合
iPhone/Mac 本地隐私推理 / 移动端及边缘低功耗部署
不适合
需全精度浮点的高敏感任务
规模
8B · 65k · Q4 ~0.3GB / FP16 ~0.9GB
授权
Apache-2.0 · 可商用
框架
mlx / llama.cpp / mlx-swift
血统
量化自 Bonsai-8B-unpacked
可信度
下载量 15k+,平均分 70.5 接近全精度 8B,内存仅 1.28 GB

仅 safetensors · 无 pickle 加载风险

社区实测

社区普遍认为 Bonsai-8B 作为端到端 1-bit 模型的技术验证意义大于实用价值——模型确实能跑且速度极快,但实际能力远逊于同规模常规模型。

  • 验证了端到端 1-bit LLM 在 8B 规模上技术可行,模型体积约为 FP16 同等参数的 1/14
  • 推理速度极快,在 GPU 上响应延迟显著低于常规量化模型
  • 在 CPU 上使用 Q1_0_g128 量化版本输出为乱码,GPU 似乎是必要条件
  • 实际能力远低于同规模常规模型(如 Gemma-4-E2B),不适合作为日常实用工具
  • 三元(1.58-bit)版本表现甚至比 1-bit 版本更差

截至 2026-06-19

快速上手

pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit')