模型 / Bonsai-8B-mlx-1bit (PrismML)

Bonsai-8B-mlx-1bit (PrismML)

Apple Silicon 的 1-bit LLM,端侧极低内存推理

作者
prism-ml
对位
对位 Qwen3-8B、Llama 3.1 8B 等全精度模型
适合
iPhone/Mac 本地隐私推理 / 移动端及边缘低功耗部署
不适合
需全精度浮点的高敏感任务
入选理由
提供Colab在线试用和MLX格式,5分钟可运行;下载量高;端到端1-bit量化,显著降低内存,核心创新。
规模
8B · 65k · 最低 ~1.2GB · 1-bit(估算)
授权
Apache-2.0 · 可商用
框架
mlx / llama.cpp / mlx-swift
血统
量化自 Bonsai-8B-unpacked
国内访问
需代理
可信度
下载量 15k+,平均分 70.5 接近全精度 8B,内存仅 1.28 GB

社区实测

社区评价两极分化:端侧推理速度确实很快,但实际问答质量明显不如同量级模型,体积优势也有限。

  • 推理速度快,在 iPhone 17 Pro Max 上可达 44 tokens/s,适合端侧部署
  • 模型体积小,1-bit 量化后约 782 MB–1.15 GB,可在消费级手机和桌面端本地运行
  • 实际问答质量远不如 Gemma 4-E2B,被社区用户评价为「远比 Gemma 4 笨」
  • 三元量化版本表现比 1-bit 版本更差,且体积反而比 Gemma 4 Q4_K_M 更大
  • 与 Gemma 4 Q4_K_M 相比体积仅小约 29%,优势有限

截至 2026-07-19

本形态 ~1.2GB 1-bit · 国内 需代理 · 15,022 下载

仅 safetensors · 无 pickle 加载风险

快速上手

pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit')

本形态源 ↗

下载动量

30天下载 6.7k → 14k · likes +5

观测时间线