模型 / BitCPM-CANN-8B (OpenBMB)

BitCPM-CANN-8B (OpenBMB)

昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能

作者 openbmb

仓库标识openbmb/BitCPM-CANN-8B

~2.2GB ternary许可 可商用任务 文本生成最近核对 2026-08-05
格式
ternary
文件
~1.9GB
运行内存
~2.2GB–2.8GB
运行时
transformers
下载
1,202

Hugging Face 源仓库 ↗

适合与不适合

入选理由
支持GGUF和Transformers快速部署,首个昇腾NPU原生1.58-bit训练模型,性能保留超95%。
对位
对位 MiniCPM4 8B 全精度版
适合
昇腾NPU上低内存推理 / 1.58-bit 三元量化研究
不适合
需BF16全精度的场景

独立证据与社区反馈

2 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

首个在昇腾NPU上完成端到端1.58bit三元训练的完整管线,推理阶段相比BF16可释放约6倍内存收益

  • 大模型在端侧/手机设备上因内存不足无法部署的问题,8B参数模型可在主流旗舰手机上运行
  • 在国产昇腾NPU等非NVIDIA硬件上完成大模型低比特训练,降低对受限硬件的依赖
  • 基准测试分数随模型规模或量化位宽降低而递减,1.58bit量化在部分任务上相比全精度仍有能力损失

可信度11项基准平均保留95.7%全精度性能,推理内存减至1/6,QAT仅多5%训练开销,有GGUF

完整规格

规模
8B · 下载 ~1.9GB · 显存最低 ~2.2GB · 推荐 ~2.8GB · ternary(估算)
授权
apache-2.0 · 可商用
框架
transformers / llama.cpp / ollama
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 10.1k → 3k · likes +2

观测时间线