模型 / BitCPM-CANN-8B (OpenBMB)

BitCPM-CANN-8B (OpenBMB)

昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能

作者
openbmb
对位
对位 MiniCPM4 8B 全精度版
适合
昇腾NPU上低内存推理 / 1.58-bit 三元量化研究
不适合
需BF16全精度的场景
入选理由
支持GGUF和Transformers快速部署,首个昇腾NPU原生1.58-bit训练模型,性能保留超95%。
规模
8B · 最低 ~2.2GB · ternary(估算)
授权
apache-2.0 · 可商用
框架
transformers / llama.cpp / ollama
国内访问
需代理
可信度
11项基准平均保留95.7%全精度性能,推理内存减至1/6,QAT仅多5%训练开销,有GGUF

社区实测

首个原生 1.58-bit 训练的 Ascend NPU 大模型,社区实测反馈尚少,官方宣称支持端侧部署且兼容标准推理框架

  • 端侧部署:8B 模型可在手机、PC、车载设备上运行
  • 兼容标准推理框架:pseudo-quantized 格式可直接像全精度模型一样使用 Transformers/vLLM/SGLang
  • 社区反馈 safetensors 格式变体尚未提供
  • 模型卡缺少 base_model 元数据标注

截至 2026-06-21

本形态 ~2.2GB ternary · 国内 需代理 · 1,202 下载

快速上手

ollama create 从 https://huggingface.co/openbmb/BitCPM-CANN-8B-gguf 导入

本形态源 ↗

下载动量

30天下载 2.6k → 1.6k

观测时间线