模型 / VibeVoice-ASR-BitNet (Microsoft)

VibeVoice-ASR-BitNet (Microsoft)

边缘CPU实时多语言语音识别,压缩至1.58GB

作者 microsoft

仓库标识microsoft/VibeVoice-ASR-BitNet

~0.2GB 4-bit许可 可商用任务 语音识别最近核对 2026-08-05
格式
4-bit
文件
~0.2GB
运行内存
~0.2GB–0.3GB
运行时
ggml
下载
1,219

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
微软开源的 ASR 模型 BitNet 量化版,提供 GGUF 格式,可在 CPU 上实时推理,适合边缘部署,支持多语言。
对位
对位 Whisper、SenseVoice 等开源ASR
适合
边缘设备实时语音转文字 / 多语言低延迟转录
不适合
追求最低字错率场景

独立证据与社区反馈

6 个独立来源 · 另 2 官方/转载最近验证 2026-08-05

BitNet 量化版在 CPU 上即可实时推理,内置说话人分离和长音频直通转录是核心差异化优势,实测比 Whisper.cpp 快 1.6-2.3 倍。但社区反馈存在识别效果两极分化,9B 大模型曾被微软下架且部署重、慢,非英语和会议场景 WER 仍偏高。

  • CPU 实时推理,无需 GPU,3 线程即可 RTF<1
  • 内置说话人分离(diarization),省去额外模型
  • 60 分钟长音频单次直通转录,无需切片
  • 比 Whisper.cpp 快 1.6-2.3 倍
  • 开源 MIT 许可
  • 结构化转录输出,包含 Who(说话人)、When(时间戳)、What(内容)
  • 支持自定义热词
  • 有 ComfyUI 封装可用
  • 部分用户反馈识别效果很差
  • 9B 大模型曾被微软从 GitHub/HuggingFace 下架,获取不便
  • 9B 版本重且慢
  • 非英语 WER 明显高于英语,如葡萄牙语 24.87、越南语 22.38
  • AISHELL4 中文会议场景 WER 达 27.45,弱于 SenseVoice 和 FunASR
  • 单线程 RTF 达 1.98,未达实时

可信度微软研究发布,2.9×压缩,3线程CPU实时转写

完整规格

规模
323M · 下载 ~0.2GB · 显存最低 ~0.2GB · 推荐 ~0.3GB · 4-bit(估算)
授权
MIT · 可商用
框架
ggml
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 18k → 12.9k · likes +28

在线体验

观测时间线

研究依据

以下论文与本条目存在经人工复核的直接关系。论文本身不构成对它的推荐。

  • 本论文提出了它

    VibeVoice-ASR-BitNet Technical Report

    发表 2026-07-23· 站内条目与论文公开的资产逐字对应、官方资产页即论文产物、论文明确点名该资产