模型 / CrisperWhisper2.0-Large (nyralabs)

CrisperWhisper2.0-Large (nyralabs)

可控逐字/意图风格的多语言ASR,精准词级时间戳

作者 nyralabs

仓库标识nyralabs/CrisperWhisper2.0_large

~0.9GB 4-bit许可 需自查任务 语音识别最近核对 2026-08-05
格式
4-bit
文件
~0.8GB
运行内存
~0.9GB–1.2GB
运行时
ctranslate2
下载
1,829

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
可控逐字/意图转录,词级时间戳精度30ms,多语言,支持长音频无缝处理,适合需要高精度逐字记录的医疗与会议场景。注意许可证为非商业研究用途。
对位
对位OpenAI Whisper large-v3
适合
逐字转录(含填充词、重复) / 词级时间戳对齐与字幕生成
不适合
商业用途(需商业许可)

独立证据与社区反馈

1 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

独立来源不足,尚未形成社区共识:社区认可其作为本地化逐字 ASR 方案的能力,但普遍反映项目已不再活跃开发。

  • 多语言逐字识别,能够捕捉填充词等非流利现象
  • 本地离线运行,不依赖云端服务
  • 项目似乎已停止开发维护
  • 可能需要独立显卡才能运行

可信度Nyra Verbatim Speech Benchmark多语言平均F1 87.8,词边界误差29.6ms

完整规格

规模
1.55B · 30s音频窗口,长音频自动拼接 · 下载 ~0.8GB · 显存最低 ~0.9GB · 推荐 ~1.2GB · 4-bit(估算)
授权
非商业研究许可 · 需自查
框架
ctranslate2 / transformers
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 30.3k → 25.8k · likes +15

观测时间线