模型 / GigaAM-Multilingual (ai-sage)

GigaAM-Multilingual (ai-sage)

70+语言语音识别,关注俄语、哈萨克语等小语种

作者 ai-sage

仓库标识ai-sage/GigaAM-Multilingual

显存未知许可 可商用任务 语音识别最近核对 2026-08-05

仅 safetensors · 无 pickle 加载风险

运行内存
权重格式未知,无法估算显存
运行时
transformers
下载
2,399

Hugging Face 源仓库 ↗

适合与不适合

入选理由
GigaAM Multilingual 是针对俄语及中亚低资源语音识别的开源模型,在中亚语言上大幅超越 Whisper、Seamless M4T。提供清晰的使用示例,但需本地运行 PyTorch 代码。
对位
对位 Whisper large v3,小语种 ASR 表现更优
适合
俄/哈/吉/乌语等小语种 ASR / 多语言语音转录服务
不适合
英语高精度 ASR

独立证据与社区反馈

2 个独立来源 · 另 2 官方/转载最近验证 2026-08-05

在哈萨克语、乌兹别克语、吉尔吉斯语等低资源语言上展现出领先的识别准确率,社区认可其基准测试结果

  • 为哈萨克语、乌兹别克语、吉尔吉斯语等低资源语言提供高质量的开源语音识别
  • 覆盖 70+ 语言的预训练基础模型,填补多语言 ASR 空白
  • GPU 推理时存在内存泄漏问题
  • 不支持 vllm/sglang 推理框架
  • 英文识别表现仅为中等水平
  • 缺少 safetensors 格式
  • 词级时间戳功能尚不完善

可信度在 Common Voice、FLEURS 及内部测试集上,俄/哈/吉/乌语 WER 优于 Whisper large v3

完整规格

规模
220M / 600M · 权重格式未知,无法估算显存
授权
mit · 可商用
框架
transformers
血统
量化自 GigaAM-Multilingual
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 174.9k → 193.8k · likes +11

观测时间线

模型家族

查看全部家族 →