模型 / GigaAM-Multilingual (ai-sage)

GigaAM-Multilingual (ai-sage)

70+语言语音识别,关注俄语、哈萨克语等小语种

作者
ai-sage
对位
对位 Whisper large v3,小语种 ASR 表现更优
适合
俄/哈/吉/乌语等小语种 ASR / 多语言语音转录服务
不适合
英语高精度 ASR
入选理由
GigaAM Multilingual 是针对俄语及中亚低资源语音识别的开源模型,在中亚语言上大幅超越 Whisper、Seamless M4T。提供清晰的使用示例,但需本地运行 PyTorch 代码。
规模
220M / 600M · Q4 ~0.1GB / FP16 ~0.5GB
授权
mit · 需自查
框架
transformers
血统
量化自 GigaAM-Multilingual
国内访问
需代理
可信度
在 Common Voice、FLEURS 及内部测试集上,俄/哈/吉/乌语 WER 优于 Whisper large v3

仅 safetensors · 无 pickle 加载风险

本形态显存 Q4 ~0.1GB / FP16 ~0.5GB · 国内 需代理 · 2,399 下载

快速上手

python -c "from transformers import AutoModel; model=AutoModel.from_pretrained('ai-sage/GigaAM-Multilingual', revision='ctc', trust_remote_code=True); print(model.transcribe('example.wav'))"

本形态源 ↗

下载动量

观测时间线

模型家族

查看全部家族 →