SummFlow 2026-05-20 Hugging Face

XEUS (CMU WAVLab)

覆盖4000+语言的语音基础模型,供ASR/翻译微调

  • Apple Silicon
入选理由
需ESPnet代码运行,无现成API;仅有自引论文和基准,无社区复现;覆盖4000+语言,新架构SOTA
对位
对位MMS、XLS-R等跨语言语音模型
适合
多语言语音识别微调 / 语音翻译与语音tokenization
不适合
不微调直接用于生产ASR
规模
577M · 未知
授权
CC BY-NC-SA 4.0 · 不可商用
框架
espnet / pytorch / flash-attn
可信度
ML-SUPERB超越MMS/XLS-R,577M参数,100万小时预训练

社区实测

多语言语音预训练模型,HuggingFace 社区关注度中等(约 150 赞),ESPnet 生态用户群体为主要受众

  • 覆盖 4,057 种语言的大规模语音预训练
  • 开源发布检查点,支持 ESPnet 调用
  • 单语 SUPERB 基准上 4 项任务达到 SOTA
  • 核心代码仍在合并进 ESPnet 主仓库,尚未稳定
  • 需下游微调才能用于识别/翻译等具体任务,不可开箱即用

截至 2026-07-12

快速上手

python -c "from espnet2.tasks.ssl import SSLTask; model, _ = SSLTask.build_model_from_file(None, 'espnet/XEUS/checkpoint.pth', 'cuda')"