数据集 / google / WaxalNLP

google / WaxalNLP

非洲语言的多语种语音数据,用于语音识别与合成

HF 源仓库 ↗本站资料更新 2026-07-06

关键规格

作者
google
规模
167.3万行 · 3.5 TB
模态
多模态
任务
语音识别 / 语音合成
授权
cc-by-sa-4.0 · 许可标注允许商用
语种
已标注 29 种
查看全部 29 种
  • ach
  • aka
  • amh
  • bau
  • dag
  • dga
  • ewe
  • fat
  • ful
  • hau
  • ibo
  • kik
  • kpo
  • lin
  • lug
  • luo
  • mas
  • mlg
  • nyn
  • orm
  • pcm
  • sid
  • sna
  • sog
  • swa
  • tir
  • twi
  • wal
  • yor
HF 热度35,070 下载 · 246 收藏观测于 2026-07-06
源仓库更新2026-06-11

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

采用判断

项目方资料核对 · 2 个来源 · 核验于 2026-07-22

数据集以CC-BY-4.0许可发布,适合非洲语言语音技术研发,但ASR部分为图像提示语音,领域覆盖有限,且官方来源间语言数与时长统计存在版本差异,采用前需确认实际覆盖范围。[1][2]

适合用来

  • 非洲语言自动语音识别模型训练与评估[1][2]
  • 非洲语言语音合成模型训练[1][2]

采用前注意

  • ASR数据为图像提示的自然语音(image-prompted natural speech),语音内容局限于图像描述场景,非开放域日常对话,领域覆盖偏窄,可能影响模型在通用对话场景下的表现[1]
  • 官方论文与官方博客对覆盖语种数、数据时长的统计不一致:论文称24语种/约1250小时ASR与235小时TTS,博客称27语种/约1846小时ASR与565小时TTS,采用前需确认实际版本对应的数据规模[1][2]

历史记录

1 次历史卡片 · 2026-07-06