数据集 / 归档 / 2026-05-31

2026-05-31 数据集 (1)

KRAFTON / Raon-OpenTTS-Pool

多个公开英语语音语料库聚合而成的TTS训练数据集

8.46亿行 · 19.7 TB

  • 多模态
  • 语音合成
  • other · 待核

下载 10k · 收藏 25 · 2个月前更新

社区实测

首个同时公开模型权重与全量训练数据的大规模 TTS 项目,在可复现性上具有标杆意义,但数据量大、需额外过滤步骤才能达到论文指标。

  • 全量训练数据(510K 小时)与模型权重双开放,支持完全可复现的 TTS 训练
  • 在仅使用公开数据训练的 TTS 模型中取得有竞争力的 WER 与说话人相似度
  • Raon-OpenTTS-Pool 需经模型过滤管道得到 Raon-OpenTTS-Core 子集才能复现论文指标,直接使用原始 Pool 效果未经验证
  • 510K 小时数据量巨大,下载与预处理的计算与存储门槛高

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("KRAFTON/Raon-OpenTTS-Pool")

← 前一日 2026-05-30 · 后一日 2026-06-02 →