模型 / IndexTTS-2

IndexTTS-2

精准时长控制与情感表达的中文零样本TTS

作者
IndexTeam
对位
相比其他中文TTS,在情感自然度和时长控制上优势明显,但英文/跨语言实测覆盖不足。
适合
视频配音与对口型(时长精确可控) / 有声书/播客的情感化生成 / 需要中文情感零样本克隆的创作场景
不适合
对延迟敏感的实时流式交互(如实时对话助手)或主要面向英文的场景。
商用
需自查
国内访问
魔搭可用
可信度
由Bilibili团队开发,附论文(arXiv 2506.21619)、GitHub及HuggingFace/ModelScope开源,社区已有本地运行案例。

社区实测

社区普遍认可其情感控制能力突出、声音克隆效果好,但对部分宣传功能(如精确时长控制)未兑现存在不满。

  • 通过情感向量、文本描述或参考音频实现细粒度情感控制
  • 单条参考音频即可完成零样本声音克隆
  • 支持中英文零样本跨语言合成
  • 完全本地化部署、开源免费
  • 宣传的精确音频时长控制功能实际未支持
  • 官方演示站点在发布初期未公开可访问

截至 2026-06-19

国内 魔搭可用 · 0 下载

快速上手

暂无已验证的一键部署命令,需参考官方GitHub仓库(https://github.com/index-tts/index-tts)手动安装

本形态源 ↗

下载动量

30天下载 15.4k → 15.2k · likes +18

观测时间线