🏢IndexTeam / IndexTTS-2-Demo
自回归零样本TTS,支持精确时长控制与文本情感指令
- 基于自回归架构,支持两种生成模式:明确指定token数量精准控制时长,或自由生成保留输入韵律
- 零样本语音克隆,可参考任意说话人音频生成语音
- 通过微调Qwen3实现文本描述指令控制情感,可指定情绪类型(如高兴、悲伤)
- 在多个公开基准中词错误率(WER)、说话人相似度(SIM)和情感保真度均优于当时SOTA模型(来源[0][4])
- 模型组件包含Tortoise-TTS、XTTSv2、BigVGAN、Wenet、Icefall、MaskGCT、Seed-VC
为什么本地跑本地部署可避开云端延迟与数据隐私问题,完整试验时长控制、情感解耦等高阶功能,尤其适合中文零样本TTS场景。
- 英文及跨语言(中↔英)功能虽经论文验证,但英文社区实测较少,细节稳定性和边界场景待确认
- 情感强度过高时可能出现音色折损(用户报告[1])
- 不支持印地语、乌克兰语等非中英语言
- 当前无官方ONNX导出、训练脚本或精细语音标记(如停顿、重音)控制(社区请求[1])