IndexTTS-2
精准时长控制与情感表达的中文零样本TTS
仓库标识IndexTeam/IndexTTS-2
许可 需自查任务 语音合成最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
适合与不适合
- License未明确(unknown),商用需自行评估风险
- 显存需求较高:推荐参数(如80-200)需根据显存调整,4GB可尝试但可能受限
- 英文及跨语言效果论文有报但社区实测稀少,中文外场景效果不保证
- 无原生流式支持,完整生成耗时较长,不适合实时播报
独立证据与社区反馈
社区认为 IndexTTS-2 在情感控制和语音克隆方面令人印象深刻,但音频存在伪影、不支持流式输出,且宣传的精确时长控制实际未实现,整体口碑两极分化。
- 零样本语音克隆,效果被部分用户称为「最好的语音克隆」
- 通过情感向量手动调节合成语音的情感,被多位用户认为是实用且强大的功能(来源 [1][2])
- 采用 Apache 2.0 开源协议,安装相对简便,约 6GB 显存可运行
- 采用 Flow Matching,不支持流式输出
- 音频中容易出现伪影,部分用户反馈反复调整仍无法获得自然输出,不如 Higgs Audio 效果好
- 官方宣传的精确音频时长控制功能实际并未支持,令用户失望
- 在 ComfyUI 的 TTS Audio Suite 集成中,有用户反馈情感向量节点无法影响音频输入的情感特征
- 社区实测A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech : r/LocalLLaMA
- 社区实测I quite like IndexTTS2 personally, it does voice cloning and also lets you modul... | Hacker News
- 社区实测🌈 The new IndexTTS-2 model is now supported on TTS Audio Suite v4.9 with Advanced Emotion Control - ComfyUI
可信度由Bilibili团队开发,附论文(arXiv 2506.21619)、GitHub及HuggingFace/ModelScope开源,社区已有本地运行案例。
完整规格
下载动量
30天下载 9.7k → 9.8k · likes +3
在线体验
观测时间线
研究依据
以下论文与本条目存在经人工复核的直接关系。论文本身不构成对它的推荐。