指南 / 语音合成模型

语音合成模型

共 25 个 · 数据更新于 2026-09-12

中文 TTS 开源模型怎么选

面向要在本地合成中文语音的人:按语言、授权、运行资料是否齐全挑重点;不评音质,没跑过的不承诺。

阅读完整指南 →

优先看

以下是编辑复核后的起点,完整候选仍见下表。

中文语音合成

  1. IndexTTS-2

    精准时长控制与情感表达的中文零样本TTS

    • 中文支持经人工复核确认
    • 有可直接运行的部署命令
    • 有社区实测记录
  • 开源语音生成与编辑基础模型,支持零样本 TTS

    参数量
    1.5B
    商用
    可商用

    当前运行配置 tencent/AuK

    显存
    暂无估算
    查看详情
    查看运行方式
    python -m sglang_omni.cli serve --model-path tencent/AuK
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    语言
    未公开
    国内可达
    魔搭可用
  • 中英文实时TTS,支持语音克隆/设计/定向

    参数量
    3.5B
    商用
    需自查

    当前运行配置 BreezeBlue/Breeze-TTS-2

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    研究/非商业许可;代码 Apache-2.0
    语言
    英文 / 中文
    国内可达
    需代理
  • 0.17B 零样本语音克隆,中英为主多语种 TTS

    参数量
    0.17B
    商用
    需自查

    当前运行配置 Audio8/Audio8-TTS-Preview-0.1b

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Audio8 Community License v1.0
    上下文
    2048
    语言
    中文(主) · 英文(主) · 德 / 西 / 法 / 意 / 日 / 韩
    国内可达
    需代理
  • 零样本语音克隆,支持中英日西阿,单音频参考

    参数量
    0.8B
    商用
    需自查

    当前运行配置 IndexTeam/IndexTTS-2.5

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    bilibili-model-license
    语言
    中文 / 英文 / 日语 / 西班牙语 / 阿拉伯语
    国内可达
    魔搭可用
  • 多语种TTS,细粒度韵律/情感内联控制,80+语言

    参数量
    4B + 400M
    商用
    需自查

    当前运行配置 fishaudio/s2-pro

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    fish-audio-research-license
    语言
    日 / 英 / 中 (主) · 韩 / 西 / 葡 / 阿 / 俄 / 法 / 德等80+语言
    国内可达
    需代理
  • 0.6B多语言TTS,零样本语音克隆,支持11种语言

    参数量
    0.6B
    商用
    可商用

    当前运行配置 Audio8/Audio8-TTS-Preview-0.6b

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    2048
    语言
    粤语 / 中文 / 荷兰语 / 英语 / 法语 / 德语 / 意大利语 / 日语 / 韩语 / 波兰语 / 西班牙语
    国内可达
    需代理
  • 15语TTS GGUF,离线CPU运行

    参数量
    82M
    商用
    需自查

    当前运行配置 Nanthasit/sakthai-tts-model

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT (包装) / Apache 2.0 (Kokoro)
    上下文
    不适用
    语言
    英/日/中/韩/法/西/葡/意/德/波/俄/阿/印/孟/泰
    国内可达
    需代理
  • 4M参数本地英文TTS,CPU实时推理

    参数量
    3.97M
    商用
    可商用

    当前运行配置 owensong/Inflect-Nano-v2

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    不适用
    语言
    英文
    国内可达
    需代理
  • 9.36M 参数完整本地 TTS,固定男声英语言语合成

    参数量
    9.36M
    商用
    可商用

    当前运行配置 owensong/Inflect-Micro-v2

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    无限制(标点分块)
    语言
    英文
    国内可达
    需代理
  • Gepard-1.0 (nineninesix)

    微调自 qwen3_5-full-attn-only-14

    流式自回归 TTS,面向实时对话与语音代理

    参数量
    555M
    商用
    需自查

    当前运行配置 nineninesix/gepard-1.0

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve nineninesix/gepard-1.0
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0 (codec: NVIDIA Open Model License)
    语言
    英语(美/英) · 西班牙语(墨) · 葡萄牙语(巴西) · 荷兰语
    国内可达
    需代理
  • Kokoro-82M (hexgrad)

    微调自 StyleTTS2-LJSpeech

    82M 参数轻量 TTS 模型,支持多语言,可本地部署

    参数量
    82M
    商用
    可商用

    当前运行配置 hexgrad/Kokoro-82M

    显存
    暂无估算
    查看详情
    查看运行方式
    pip install kokoro && python -c "from kokoro import KPipeline; KPipeline('a'); print('Kokoro loaded')"
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    语言
    8 种语言
    国内可达
    需代理
  • 对话式语音合成,100+语种,零样本克隆与内联控制

    参数量
    4B
    商用
    需自查

    当前运行配置 bosonai/higgs-tts-3-4b

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    sgl-omni serve --model-path bosonai/higgs-tts-3-4b --port 8000

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    boson-higgs-audio-v3-research-and-non-commercial-license
    上下文
    8192
    语言
    100+ 语种 (含中/英/日/韩/阿拉伯等85种<5% WER)
    国内可达
    需代理
  • 零样本声音克隆多语言TTS模型,支持31种语言和本地部署

    参数量
    4.6B
    商用
    可商用

    当前运行配置 OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    python -c "from transformers import AutoModel; model = AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5', trust_remote_code=True)"

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    语言
    31种语言 (含中·粤·英·日·韩·法·德·西等)
    国内可达
    魔搭可用
  • 超小型英文TTS,总4.63M参数,适合本地/嵌入式实验

    参数量
    4.63M
    商用
    可商用

    当前运行配置 owensong/Inflect-Nano-v1

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    git clone https://huggingface.co/owensong/Inflect-Nano-v1 && cd Inflect-Nano-v1 && pip install -r requirements.txt && python inference.py --text 'Hello, world.' --out output.wav

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    语言
    英文
    国内可达
    需代理
  • 精准时长控制与情感表达的中文零样本TTS

    商用
    需自查

    当前运行配置 IndexTeam/IndexTTS-2

    显存
    暂无估算
    查看详情
    查看运行方式
    暂无已验证的一键部署命令,需参考官方GitHub仓库(https://github.com/index-tts/index-tts)手动安装
    为何暂无估算
    缺少可用的显存依据
    国内可达
    魔搭可用
  • 基于 MoE 的多语言 TTS,支持零样本克隆与流式生成

    商用
    可商用

    当前运行配置 Zyphra/ZONOS2

    显存
    暂无估算
    查看详情
    查看运行方式
    git clone https://github.com/Zyphra/ZONOS2 && cd ZONOS2 && uv sync && uv run python -m minisgl --model-path Zyphra/ZONOS2 --tts-default-voices-dir ./default_voices/(需 NVIDIA GPU, Linux)
    为何暂无估算
    缺少可用的显存依据
    许可证
    apache-2.0
    语言
    英语(主)·中文(主)·日语(主) · 韩/俄/意/葡/法/西/越/德/希伯来/荷兰/瑞典等 32 语种
    国内可达
    需代理
  • 语音对话TTS:100+语种、零样克隆、情感/风格内联控制

    参数量
    4B
    商用
    需自查

    当前运行配置 bosonai/higgs-audio-v3-tts-4b

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    sgl-omni serve --model-path bosonai/higgs-audio-v3-tts-4b

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Boson Research & Non-Commercial License
    上下文
    8k
    语言
    100+语言,含中、英、日、韩、法、德等83种高质量语种
    国内可达
    需代理
  • 基于 Sesame CSM 的对话 TTS 模型,支持语音上下文延续

    参数量
    8B
    商用
    需自查

    当前运行配置 MisoLabs/MisoTTS

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    git clone https://github.com/MisoLabsAI/MisoTTS && cd MisoTTS && pip install -r requirements.txt

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    other
    上下文
    2048
    语言
    未声明
    国内可达
    需代理
  • 指令式多语言TTS,流式延迟低至97ms,9音色

    参数量
    1.7B
    商用
    可商用

    当前运行配置 Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    pip install qwen-tts && python -c 'from qwen_tts import Qwen3TTSModel; model=Qwen3TTSModel.from_pretrained("Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice", device_map="cuda:0")'

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    魔搭可用
  • 零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。

    参数量
    8.5B
    商用
    可商用

    当前运行配置 OpenMOSS-Team/MOSS-TTS-v1.5

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    transformers.AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-v1.5')

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    魔搭可用
  • Irodori-TTS-500M-v3 (Aratako)

    微调自 Irodori-TTS-500M-v2

    日语TTS,表情符号控制风格,零样本克隆

    参数量
    500M
    商用
    可商用

    当前运行配置 Aratako/Irodori-TTS-500M-v3

    显存
    暂无估算
    查看详情
    查看运行方式
    git clone https://github.com/Aratako/Irodori-TTS
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • Dramabox (ResembleAI)

    微调自 LTX-2.3

    通用文本转语音,面向配音与有声内容制作者

    当前运行配置 ResembleAI/Dramabox

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    snapshot_download('ResembleAI/Dramabox')

    其它 1 种运行方式见详情页

    为何暂无估算
    缺少可用的显存依据
    许可证
    other
    上下文
    不适用
    国内可达
    需代理
  • OmniVoice (k2-fsa)

    微调自 Qwen3-0.6B

    为开发者提供600+语言零样本语音合成

    参数量
    613M
    商用
    可商用

    当前运行配置 k2-fsa/OmniVoice

    显存
    暂无估算
    查看详情
    查看运行方式
    pip install omnivoice
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    不适用
    国内可达
    需代理
  • 31种语言本地TTS,面向AI应用开发者的语音合成

    参数量
    99M
    商用
    限制商用

    当前运行配置 Supertone/supertonic-3

    显存
    暂无估算
    查看详情
    查看运行方式
    pip install supertonic
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    OpenRAIL-M
    国内可达
    需代理
  • TTS 模型,面向语音合成开发者

    当前运行配置 ScenemaAI/scenema-audio

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    huggingface-cli download ScenemaAI/scenema-audio

    其它 1 种运行方式见详情页

    为何暂无估算
    缺少可用的显存依据
    许可证
    other
    国内可达
    需代理

常见坑

  • 当前为预览版(Preview)检查点,语言覆盖和方言支持有限 —— Audio8/Audio8-TTS-Preview-0.6b
  • 参考音频过长、嘈杂或转录不准会降低合成稳定性和说话人相似度 —— Audio8/Audio8-TTS-Preview-0.6b
  • 需trust_remote_code=True加载,存在自定义代码安全审计需求 —— Audio8/Audio8-TTS-Preview-0.6b
  • 目前仅支持英文(英文音素前端) —— owensong/Inflect-Nano-v2
  • 当前模型音色单一,多语言和多音色尚在规划中 —— owensong/Inflect-Nano-v2
  • 独立开发者项目,后续更新依赖社区反馈和兴趣 —— owensong/Inflect-Nano-v2
  • 训练语料生成管线、私有过滤基础设施与完整优化配方未公开,可复现性受限 —— owensong/Inflect-Micro-v2
  • 固定单一音色,不可自定义语音 —— owensong/Inflect-Micro-v2
展开其余 50 条
  • 产品化集成前需评估局限性,不宜仅凭基准分数做决策 —— owensong/Inflect-Micro-v2
  • 以准确性换取速度,流式生成可能牺牲文本准确度 —— nineninesix/gepard-1.0
  • 训练数据主要来自 OpenAI 和 ElevenLabs 的合成输出,存在潜在版权与许可风险 —— hexgrad/Kokoro-82M
  • 对长叙事文本表现优于日常对话,对话场景下自然度可能不足 —— hexgrad/Kokoro-82M
  • 需要 espeak 作为系统依赖处理 OOD 回退及部分非英语语言,增加部署复杂度 —— hexgrad/Kokoro-82M
  • 最快的推理配置不一定是最佳音质,需在速度与质量之间权衡 —— hexgrad/Kokoro-82M
  • 现有托管 API 服务较少,不易找到现成的云端调用方案 —— hexgrad/Kokoro-82M
  • 全精度模型需 18-20GB 显存,8GB 显卡无法运行完整模式 —— bosonai/higgs-tts-3-4b
  • 8GB 显卡即使使用量化版本(QT8/QT4)也较慢,需借助 CPU 内存卸载 —— bosonai/higgs-tts-3-4b
  • 长文本批量生成时可能出现缺词,需用 STT 逐条校验 —— bosonai/higgs-tts-3-4b
  • 8GB 显卡无法使用声音克隆功能 —— bosonai/higgs-tts-3-4b
  • 生产级服务化部署难度较高,涉及多阶段推理链路 —— OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
  • 生成质量不及 VibeVoice Large —— OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
  • 音质机械、有金属感,韵律平淡,不适合沉浸式听感 —— owensong/Inflect-Nano-v1
  • 输出长度限制在约 15 秒 —— owensong/Inflect-Nano-v1
  • 仅支持单一英语男声,无多说话人、无声音克隆、无流式输出 —— owensong/Inflect-Nano-v1
  • 对长文本、罕见词、数字缩写等鲁棒性不足,独立合成片段拼接时连贯性差 —— owensong/Inflect-Nano-v1
  • License未明确(unknown),商用需自行评估风险 —— IndexTeam/IndexTTS-2
  • 显存需求较高:推荐参数(如80-200)需根据显存调整,4GB可尝试但可能受限 —— IndexTeam/IndexTTS-2
  • 英文及跨语言效果论文有报但社区实测稀少,中文外场景效果不保证 —— IndexTeam/IndexTTS-2
  • 无原生流式支持,完整生成耗时较长,不适合实时播报 —— IndexTeam/IndexTTS-2
  • 采用 Flow Matching,不支持流式输出 —— IndexTeam/IndexTTS-2
  • 音频中容易出现伪影,部分用户反馈反复调整仍无法获得自然输出,不如 Higgs Audio 效果好 —— IndexTeam/IndexTTS-2
  • 官方宣传的精确音频时长控制功能实际并未支持,令用户失望 —— IndexTeam/IndexTTS-2
  • 在 ComfyUI 的 TTS Audio Suite 集成中,有用户反馈情感向量节点无法影响音频输入的情感特征 —— IndexTeam/IndexTTS-2
  • 安装过程存在兼容性问题,依赖 nvidia-cuda-toolkit —— Zyphra/ZONOS2
  • RTX 5090 等新硬件不支持 —— Zyphra/ZONOS2
  • 推理速度慢 —— Zyphra/ZONOS2
  • 文本开头部分可能丢失 —— Zyphra/ZONOS2
  • 仅支持 Ubuntu 22.04 + NVIDIA GPU —— Zyphra/ZONOS2
  • 仅限研究和非商业用途,生产/商用/创收需额外获取商业许可 —— bosonai/higgs-audio-v3-tts-4b
  • 复杂发音(Complex Pronunciation)主观评测得分仅 25.10%,在对比模型中仍属短板 —— bosonai/higgs-audio-v3-tts-4b
  • 需 48 GB 显存级别显卡才能加载,消费级 GPU 可能无法运行 —— bosonai/higgs-audio-v3-tts-4b
  • TTS 输出一致性不足,极短文本也会产生幻觉 —— MisoLabs/MisoTTS
  • 有用户认为这类规模仍不够稳定,稳定性问题比想象中明显 —— MisoLabs/MisoTTS
  • 在未启用 FlashAttention 的情况下推理极慢,RTX 5090 上仅 0.3 倍实时速度,GPU 占用率仅 30% —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • 合成语音语速普遍偏快,无论参考语音如何,听起来都很急促 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • 语音克隆效果与原始音频存在可感知差异 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • Voice Design 模式的输出质量不适合用作训练数据 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • 8B v1.5 不支持流式输出,必须一次性发送整个音频,实时语音应用里耗时太长、不够快 —— OpenMOSS-Team/MOSS-TTS-v1.5
  • 实时场景只能改用更小的 MOSS-TTS-Realtime,8B 版本不适合实时生成 —— OpenMOSS-Team/MOSS-TTS-v1.5
  • 新专区的内容全部由 AI 生成,多名用户因此表示要取消订阅、寻找替代品。 —— ResembleAI/Dramabox
  • DramaBox 内容在 DramaFren 等约 18 个同类 App 中也有覆盖,独占性存疑。 —— ResembleAI/Dramabox
  • 部分场景下跳过或误读基础词汇,逗号后出现无法通过编辑修复的卡顿停顿 —— k2-fsa/OmniVoice
  • 有用户反馈音色克隆效果“像模仿”,VibeVoice 在某些情况下更自然 —— k2-fsa/OmniVoice
  • 降低 num_step 可提速但输出质量随之下降,需权衡速度与质量 —— k2-fsa/OmniVoice
  • 纯 CPU 推理性能受限,最佳体验依赖 GPU 加速 —— k2-fsa/OmniVoice
  • N100、Raspberry Pi 5 等低功耗设备的性能表现尚无社区实测数据 —— Supertone/supertonic-3
  • Supertone Shift 服务条款中用户内容是否用于产品改进的表述不够明确 —— Supertone/supertonic-3
  • 模型权重使用 LTX-2 Community License,非完全开放 —— ScenemaAI/scenema-audio

收藏本页,或 订阅 RSS 追踪每日更新。