指南 / 语音合成模型

语音合成模型

共 15 个 · 数据更新于 2026-07-10

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

中文 TTS 开源模型怎么选(2026-07)

13 张支持中文的开源语音合成模型卡,按使用场景挑重点,不用你一张张翻。

阅读完整指南 →

模型参数量显存门槛上下文许可证商用语言国内可达部署
Gepard-1.0 (nineninesix)
微调自 qwen3_5-full-attn-only-14
555MQ4 ~0.4GB / FP16 ~1.3GBApache 2.0 (codec: NVIDIA Open Model License)需自查英语(美/英) · 西班牙语(墨) · 葡萄牙语(巴西) · 荷兰语需代理vllm serve nineninesix/gepard-1.0
Kokoro-82M (hexgrad)
微调自 StyleTTS2-LJSpeech
82MQ4 ~0.1GB / FP16 ~0.2GBapache-2.0需自查8 种语言需代理pip install kokoro && python -c "from kokoro import KPipeline; KPipeline('a'); print('Kokoro loaded')"
Higgs TTS 3 (Boson AI) 4BQ4 ~3.1GB / FP16 ~11GB8192boson-higgs-audio-v3-research-and-non-commercial-license需自查100+ 语种 (含中/英/日/韩/阿拉伯等85种<5% WER)需代理sgl-omni serve --model-path bosonai/higgs-tts-3-4b --port 8000 等 3 种
MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS) 4.6BQ4 ~3GB / FP16 ~11GBApache-2.0需自查31种语言 (含中·粤·英·日·韩·法·德·西等)魔搭可用python -c "from transformers import AutoModel; model = AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5', trust_remote_code=True)" 等 2 种
Inflect-Nano-v1 (owensong) 4.63MApache-2.0需自查英文需代理git clone https://huggingface.co/owensong/Inflect-Nano-v1 && cd Inflect-Nano-v1 && pip install -r requirements.txt && python inference.py --text 'Hello, world.' --out output.wav 等 2 种
ZONOS2 (Zyphra) apache-2.0可商用英语(主)·中文(主)·日语(主) · 韩/俄/意/葡/法/西/越/德/希伯来/荷兰/瑞典等 32 语种需代理git clone https://github.com/Zyphra/ZONOS2 && cd ZONOS2 && uv sync && uv run python -m minisgl --model-path Zyphra/ZONOS2 --tts-default-voices-dir ./default_voices/(需 NVIDIA GPU, Linux)
Higgs-Audio-v3-TTS-4B (Boson AI) 4BQ4 ~3.1GB / FP16 ~11GB8kBoson Research & Non-Commercial License需自查100+语言,含中、英、日、韩、法、德等83种高质量语种需代理sgl-omni serve --model-path bosonai/higgs-audio-v3-tts-4b 等 2 种
MisoTTS-8B (MisoLabs) 8BQ4 ~5.4GB / FP16 ~20GB2048other需自查未声明需代理git clone https://github.com/MisoLabsAI/MisoTTS && cd MisoTTS && pip install -r requirements.txt 等 2 种
Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen) 1.7BQ4 ~1.3GB / FP16 ~4.6GBApache-2.0可商用魔搭可用pip install qwen-tts && python -c 'from qwen_tts import Qwen3TTSModel; model=Qwen3TTSModel.from_pretrained("Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice", device_map="cuda:0")' 等 3 种
MOSS-TTS-v1.5 (OpenMOSS) 8.5BQ4 ~5.6GB / FP16 ~20GBApache-2.0可商用魔搭可用transformers.AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-v1.5') 等 2 种
Irodori-TTS-500M-v3 (Aratako)
微调自 Irodori-TTS-500M-v2
500MQ4 ~0.3GB / FP16 ~1.2GBMIT可商用需代理git clone https://github.com/Aratako/Irodori-TTS
Dramabox (ResembleAI)
微调自 LTX-2.3
不适用other需代理snapshot_download('ResembleAI/Dramabox') 等 2 种
OmniVoice (k2-fsa)
微调自 Qwen3-0.6B
613MQ4 ~0.4GB / FP16 ~1.5GB不适用apache-2.0可商用需代理pip install omnivoice
scenema-audio (ScenemaAI) other需代理huggingface-cli download ScenemaAI/scenema-audio 等 2 种
Supertonic 3 (Supertone) 99MOpenRAIL-M限制商用需代理pip install supertonic

常见坑

  • 训练数据主要来自 OpenAI 和 ElevenLabs 的合成输出,存在潜在版权与许可风险 —— hexgrad/Kokoro-82M
  • 对长叙事文本表现优于日常对话,对话场景下自然度可能不足 —— hexgrad/Kokoro-82M
  • 需要 espeak 作为系统依赖处理 OOD 回退及部分非英语语言,增加部署复杂度 —— hexgrad/Kokoro-82M
  • 最快的推理配置不一定是最佳音质,需在速度与质量之间权衡 —— hexgrad/Kokoro-82M
  • 现有托管 API 服务较少,不易找到现成的云端调用方案 —— hexgrad/Kokoro-82M
  • 全精度模型需 18-20GB 显存,8GB 显卡无法运行完整模式 —— bosonai/higgs-tts-3-4b
  • 8GB 显卡即使使用量化版本(QT8/QT4)也较慢,需借助 CPU 内存卸载 —— bosonai/higgs-tts-3-4b
  • 长文本批量生成时可能出现缺词,需用 STT 逐条校验 —— bosonai/higgs-tts-3-4b
展开其余 32 条
  • 8GB 显卡无法使用声音克隆功能 —— bosonai/higgs-tts-3-4b
  • 参考 Python 推理代码速度仅 RTF ~2(约 50% 实时),本地实时使用有压力 —— OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
  • 服务化部署复杂,需处理参考音频编码、自回归生成、多码本采样与有状态解码器等多阶段流水线 —— OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
  • 音质存在可感知的缺陷,非生产级/非 SOTA —— owensong/Inflect-Nano-v1
  • 目前仅为实验性发布,作者表示若有足够关注才考虑加大训练预算做 v2 —— owensong/Inflect-Nano-v1
  • 免费额度仅 100 分钟/月,重度使用不够 —— Zyphra/ZONOS2
  • 生成偶尔不稳定,可能出现错误(官方自述 'sometimes unreliable in generations') —— Zyphra/ZONOS2
  • 仅限研究与非商业用途 —— bosonai/higgs-audio-v3-tts-4b
  • 部分语言(如日语)的实际表现需自行验证 —— bosonai/higgs-audio-v3-tts-4b
  • 短文本也会出现幻觉/乱读,需通过减少大写等方式缓解但无法根除 —— MisoLabs/MisoTTS
  • 合成一致性不足,同一段话容易出现偏离 —— MisoLabs/MisoTTS
  • 作为 8B 参数模型,实际表现让人觉得训练不充分 —— MisoLabs/MisoTTS
  • 推理速度偏慢,有用户反馈生成速度低 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • GPU 利用率仅约 12%,存在优化空间 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • 与 VibeVoice 相比表达力偏平淡/单调 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • VoiceDesign 模型设计的语音难以在下一次生成中保留复用 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • 社区反馈缺少阿拉伯语、越南语、荷兰语、罗马尼亚语、粤语等语言支持 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • 社区 faster 版本在 PyTorch ≤2.5.0 上 CUDA graph 捕获不可靠 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
  • 不指定语言标签时,部分语言质量可能相比 1.0 版本回退 —— OpenMOSS-Team/MOSS-TTS-v1.5
  • 生成质量对部署配置敏感,需调优才能达到最佳效果 —— OpenMOSS-Team/MOSS-TTS-v1.5
  • 使用 whisper 音频做参考时,因 emoji 标注的 conditioning 方式可能导致参考音复现度偏低 —— Aratako/Irodori-TTS-500M-v3
  • 实际推理需要 CUDA 或 ROCm GPU,纯 CPU 不实用 —— Aratako/Irodori-TTS-500M-v3
  • 新栏目内容被指为 AI 生成,非真人出演 —— ResembleAI/Dramabox
  • 部分用户因此取消订阅并寻求替代应用 —— ResembleAI/Dramabox
  • 语音克隆模式下无法通过文本提示调整语调,提示词仅对语音设计模式生效 —— k2-fsa/OmniVoice
  • 模型约 6.5GB,显存占用较大,需要与其他模型协调加载/卸载 —— k2-fsa/OmniVoice
  • 10 秒参考音频可能不足以捕捉情感变化,建议 30-60 秒以上以获得更可靠的音色、节奏和说话风格 —— k2-fsa/OmniVoice
  • 要获得最佳且最一致的克隆效果,需要用 45 分钟以上、包含丰富情感变化的音频进行微调 —— k2-fsa/OmniVoice
  • 8GB 或更低显存环境下,TTS 会自动卸载到 CPU 运行 —— k2-fsa/OmniVoice
  • 官方说明语音克隆是最稳定的模式,暗示其他模式可能稳定性不足 —— k2-fsa/OmniVoice
  • 原生克隆(native cloning)方案仍在探索替代路线,当前方案可能并非最终形态 —— ScenemaAI/scenema-audio
  • 社区关注度极低,缺乏独立验证与实测反馈 —— ScenemaAI/scenema-audio

收藏本页,或 订阅 RSS 追踪每日更新。