指南 / 中文 TTS 开源模型怎么选(2026-07)
中文 TTS 开源模型怎么选(2026-07)
13 张支持中文的开源语音合成模型卡,按使用场景挑重点,不用你一张张翻。
编辑推荐
这页覆盖站内全部 13 张能生成中文语音的开源 TTS 模型——6 张自带 key_info.tts 字段,另外 7 张(MOSS-TTS-v1.5、OmniVoice 等)因早期卡片版本缺该字段,靠 pipeline_tag 兜底纳入。下方 picks 按场景挑了几个重点,其余看表格;显存/语言/许可证以 key_info 为准,和社区实测冲突时以实测为准。
- 综合验证最广泛/低延迟对话 Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen)
HF 下载 182 万、点赞 1548,是本页体量最大的社区验证;key_info.commercial_use 标注可商用,community.solves 明确列出支持中文等 10 种主流语言,适合低延迟(97ms)语音交互场景。
- 多语种表现力/情感可控 Higgs TTS 3 (Boson AI)
why_trust 提到 SeedTTS/CV3 等 4 项基准 WER 最低,key_info.tts.languages 明确含中文(100+ 语种含中/英/日/韩/阿拉伯等85种<5% WER);但许可证是 boson-higgs-audio-v3-research-and-non-commercial-license,commercial_use 标注需自查,不能直接商用。
- 轻量/CPU 友好可商用 OmniVoice (k2-fsa)
key_info.size 仅 613M、license 为 apache-2.0(可商用);community.solves 提到"基于 Qwen3-0.6B,可在消费级硬件上运行",watch_outs 也确认"8GB 或更低显存环境下,TTS 会自动卸载到 CPU 运行",是本页对硬件最友好的选项。
- 可商用长文本/多语言克隆 MOSS-TTS-v1.5 (OpenMOSS)
key_info.commercial_use 标注可商用(Apache-2.0),hf_raw.tags 含 zh/yue 等语言标签;community.solves 提到"提供基于 llama.cpp/GGML 的 torch-free 推理路径,降低 Python 环境部署门槛",但 watch_outs 也提醒"语音克隆效果对参考音频质量极为敏感"。
全部候选对比
| 模型 | 参数量 | 显存门槛 | 许可证 | 商用 | 语言 | 国内可达 | 部署 |
|---|---|---|---|---|---|---|---|
| Kokoro-82M (hexgrad) | 82M | Q4 ~0.1GB / FP16 ~0.2GB | apache-2.0 | 需自查 | 8 种语言 | 需代理 | pip install kokoro && python -c "from kokoro import KPipeline; KPipeline('a'); print('Kokoro loaded')" |
| OmniVoice (k2-fsa) | 613M | Q4 ~0.4GB / FP16 ~1.5GB | apache-2.0 | 可商用 | — | 需代理 | pip install omnivoice |
| Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen) | 1.7B | Q4 ~1.3GB / FP16 ~4.6GB | Apache-2.0 | 可商用 | — | 魔搭可用 | pip install qwen-tts && python -c 'from qwen_tts import Qwen3TTSModel; model=Qwen3TTSModel.from_pretrained("Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice", device_map="cuda:0")' / qwen-tts-demo Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice --ip 0.0.0.0 --port 8000 / modelscope download --model Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice --local_dir ./local_model |
| Higgs TTS 3 (Boson AI) | 4B | Q4 ~3.1GB / FP16 ~11GB | boson-higgs-audio-v3-research-and-non-commercial-license | 需自查 | 100+ 语种 (含中/英/日/韩/阿拉伯等85种<5% WER) | 需代理 | sgl-omni serve --model-path bosonai/higgs-tts-3-4b --port 8000 / vllm-omni serve bosonai/higgs-tts-3-4b --host 0.0.0.0 --port 8095 --trust-remote-code --omni / Boson AI API (https://docs.boson.ai/models/higgs-audio-tts/overview) |
| MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS) | 4.6B | Q4 ~3GB / FP16 ~11GB | Apache-2.0 | 需自查 | 31种语言 (含中·粤·英·日·韩·法·德·西等) | 魔搭可用 | python -c "from transformers import AutoModel; model = AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5', trust_remote_code=True)" / python -c "from modelscope import AutoModel; model = AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5', trust_remote_code=True)" |
| MOSS-TTS-v1.5 (OpenMOSS) | 8.5B | Q4 ~5.6GB / FP16 ~20GB | Apache-2.0 | 可商用 | — | 魔搭可用 | git clone https://github.com/OpenMOSS/MOSS-TTS.git && pip install -e . / transformers.AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-v1.5') |
| Gepard-1.0 (nineninesix) | 555M | Q4 ~0.4GB / FP16 ~1.3GB | Apache 2.0 (codec: NVIDIA Open Model License) | 需自查 | 英语(美/英) · 西班牙语(墨) · 葡萄牙语(巴西) · 荷兰语 | 需代理 | vllm serve nineninesix/gepard-1.0 |
| Dramabox (ResembleAI) | — | — | other | — | — | 需代理 | huggingface-cli download ResembleAI/Dramabox / snapshot_download('ResembleAI/Dramabox') |
| Higgs-Audio-v3-TTS-4B (Boson AI) | 4B | Q4 ~3.1GB / FP16 ~11GB | Boson Research & Non-Commercial License | 需自查 | 100+语言,含中、英、日、韩、法、德等83种高质量语种 | 需代理 | sgl-omni serve --model-path bosonai/higgs-audio-v3-tts-4b / Boson AI API (https://docs.boson.ai/models/higgs-audio-tts/overview) |
| scenema-audio (ScenemaAI) | — | — | other | — | — | 需代理 | huggingface-cli download ScenemaAI/scenema-audio / git clone https://huggingface.co/ScenemaAI/scenema-audio |
| ZONOS2 (Zyphra) | — | — | apache-2.0 | 可商用 | 英语(主)·中文(主)·日语(主) · 韩/俄/意/葡/法/西/越/德/希伯来/荷兰/瑞典等 32 语种 | 需代理 | git clone https://github.com/Zyphra/ZONOS2 && cd ZONOS2 && uv sync && uv run python -m minisgl --model-path Zyphra/ZONOS2 --tts-default-voices-dir ./default_voices/(需 NVIDIA GPU, Linux) |
| MisoTTS-8B (MisoLabs) | 8B | Q4 ~5.4GB / FP16 ~20GB | other | 需自查 | 未声明 | 需代理 | git clone https://github.com/MisoLabsAI/MisoTTS && cd MisoTTS && pip install -r requirements.txt / huggingface-cli download MisoLabs/MisoTTS --local-dir ./weights |
| Inflect-Nano-v1 (owensong) | 4.63M | — | Apache-2.0 | 需自查 | 英文 | 需代理 | git clone https://huggingface.co/owensong/Inflect-Nano-v1 && cd Inflect-Nano-v1 && pip install -r requirements.txt && python inference.py --text 'Hello, world.' --out output.wav / git clone https://huggingface.co/owensong/Inflect-Nano-v1 && cd Inflect-Nano-v1 && pip install -r requirements.txt && python app.py |
常见坑
- 仅限研究与非商业用途 —— bosonai/higgs-audio-v3-tts-4b
- 部分语言(如日语)的实际表现需自行验证 —— bosonai/higgs-audio-v3-tts-4b
- 全精度模型需 18-20GB 显存,8GB 显卡无法运行完整模式 —— bosonai/higgs-tts-3-4b
- 8GB 显卡即使使用量化版本(QT8/QT4)也较慢,需借助 CPU 内存卸载 —— bosonai/higgs-tts-3-4b
- 长文本批量生成时可能出现缺词,需用 STT 逐条校验 —— bosonai/higgs-tts-3-4b
- 8GB 显卡无法使用声音克隆功能 —— bosonai/higgs-tts-3-4b
- 训练数据主要来自 OpenAI 和 ElevenLabs 的合成输出,存在潜在版权与许可风险 —— hexgrad/Kokoro-82M
- 对长叙事文本表现优于日常对话,对话场景下自然度可能不足 —— hexgrad/Kokoro-82M
- 需要 espeak 作为系统依赖处理 OOD 回退及部分非英语语言,增加部署复杂度 —— hexgrad/Kokoro-82M
- 最快的推理配置不一定是最佳音质,需在速度与质量之间权衡 —— hexgrad/Kokoro-82M
- 现有托管 API 服务较少,不易找到现成的云端调用方案 —— hexgrad/Kokoro-82M
- 语音克隆模式下无法通过文本提示调整语调,提示词仅对语音设计模式生效 —— k2-fsa/OmniVoice
- 模型约 6.5GB,显存占用较大,需要与其他模型协调加载/卸载 —— k2-fsa/OmniVoice
- 10 秒参考音频可能不足以捕捉情感变化,建议 30-60 秒以上以获得更可靠的音色、节奏和说话风格 —— k2-fsa/OmniVoice
- 要获得最佳且最一致的克隆效果,需要用 45 分钟以上、包含丰富情感变化的音频进行微调 —— k2-fsa/OmniVoice
- 8GB 或更低显存环境下,TTS 会自动卸载到 CPU 运行 —— k2-fsa/OmniVoice
- 官方说明语音克隆是最稳定的模式,暗示其他模式可能稳定性不足 —— k2-fsa/OmniVoice
- 短文本也会出现幻觉/乱读,需通过减少大写等方式缓解但无法根除 —— MisoLabs/MisoTTS
- 合成一致性不足,同一段话容易出现偏离 —— MisoLabs/MisoTTS
- 作为 8B 参数模型,实际表现让人觉得训练不充分 —— MisoLabs/MisoTTS
- 参考 Python 推理代码速度仅 RTF ~2(约 50% 实时),本地实时使用有压力 —— OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
- 服务化部署复杂,需处理参考音频编码、自回归生成、多码本采样与有状态解码器等多阶段流水线 —— OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
- 不指定语言标签时,部分语言质量可能相比 1.0 版本回退 —— OpenMOSS-Team/MOSS-TTS-v1.5
- 生成质量对部署配置敏感,需调优才能达到最佳效果 —— OpenMOSS-Team/MOSS-TTS-v1.5
- 音质存在可感知的缺陷,非生产级/非 SOTA —— owensong/Inflect-Nano-v1
- 目前仅为实验性发布,作者表示若有足够关注才考虑加大训练预算做 v2 —— owensong/Inflect-Nano-v1
- 推理速度偏慢,有用户反馈生成速度低 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- GPU 利用率仅约 12%,存在优化空间 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- 与 VibeVoice 相比表达力偏平淡/单调 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- VoiceDesign 模型设计的语音难以在下一次生成中保留复用 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- 社区反馈缺少阿拉伯语、越南语、荷兰语、罗马尼亚语、粤语等语言支持 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- 社区 faster 版本在 PyTorch ≤2.5.0 上 CUDA graph 捕获不可靠 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- 新栏目内容被指为 AI 生成,非真人出演 —— ResembleAI/Dramabox
- 部分用户因此取消订阅并寻求替代应用 —— ResembleAI/Dramabox
- 原生克隆(native cloning)方案仍在探索替代路线,当前方案可能并非最终形态 —— ScenemaAI/scenema-audio
- 社区关注度极低,缺乏独立验证与实测反馈 —— ScenemaAI/scenema-audio
- 免费额度仅 100 分钟/月,重度使用不够 —— Zyphra/ZONOS2
- 生成偶尔不稳定,可能出现错误(官方自述 'sometimes unreliable in generations') —— Zyphra/ZONOS2
- 表内 vram 数字是参数量化估算公式给出的,TTS/语音模型实际占用可能明显更高——例如 k2-fsa/OmniVoice 结构化字段写 Q4 约 0.4GB,但 community 实测真实占用约 6.5GB 且 8GB 以下会自动切到 CPU,请以社区实测或自行测试结果为准,而不是只看这一列数字。
常见问题
- 4GB 显存能跑中文 TTS 吗?
- 能,但要挑型号。owensong/Inflect-Nano-v1(4.63M 参数)、Aratako/Irodori-TTS-500M-v3(key_info.vram 约 Q4 0.3GB)体积很小;k2-fsa/OmniVoice 结构化字段写 Q4 约 0.4GB,但社区实测真实占用约 6.5GB、且 8GB 以下会自动切到 CPU 运行——遇到这类冲突以社区实测为准,4GB 显存更适合体积确定更小的那几个。
- 想要可商用的中文 TTS 模型怎么选?
- 表内 key_info.commercial_use 标注"可商用"的有 k2-fsa/OmniVoice、Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice、OpenMOSS-Team/MOSS-TTS-v1.5、Zyphra/ZONOS2、Aratako/Irodori-TTS-500M-v3(日语专精);Boson AI 的 Higgs 系列和 MOSS-TTS-Local-Transformer-v1.5 都标注"需自查",商用前请自行核对许可证条款。
- 完全没有 GPU,只用 CPU 能跑吗?
- Supertone/supertonic-3 是 ONNX 模型,community.solves 确认可离线、无需 GPU 运行(99M 参数);k2-fsa/OmniVoice 在 8GB 以下显存环境也会自动退回 CPU,但速度会下降。