SummFlow 2026-06-14 Hugging Face

ZONOS2 (Zyphra)

基于 MoE 的多语言 TTS,支持零样本克隆与流式生成

入选理由
云服务可直接试用高质量多语言TTS和语音克隆,适合创作者;本地部署需Linux+NVIDIA GPU。
对位
对位 CosyVoice 2 / F5-TTS 等开源 TTS
适合
零样本语音克隆与流式输出 / 中/英/日等多语种高保真合成
不适合
仅限 Linux+NVIDIA GPU
规模
未公开 · 未知
授权
apache-2.0 · 可商用
框架
Mini-SGLang
语种
英语(主)·中文(主)·日语(主) · 韩/俄/意/葡/法/西/越/德/希伯来/荷兰/瑞典等 32 语种
可信度
Apache-2.0 许可,训练数据逾 600 万小时,官方提供 Mini-SGLang 服务

社区实测

社区认为 Zonos 是质量接近 ElevenLabs/Cartesia 的开源 TTS,支持声音克隆且本地可跑,但 beta 阶段存在杂音/伪影问题,尚不能完全替代商业方案。

  • 开源高保真声音克隆 TTS,质量对标 Cartesia 与 ElevenLabs
  • 仅需 6GB VRAM 即可本地运行,降低硬件门槛
  • 支持情感控制与多语言,弥补 Kokoro 等开源模型缺乏声音克隆和情感表达的短板
  • 可用于语言学习等场景
  • beta 版本存在杂音/伪影(artifact)问题,部分用户因此无法完全切换
  • 免费额度仅 100 分钟/月,重度使用受限

截至 2026-06-19

快速上手

git clone https://github.com/Zyphra/ZONOS2 && cd ZONOS2 && uv sync && uv run python -m minisgl --model-path Zyphra/ZONOS2 --tts-default-voices-dir ./default_voices/(需 NVIDIA GPU, Linux)