此页是 2026-06-14 的观测快照,查看该模型当前信息 → /m/zyphra__zonos2/

归档 / 2026-06-14 / ZONOS2 (Zyphra)

ZONOS2 (Zyphra)

基于 MoE 的多语言 TTS,支持零样本克隆与流式生成

入选理由
云服务可直接试用高质量多语言TTS和语音克隆,适合创作者;本地部署需Linux+NVIDIA GPU。
对位
对位 CosyVoice 2 / F5-TTS 等开源 TTS
适合
零样本语音克隆与流式输出 / 中/英/日等多语种高保真合成
不适合
仅限 Linux+NVIDIA GPU
规模
未公开 · 未知
授权
apache-2.0 · 可商用
框架
Mini-SGLang
语种
英语(主)·中文(主)·日语(主) · 韩/俄/意/葡/法/西/越/德/希伯来/荷兰/瑞典等 32 语种
可信度
Apache-2.0 许可,训练数据逾 600 万小时,官方提供 Mini-SGLang 服务

社区实测

社区认为 Zonos 是质量接近 ElevenLabs/Cartesia 的开源 TTS,支持声音克隆且本地可跑,但 beta 阶段存在杂音/伪影问题,尚不能完全替代商业方案。

  • 开源高保真声音克隆 TTS,质量对标 Cartesia 与 ElevenLabs
  • 仅需 6GB VRAM 即可本地运行,降低硬件门槛
  • 支持情感控制与多语言,弥补 Kokoro 等开源模型缺乏声音克隆和情感表达的短板
  • 可用于语言学习等场景
  • beta 版本存在杂音/伪影(artifact)问题,部分用户因此无法完全切换
  • 免费额度仅 100 分钟/月,重度使用受限

截至 2026-06-19

快速上手

git clone https://github.com/Zyphra/ZONOS2 && cd ZONOS2 && uv sync && uv run python -m minisgl --model-path Zyphra/ZONOS2 --tts-default-voices-dir ./default_voices/(需 NVIDIA GPU, Linux)

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   4 / 5
总分
10

HuggingFace 原始数据 (抓取于 2026-06-14)

作者
Zyphra
任务类型
text-to-speech
推理库
ZONOS2
下载
11
点赞
56
许可证
apache-2.0
标签
ZONOS2, text-to-speech, license:apache-2.0, region:us

探索

源链接