SummFlow 2026-05-16 Hugging Face

OmniVoice (k2-fsa)

为开发者提供600+语言零样本语音合成

入选理由
有HF Space和Colab可用,pip安装即用;下载量200万+支持600语言,架构为扩散语言模型。
对位
对位 XTTS-v2、Fish Audio
适合
全球多语种语音合成与声音克隆 / 创意声音设计与非语言符号表达
不适合
实时流式对话系统
规模
613M · 不适用 · Q4 ~0.4GB / FP16 ~1.5GB
授权
apache-2.0 · 可商用
框架
omnivoice
血统
微调自 Qwen3-0.6B
可信度
下载量超 208 万,论文 arXiv:2604.00688,910 点赞

仅 safetensors · 无 pickle 加载风险

社区实测

社区普遍认为 OmniVoice 是当前开源 TTS 中语言覆盖最广、推理速度最快的方案之一,零样本语音克隆操作简便且效果出色,基于 Qwen3-0.6B 的架构使其可在消费级硬件上运行,但约 6.5GB 的显存占用意味着需要与其他模型协调资源,且语音克隆模式下无法通过文本提示调整语调。

  • 支持 600+ 语言的零样本 TTS,语言覆盖为目前开源方案中最广
  • 仅需 3 秒参考音频即可完成语音克隆
  • 推理速度达 40 倍实时,生成效率高
  • Apache 2.0 开源许可,商用友好
  • 基于 Qwen3-0.6B,可在消费级硬件上运行
  • 已有社区集成到 Home Assistant(wyoming_omnivoice)实现本地智能家居 TTS
  • 已有社区集成到 ComfyUI,可在 Stable Diffusion 工作流中使用
  • 可在免费 Google Colab 上运行,降低试用门槛
  • OmniVoice Studio 桌面应用提供本地化的 ElevenLabs 替代方案,支持语音克隆、视频配音、实时听写等功能
  • 支持语音设计(voice design)模式,可通过文本描述控制音色属性
  • 提供 Web UI,方便非开发者使用
  • 扩散语言模型架构直接映射文本到多码本声学 token,简化了传统两阶段流水线
  • 基于 581k 小时开源多语言数据集训练,在中英及多语言基准上达到 SOTA
  • 语音克隆模式下无法通过文本提示调整语调,提示词仅对语音设计模式生效
  • 模型约 6.5GB,显存占用较大,需要与其他模型协调加载/卸载
  • 10 秒参考音频可能不足以捕捉情感变化,建议 30-60 秒以上以获得更可靠的音色、节奏和说话风格
  • 要获得最佳且最一致的克隆效果,需要用 45 分钟以上、包含丰富情感变化的音频进行微调
  • 8GB 或更低显存环境下,TTS 会自动卸载到 CPU 运行
  • 官方说明语音克隆是最稳定的模式,暗示其他模式可能稳定性不足

截至 2026-06-21

快速上手

pip install omnivoice