OmniVoice (k2-fsa)
为开发者提供600+语言零样本语音合成
社区实测
社区普遍认为 OmniVoice 是当前开源 TTS 中语言覆盖最广、推理速度最快的方案之一,零样本语音克隆操作简便且效果出色,基于 Qwen3-0.6B 的架构使其可在消费级硬件上运行,但约 6.5GB 的显存占用意味着需要与其他模型协调资源,且语音克隆模式下无法通过文本提示调整语调。
- 支持 600+ 语言的零样本 TTS,语言覆盖为目前开源方案中最广
- 仅需 3 秒参考音频即可完成语音克隆
- 推理速度达 40 倍实时,生成效率高
- Apache 2.0 开源许可,商用友好
- 基于 Qwen3-0.6B,可在消费级硬件上运行
- 已有社区集成到 Home Assistant(wyoming_omnivoice)实现本地智能家居 TTS
- 已有社区集成到 ComfyUI,可在 Stable Diffusion 工作流中使用
- 可在免费 Google Colab 上运行,降低试用门槛
- OmniVoice Studio 桌面应用提供本地化的 ElevenLabs 替代方案,支持语音克隆、视频配音、实时听写等功能
- 支持语音设计(voice design)模式,可通过文本描述控制音色属性
- 提供 Web UI,方便非开发者使用
- 扩散语言模型架构直接映射文本到多码本声学 token,简化了传统两阶段流水线
- 基于 581k 小时开源多语言数据集训练,在中英及多语言基准上达到 SOTA
- 语音克隆模式下无法通过文本提示调整语调,提示词仅对语音设计模式生效
- 模型约 6.5GB,显存占用较大,需要与其他模型协调加载/卸载
- 10 秒参考音频可能不足以捕捉情感变化,建议 30-60 秒以上以获得更可靠的音色、节奏和说话风格
- 要获得最佳且最一致的克隆效果,需要用 45 分钟以上、包含丰富情感变化的音频进行微调
- 8GB 或更低显存环境下,TTS 会自动卸载到 CPU 运行
- 官方说明语音克隆是最稳定的模式,暗示其他模式可能稳定性不足
OmniVoice: Open-Source TTS with 600+ Languages and Zero-Shot Voice Cloning - DEV CommunityGitHub - k2-fsa/OmniVoice: High-Quality Voice Cloning TTS for 600+ LanguagesI know this isn't technically an LLM but OmniVoice is FUCKING AMAZING. : r/LocalLLaMAComfyUI-OmniVoice-TTS : r/StableDiffusion600+ Language Open-Source TTS with Voice Cloning and Design : r/LocalLLaMAMeet OmniVoice Studio: A Local, Open-Source Alternative to ElevenLabsOmniVoice local tts model with voice cloning - Third party integrations - Home Assistant Community🎙️ How to Run OmniVoice (600+ Language AI Voice Model) on Free Google Colab — Complete GuideOmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Modelsk2-fsa/OmniVoice · Hugging Face
截至 2026-06-21
本形态 ~0.4GB 4-bit · 国内 需代理 · 2,087,606 下载
仅 safetensors · 无 pickle 加载风险
快速上手
pip install omnivoice