模型 / OmniVoice (k2-fsa)

OmniVoice (k2-fsa)

为开发者提供600+语言零样本语音合成

作者 k2-fsa

仓库标识k2-fsa/OmniVoice

显存未知许可 可商用任务 语音合成最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
omnivoice
下载
2,087,606

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
有HF Space和Colab可用,pip安装即用;下载量200万+支持600语言,架构为扩散语言模型。
对位
对位 XTTS-v2、Fish Audio
适合
全球多语种语音合成与声音克隆 / 创意声音设计与非语言符号表达
不适合
实时流式对话系统

独立证据与社区反馈

13 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

OmniVoice 被多数社区用户视为当前最佳开源多语言 TTS,说话人相似度与多语言准确率在基准测试中超越 ElevenLabs,延迟低至 300-450ms,且可完全本地运行;但部分用户反馈特定输入下存在误读和停顿问题。

  • 覆盖 600+ 语言,单模型支持多语言 TTS
  • 零样本声音克隆,仅需 3 秒参考音频即可复刻说话人音色
  • 完全本地/自托管运行,数据不出服务器
  • 低延迟实时合成,TTFT 可达 300–450ms
  • Apache 2.0 开源许可,商业使用友好
  • 说话人相似度 SIM-o 0.830,显著高于 ElevenLabs 的 0.655
  • 多语言基准错误率 2.85%,远低于 ElevenLabs 的 10.95%
  • 实时因子 RTF 低至 0.025,合成速度远超实时播放
  • 支持 FlashInfer 和 CUDA Graph 加速推理,优化批处理与单流延迟
  • 部分场景下跳过或误读基础词汇,逗号后出现无法通过编辑修复的卡顿停顿
  • 有用户反馈音色克隆效果“像模仿”,VibeVoice 在某些情况下更自然
  • 降低 num_step 可提速但输出质量随之下降,需权衡速度与质量
  • 纯 CPU 推理性能受限,最佳体验依赖 GPU 加速

可信度下载量超 208 万,论文 arXiv:2604.00688,910 点赞

完整规格

规模
613M · 不适用 · 权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
omnivoice
血统
微调自 Qwen3-0.6B
访问提示
Hugging Face 可能需要代理

在线体验

观测时间线

模型家族

查看全部家族 →