SummFlow 2026-07-03 Hugging Face

Higgs TTS 3 (Boson AI)

对话式语音合成,100+语种,零样本克隆与内联控制

入选理由
Higgs TTS 3是首个支持100+语言、零样本语音克隆和内联情感控制的4B开源TTS,可通过SGLang/vLLM-Omni或API快速部署,适合构建语音代理,但需接受非商业许可证。
对位
对位 Fish Audio S2 Pro、Qwen3-TTS-1.7B
适合
语音代理对话合成 / 零样本多语种声音克隆与情绪控制
不适合
商业化部署与未经授权的语音克隆
规模
4B · 8192 · Q4 ~3.1GB / FP16 ~11GB
授权
boson-higgs-audio-v3-research-and-non-commercial-license · 需自查
框架
vllm-omni / sglang-omni
语种
100+ 语种 (含中/英/日/韩/阿拉伯等85种<5% WER)
可信度
下载103k,赞581,SeedTTS/CV3等4项基准WER最低,100+语种

仅 safetensors · 无 pickle 加载风险

社区实测

社区对 Higgs TTS 3 的语音自然度和多语言能力评价积极,认为相比前代和同类开源方案(如 spark-tts)有明显跃升,零样本声音克隆质量出色,且对内容创作者提供免费商用许可颇具吸引力;但本地部署门槛较高,全精度模型需 18-20GB 显存,8GB 显卡即使用量化版本也体验缓慢。

  • 零样本声音克隆质量出色,支持从参考音频复刻说话人音色
  • 支持 100+ 语言,词错误率(WER)达到个位数水平
  • 面向语音对话场景设计,输出自然、有表现力的对话式语音,而非机械朗读
  • 量化版本 QT8 质量接近全精度模型,QT4 在合适参数下也表现不错,降低了一定硬件门槛
  • 对数字创作者免费商用许可(含盈利内容),仅需注明 Boson AI's Higgs Audio 出处
  • 在对比测试中以 75.7% 胜率击败 GPT-4o-mini-tts
  • 生成质量大幅超越 spark-tts
  • 支持内联控制情感、风格、韵律、停顿和音效
  • 全精度模型需 18-20GB 显存,8GB 显卡无法运行完整模式
  • 8GB 显卡即使使用量化版本(QT8/QT4)也较慢,需借助 CPU 内存卸载
  • 长文本批量生成时可能出现缺词,需用 STT 逐条校验
  • 8GB 显卡无法使用声音克隆功能

截至 2026-07-12

快速上手

sgl-omni serve --model-path bosonai/higgs-tts-3-4b