模型 / Higgs TTS 3 (Boson AI)

Higgs TTS 3 (Boson AI)

对话式语音合成,100+语种,零样本克隆与内联控制

作者
bosonai
对位
对位 Fish Audio S2 Pro、Qwen3-TTS-1.7B
适合
语音代理对话合成 / 零样本多语种声音克隆与情绪控制
不适合
商业化部署与未经授权的语音克隆
入选理由
Higgs TTS 3是首个支持100+语言、零样本语音克隆和内联情感控制的4B开源TTS,可通过SGLang/vLLM-Omni或API快速部署,适合构建语音代理,但需接受非商业许可证。
规模
4B · 8192 · 最低 ~2.8GB · 4-bit(估算)
授权
boson-higgs-audio-v3-research-and-non-commercial-license · 需自查
框架
vllm-omni / sglang-omni
语种
100+ 语种 (含中/英/日/韩/阿拉伯等85种<5% WER)
国内访问
需代理
可信度
下载103k,赞581,SeedTTS/CV3等4项基准WER最低,100+语种

社区实测

社区对 Higgs TTS 3 的语音自然度和多语言能力评价积极,认为相比前代和同类开源方案(如 spark-tts)有明显跃升,零样本声音克隆质量出色,且对内容创作者提供免费商用许可颇具吸引力;但本地部署门槛较高,全精度模型需 18-20GB 显存,8GB 显卡即使用量化版本也体验缓慢。

  • 零样本声音克隆质量出色,支持从参考音频复刻说话人音色
  • 支持 100+ 语言,词错误率(WER)达到个位数水平
  • 面向语音对话场景设计,输出自然、有表现力的对话式语音,而非机械朗读
  • 量化版本 QT8 质量接近全精度模型,QT4 在合适参数下也表现不错,降低了一定硬件门槛
  • 对数字创作者免费商用许可(含盈利内容),仅需注明 Boson AI's Higgs Audio 出处
  • 在对比测试中以 75.7% 胜率击败 GPT-4o-mini-tts
  • 生成质量大幅超越 spark-tts
  • 支持内联控制情感、风格、韵律、停顿和音效
  • 全精度模型需 18-20GB 显存,8GB 显卡无法运行完整模式
  • 8GB 显卡即使使用量化版本(QT8/QT4)也较慢,需借助 CPU 内存卸载
  • 长文本批量生成时可能出现缺词,需用 STT 逐条校验
  • 8GB 显卡无法使用声音克隆功能

截至 2026-07-12

本形态 ~2.8GB 4-bit · 国内 需代理 · 103,905 下载

仅 safetensors · 无 pickle 加载风险

快速上手

sgl-omni serve --model-path bosonai/higgs-tts-3-4b

本形态源 ↗

下载动量

30天下载 211.5k → 309.4k

观测时间线