SummFlow 2026-06-06 Hugging Face

Higgs-Audio-v3-TTS-4B (Boson AI)

语音对话TTS:100+语种、零样克隆、情感/风格内联控制

入选理由
Higgs Audio v3 TTS 支持100+语言零样本语音克隆与内联情绪控制,适合研究与非商业用途,需GPU(推荐H100)。
对位
对位 Fish Audio S2 Pro / Qwen3-TTS-1.7B / OmniVoice
适合
语音对话代理与聊天机器人 / 多语种、情感可控的语音生成
不适合
商业用途或未经授权的声音克隆
规模
4B · 8k · Q4 ~3.1GB / FP16 ~11GB
授权
Boson Research & Non-Commercial License · 需自查
框架
sglang-omni / Boson AI API
语种
100+语言,含中、英、日、韩、法、德等83种高质量语种
可信度
SeedTTS/CV3等4项多语种零样克隆基准WER均最低 (SeedTTS 1.11, CV3 4.41)

仅 safetensors · 无 pickle 加载风险

社区实测

社区对开源发布反响积极,已有用户在 RTX 3090 上实测并纳入多模型基准对比

  • 开源可本地部署的 TTS 模型,社区已在消费级 GPU 上实测
  • 比前代 8B 版本推理更快
  • 仅限研究与非商业用途
  • 部分语言(如日语)的实际表现需自行验证

截至 2026-06-21

快速上手

sgl-omni serve --model-path bosonai/higgs-audio-v3-tts-4b