模型 / Higgs-Audio-v3-TTS-4B (Boson AI)

Higgs-Audio-v3-TTS-4B (Boson AI)

语音对话TTS:100+语种、零样克隆、情感/风格内联控制

作者
bosonai
对位
对位 Fish Audio S2 Pro / Qwen3-TTS-1.7B / OmniVoice
适合
语音对话代理与聊天机器人 / 多语种、情感可控的语音生成
不适合
商业用途或未经授权的声音克隆
入选理由
Higgs Audio v3 TTS 支持100+语言零样本语音克隆与内联情绪控制,适合研究与非商业用途,需GPU(推荐H100)。
规模
4B · 8k · 最低 ~2.8GB · 4-bit(估算)
授权
Boson Research & Non-Commercial License · 需自查
框架
sglang-omni / Boson AI API
语种
100+语言,含中、英、日、韩、法、德等83种高质量语种
国内访问
需代理
可信度
SeedTTS/CV3等4项多语种零样克隆基准WER均最低 (SeedTTS 1.11, CV3 4.41)

社区实测

社区对开源发布反响积极,已有用户在 RTX 3090 上实测并纳入多模型基准对比

  • 开源可本地部署的 TTS 模型,社区已在消费级 GPU 上实测
  • 比前代 8B 版本推理更快
  • 仅限研究与非商业用途
  • 部分语言(如日语)的实际表现需自行验证

截至 2026-06-21

本形态 ~2.8GB 4-bit · 国内 需代理 · 408 下载

仅 safetensors · 无 pickle 加载风险

快速上手

sgl-omni serve --model-path bosonai/higgs-audio-v3-tts-4b

本形态源 ↗

下载动量

30天下载 211.5k → 309.4k · likes +146

观测时间线