模型 / Higgs-Audio-v3-TTS-4B (Boson AI)

Higgs-Audio-v3-TTS-4B (Boson AI)

语音对话TTS:100+语种、零样克隆、情感/风格内联控制

作者 bosonai

仓库标识bosonai/higgs-audio-v3-tts-4b

显存未知许可 需自查任务 语音合成最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
SGL-OMNI
下载
408

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

sgl-omni serve --model-path bosonai/higgs-audio-v3-tts-4b

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Higgs Audio v3 TTS 支持100+语言零样本语音克隆与内联情绪控制,适合研究与非商业用途,需GPU(推荐H100)。
对位
对位 Fish Audio S2 Pro / Qwen3-TTS-1.7B / OmniVoice
适合
语音对话代理与聊天机器人 / 多语种、情感可控的语音生成
不适合
商业用途或未经授权的声音克隆

独立证据与社区反馈

4 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

作为面向对话场景的 TTS,实测语音克隆和情绪标签控制可用,生成效果接近真人交谈而非机械朗读,但需注意许可证限制和显存门槛。

  • 语音 AI 对话/Agent 场景需要能表达情绪、改变语气的自然 TTS,而非平铺直叙的朗读
  • 100+ 语言支持,零样本语音克隆仅需参考音频即可复刻音色
  • 通过行内标签可实时控制情绪、风格、语速、音高、停顿和音效
  • 支持本地自部署,实测 RTX A6000 上占用约 9 GB 显存即可运行
  • 仅限研究和非商业用途,生产/商用/创收需额外获取商业许可
  • 复杂发音(Complex Pronunciation)主观评测得分仅 25.10%,在对比模型中仍属短板
  • 需 48 GB 显存级别显卡才能加载,消费级 GPU 可能无法运行

可信度SeedTTS/CV3等4项多语种零样克隆基准WER均最低 (SeedTTS 1.11, CV3 4.41)

完整规格

规模
4B · 8k · 权重格式未知,无法估算显存
授权
Boson Research & Non-Commercial License · 需自查
框架
sglang-omni / Boson AI API
语种
100+语言,含中、英、日、韩、法、德等83种高质量语种
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 197.4k → 123.5k · likes +44

观测时间线