Higgs-Audio-v3-TTS-4B (Boson AI)
语音对话TTS:100+语种、零样克隆、情感/风格内联控制
仓库标识bosonai/higgs-audio-v3-tts-4b
显存未知许可 需自查任务 语音合成最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- SGL-OMNI
- 下载
- 408
仅 safetensors · 无 pickle 加载风险
快速上手示例
sgl-omni serve --model-path bosonai/higgs-audio-v3-tts-4b 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
作为面向对话场景的 TTS,实测语音克隆和情绪标签控制可用,生成效果接近真人交谈而非机械朗读,但需注意许可证限制和显存门槛。
- 语音 AI 对话/Agent 场景需要能表达情绪、改变语气的自然 TTS,而非平铺直叙的朗读
- 100+ 语言支持,零样本语音克隆仅需参考音频即可复刻音色
- 通过行内标签可实时控制情绪、风格、语速、音高、停顿和音效
- 支持本地自部署,实测 RTX A6000 上占用约 9 GB 显存即可运行
- 仅限研究和非商业用途,生产/商用/创收需额外获取商业许可
- 复杂发音(Complex Pronunciation)主观评测得分仅 25.10%,在对比模型中仍属短板
- 需 48 GB 显存级别显卡才能加载,消费级 GPU 可能无法运行
- 独立评测Medium — Higgs Audio v3 TTS: Best TTS for Human-Like Audio Generation
- 独立评测Higgs TTS — SGLang
- 独立评测Boson AI — Higgs TTS 3
- 独立评测Higgs Audio v3 TTS: This Model Does Not Read, It Talks in Your Language
- 转载/仓库boson-ai/higgs-audio: Text-audio foundation model from ...
可信度SeedTTS/CV3等4项多语种零样克隆基准WER均最低 (SeedTTS 1.11, CV3 4.41)
完整规格
下载动量
30天下载 197.4k → 123.5k · likes +44