Higgs TTS 3 (Boson AI)
对话式语音合成,100+语种,零样本克隆与内联控制
仅 safetensors · 无 pickle 加载风险
社区实测
社区对 Higgs TTS 3 的语音自然度和多语言能力评价积极,认为相比前代和同类开源方案(如 spark-tts)有明显跃升,零样本声音克隆质量出色,且对内容创作者提供免费商用许可颇具吸引力;但本地部署门槛较高,全精度模型需 18-20GB 显存,8GB 显卡即使用量化版本也体验缓慢。
- 零样本声音克隆质量出色,支持从参考音频复刻说话人音色
- 支持 100+ 语言,词错误率(WER)达到个位数水平
- 面向语音对话场景设计,输出自然、有表现力的对话式语音,而非机械朗读
- 量化版本 QT8 质量接近全精度模型,QT4 在合适参数下也表现不错,降低了一定硬件门槛
- 对数字创作者免费商用许可(含盈利内容),仅需注明 Boson AI's Higgs Audio 出处
- 在对比测试中以 75.7% 胜率击败 GPT-4o-mini-tts
- 生成质量大幅超越 spark-tts
- 支持内联控制情感、风格、韵律、停顿和音效
- 全精度模型需 18-20GB 显存,8GB 显卡无法运行完整模式
- 8GB 显卡即使使用量化版本(QT8/QT4)也较慢,需借助 CPU 内存卸载
- 长文本批量生成时可能出现缺词,需用 STT 逐条校验
- 8GB 显卡无法使用声音克隆功能
来源
Higgs TTS 3: Beyond Reading, Toward Real Speech for Voice AIbosonai/higgs-tts-3-4b - Hugging FaceHiggs Audio v3 TTS on SGLang-Omni - LMSYS OrgHiggs Audio V2: A New Open-Source TTS Model with Voice ...GitHub - boson-ai/higgs-audio: Text-audio foundation model from ...Higgs Audio v3 TTS 4B. Built for voice chat. Support 100 ...This model is amazing but it is quite complex and slow to run on 8gb VRAM GPU. · Issue #117 · boson-ai/higgs-audio · GitHub
截至 2026-07-12
快速上手
sgl-omni serve --model-path bosonai/higgs-tts-3-4b