此页是 2026-06-06 的观测快照,查看该模型当前信息 → /m/bosonai__higgs-audio-v3-tts-4b/

归档 / 2026-06-06 / Higgs-Audio-v3-TTS-4B (Boson AI)

Higgs-Audio-v3-TTS-4B (Boson AI)

语音对话TTS:100+语种、零样克隆、情感/风格内联控制

入选理由
Higgs Audio v3 TTS 支持100+语言零样本语音克隆与内联情绪控制,适合研究与非商业用途,需GPU(推荐H100)。
对位
对位 Fish Audio S2 Pro / Qwen3-TTS-1.7B / OmniVoice
适合
语音对话代理与聊天机器人 / 多语种、情感可控的语音生成
不适合
商业用途或未经授权的声音克隆
规模
4B · 8k · Q4 ~3.1GB / FP16 ~11GB
授权
Boson Research & Non-Commercial License · 需自查
框架
sglang-omni / Boson AI API
语种
100+语言,含中、英、日、韩、法、德等83种高质量语种
可信度
SeedTTS/CV3等4项多语种零样克隆基准WER均最低 (SeedTTS 1.11, CV3 4.41)

仅 safetensors · 无 pickle 加载风险

社区实测

社区对开源发布反响积极,已有用户在 RTX 3090 上实测并纳入多模型基准对比

  • 开源可本地部署的 TTS 模型,社区已在消费级 GPU 上实测
  • 比前代 8B 版本推理更快
  • 仅限研究与非商业用途
  • 部分语言(如日语)的实际表现需自行验证

截至 2026-06-21

快速上手

sgl-omni serve --model-path bosonai/higgs-audio-v3-tts-4b

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   5 / 5
总分
11

HuggingFace 原始数据 (抓取于 2026-06-06)

作者
bosonai
任务类型
text-to-speech
推理库
transformers
下载
408
点赞
116
许可证
Boson Research & Non-Commercial License
标签
transformers, safetensors, higgs_multimodal_qwen3, text-generation, text-to-speech, speech-generation, voice-agent, expressive-speech, controllable-tts, multilingual-tts, af, ar, as, ast, az, ba, be, bg, bn, bs, ca, ceb, ckb, cs, cy, da, de, el, en, eo, es, et, eu, fa, fi, fr, ga, gl, gu, ha, he, hi, hr, ht, hu, hy, id, is, it, jv, ka, kab, kam, kea, kk, kn, ko, ky, la, lb, lg, ln, lt, luo, lv, mhr, mi, mk, ml, mn, mr, ms, mt, ne, nl, no, nso, ny, oc, om, pa, pl, ps, pt, ro, ru, rw, sd, sk, sl, sn, so, sq, sr, sv, sw, ta, te, tg, tl, tr, ug, uk, umb, ur, uz, vi, xh, zh, zu, license:other, endpoints_compatible, region:us

探索

源链接