模型 / Audio8-TTS-Preview-0.6b (Audio8)

Audio8-TTS-Preview-0.6b (Audio8)

0.6B多语言TTS,零样本语音克隆,支持11种语言

作者 Audio8

仓库标识Audio8/Audio8-TTS-Preview-0.6b

~0.4GB 4-bit许可 可商用任务 语音合成最近核对 2026-08-05
格式
4-bit
文件
~0.3GB
运行内存
~0.4GB–0.5GB
运行时
transformers
下载
225

Hugging Face 源仓库 ↗

适合与不适合

入选理由
0.6B超小参数量实现多语言零样本语音克隆,在线demo直接体验,适合轻量高质TTS需求。
对位
对位 CosyVoice3-1.5B (0.6B vs 1.5B)
适合
零样本语音克隆 / 多语言文本转语音生成
不适合
非推荐语言/方言效果不确定

独立证据与社区反馈

2 个来源 · 均为官方/厂商 · 暂无独立验证最近验证 2026-08-05

厂商材料,未经独立验证:0.6B参数做到Seed-TTS/CV3第一梯队水平的紧凑型TTS预览模型,HuggingFace社区关注度尚可(269赞、1.1万月下载)但尚无规模化的独立社区实测反馈

  • 0.6B极小参数规模在Seed-TTS英文WER上达到1.506,为对比模型中最低
  • 支持11种语言(含粤语、中文)的零样本声音克隆
  • 提供ONNX INT4 CPU部署方案,运行时内存仅约1GiB,无需GPU即可推理
  • Apache 2.0开源许可,附完整44.1kHz神经音频编解码器
  • 当前为预览版(Preview)检查点,语言覆盖和方言支持有限
  • 参考音频过长、嘈杂或转录不准会降低合成稳定性和说话人相似度
  • 需trust_remote_code=True加载,存在自定义代码安全审计需求

可信度0.6B参数,Seed-TTS英语WER 1.506,与4.6B Fish S2 Pro竞争

完整规格

规模
0.6B · 2048 · 下载 ~0.3GB · 显存最低 ~0.4GB · 推荐 ~0.5GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
transformers
语种
粤语 / 中文 / 荷兰语 / 英语 / 法语 / 德语 / 意大利语 / 日语 / 韩语 / 波兰语 / 西班牙语
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 22.7k → 13.2k · likes +92

在线体验

观测时间线