模型 / MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS)

MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS)

零样本声音克隆多语言TTS模型,支持31种语言和本地部署

作者
OpenMOSS-Team
对位
对位 CosyVoice 2
适合
零样本多语言语音克隆 / 长文本合成与精确停顿控制
不适合
实时流式低延迟场景
入选理由
MOSS-TTS v1.5 支持31种语言零样本声音克隆、立体声48kHz输出,可通过SGLang兼容OpenAI API或HuggingFace快速部署,适合多语言TTS与克隆场景。
规模
4.6B · 最低 ~2.7GB · 4-bit(估算)
授权
Apache-2.0 · 需自查
框架
transformers / sglang
语种
31种语言 (含中·粤·英·日·韩·法·德·西等)
国内访问
魔搭可用
可信度
HuggingFace 5655 下载,47 赞,Apache-2.0,arXiv 2603.18090

社区实测

社区普遍认可其语音克隆质量,但参考代码推理速度偏慢(RTF ~2),部署复杂度较高。

  • 零样本语音克隆效果出色,有用户明确表示偏好其克隆质量超过 fish audio s2 pro
  • 支持 31 种语言的多语种合成,指定语言标签后质量提升明显
  • 参考 Python 推理代码速度仅 RTF ~2(约 50% 实时),本地实时使用有压力
  • 服务化部署复杂,需处理参考音频编码、自回归生成、多码本采样与有状态解码器等多阶段流水线

截至 2026-06-28

本形态 ~2.7GB 4-bit · 国内 魔搭可用 · 5,655 下载

仅 safetensors · 无 pickle 加载风险

快速上手

python -c "from transformers import AutoModel; model = AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5', trust_remote_code=True)"

本形态源 ↗

下载动量

30天下载 48.3k → 59.9k

观测时间线