模型 / MOSS-TTS-v1.5 (OpenMOSS)

MOSS-TTS-v1.5 (OpenMOSS)

零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。

作者
OpenMOSS-Team
对位
对位CosyVoice、FishSpeech等开源TTS
适合
多语种有声内容生成 / 零样本个性化语音克隆
不适合
低延迟实时语音交互场景
入选理由
需自行部署推理代码,示例清晰;相比1.0版本有质量改进和新增语言支持。
规模
8.5B · 最低 ~5.1GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
transformers
国内访问
魔搭可用
可信度
论文arxiv 2603.18090,ModelScope可访问,支持31种语言零样本克隆。

社区实测

MOSS-TTS-v1.5 被社区视为当前开源语音克隆的领先方案,综合表现优于 Fish Audio S2 Pro 和 Qwen 3 TTS

  • 开源可商用的语音克隆(对比 Fish Audio 不可商用)
  • 多语言合成能力(支持31种语言,含粤语、泰语等新增语言)
  • 多推理后端支持(SGLang-Omni 和 vLLM-Omni 均已适配)
  • 长参考音频场景下的稳定语音克隆
  • 不指定语言标签时,部分语言质量可能相比 1.0 版本回退
  • 生成质量对部署配置敏感,需调优才能达到最佳效果

截至 2026-07-19

本形态 ~5.1GB 4-bit · 国内 魔搭可用 · 5,447 下载

仅 safetensors · 无 pickle 加载风险

快速上手

transformers.AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-v1.5')

本形态源 ↗

观测时间线