MOSS-TTS-v1.5 (OpenMOSS)
零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。
仅 safetensors · 无 pickle 加载风险
社区实测
社区认为 MOSS-TTS v1.5 是截至 2026 年中英语语音克隆效果最好的开源 TTS 之一,但效果对参考音频质量和参数调优高度敏感。
- 语音克隆质量在社区对比中优于 OmniVoice、Fish Audio S2 Pro、Qwen 3 TTS
- 提供基于 llama.cpp/GGML 的 torch-free 推理路径,降低 Python 环境部署门槛
- 实际支持中英文以外的更多语言,并非仅限中英双语
- 语音克隆效果对参考音频质量极为敏感,需要反复试错才能获得理想结果
- 生成语音偶有生硬段落和不自然的长停顿
- HuggingFace 上语言支持标注不准确,文档未清晰列出所有支持语种
- Python 生态部署繁琐是已知痛点
- VRAM 占用较高,实时流式推理可能吃紧
来源
this new Moss tts 1.5 is damn good with voice cloningMoss tts 1.5 8b Examples. It is the currently best voice cloning model for English as of June 2026GitHub - pwilkin/openmoss: OpenMOSS pure C++ pipeline based on GGMLMOSS-TTS has been released
截至 2026-06-19
快速上手
transformers.AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-v1.5')