此页是 2026-06-24 的观测快照,查看该模型当前信息 → /m/openmoss-team__moss-tts-local-transformer-v15/

归档 / 2026-06-24 / MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS)

MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS)

零样本声音克隆多语言TTS模型,支持31种语言和本地部署

入选理由
MOSS-TTS v1.5 支持31种语言零样本声音克隆、立体声48kHz输出,可通过SGLang兼容OpenAI API或HuggingFace快速部署,适合多语言TTS与克隆场景。
对位
对位 CosyVoice 2
适合
零样本多语言语音克隆 / 长文本合成与精确停顿控制
不适合
实时流式低延迟场景
规模
4.6B · 未知 · Q4 ~3GB / FP16 ~11GB
授权
Apache-2.0 · 需自查
框架
transformers / sglang
语种
31种语言 (含中·粤·英·日·韩·法·德·西等)
可信度
HuggingFace 5655 下载,47 赞,Apache-2.0,arXiv 2603.18090

仅 safetensors · 无 pickle 加载风险

社区实测

社区普遍认可其语音克隆质量,但参考代码推理速度偏慢(RTF ~2),部署复杂度较高。

  • 零样本语音克隆效果出色,有用户明确表示偏好其克隆质量超过 fish audio s2 pro
  • 支持 31 种语言的多语种合成,指定语言标签后质量提升明显
  • 参考 Python 推理代码速度仅 RTF ~2(约 50% 实时),本地实时使用有压力
  • 服务化部署复杂,需处理参考音频编码、自回归生成、多码本采样与有状态解码器等多阶段流水线

截至 2026-06-28

快速上手

python -c "from transformers import AutoModel; model = AutoModel.from_pretrained('OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5', trust_remote_code=True)"

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   3 / 5
总分
11

HuggingFace 原始数据 (抓取于 2026-06-24)

作者
OpenMOSS-Team
任务类型
text-to-speech
推理库
transformers
下载
5,655
点赞
47
许可证
Apache-2.0
标签
transformers, safetensors, moss_tts_local, image-feature-extraction, text-to-speech, voice-cloning, custom_code, moss-tts, moss-tts-local, arxiv:2603.18090, zh, yue, en, ar, cs, da, de, nl, es, fr, fi, el, he, hi, hu, ja, it, ko, mk, ms, ru, fa, pl, pt, sv, ro, sw, tl, th, tr, vi, license:apache-2.0, region:us

探索

源链接