模型 / MisoTTS-8B (MisoLabs)

MisoTTS-8B (MisoLabs)

基于 Sesame CSM 的对话 TTS 模型,支持语音上下文延续

作者
MisoLabs
对位
对位 Sesame CSM 开源实现
适合
高质量对话语音合成 / 从短音频提示生成语音延续
不适合
长篇有声书朗读
入选理由
基于Sesame CSM架构的TTS模型,提供推理代码和演示地址。
规模
8B · 2048 · 最低 ~4.9GB · 4-bit(估算)
授权
other · 需自查
框架
pytorch
语种
未声明
国内访问
需代理
可信度
Hugging Face 76 点赞,骨干为 Llama-8B 加 Sesame CSM 架构

社区实测

社区认可其开源与情感表达能力,但普遍反映合成稳定性不足,短文本也出现幻觉,作为 8B 模型表现低于预期。

  • 开源可用的情感语音合成与对话生成
  • 支持语音克隆能力
  • 短文本也会出现幻觉/乱读,需通过减少大写等方式缓解但无法根除
  • 合成一致性不足,同一段话容易出现偏离
  • 作为 8B 参数模型,实际表现让人觉得训练不充分

截至 2026-06-19

本形态 ~4.9GB 4-bit · 国内 需代理 · 0 下载

仅 safetensors · 无 pickle 加载风险

快速上手

git clone https://github.com/MisoLabsAI/MisoTTS && cd MisoTTS && pip install -r requirements.txt

本形态源 ↗

下载动量

30天下载 0 → 0 · likes +11

观测时间线