此页是 2026-06-05 的观测快照,查看该模型当前信息 → /m/misolabs__misotts/

归档 / 2026-06-05 / MisoTTS-8B (MisoLabs)

MisoTTS-8B (MisoLabs)

基于 Sesame CSM 的对话 TTS 模型,支持语音上下文延续

入选理由
基于Sesame CSM架构的TTS模型,提供推理代码和演示地址。
对位
对位 Sesame CSM 开源实现
适合
高质量对话语音合成 / 从短音频提示生成语音延续
不适合
长篇有声书朗读
规模
8B · 2048 · Q4 ~5.4GB / FP16 ~20GB
授权
other · 需自查
框架
pytorch
语种
未声明
可信度
Hugging Face 76 点赞,骨干为 Llama-8B 加 Sesame CSM 架构

仅 safetensors · 无 pickle 加载风险

社区实测

社区认可其开源与情感表达能力,但普遍反映合成稳定性不足,短文本也出现幻觉,作为 8B 模型表现低于预期。

  • 开源可用的情感语音合成与对话生成
  • 支持语音克隆能力
  • 短文本也会出现幻觉/乱读,需通过减少大写等方式缓解但无法根除
  • 合成一致性不足,同一段话容易出现偏离
  • 作为 8B 参数模型,实际表现让人觉得训练不充分

截至 2026-06-19

快速上手

git clone https://github.com/MisoLabsAI/MisoTTS && cd MisoTTS && pip install -r requirements.txt

评分详情

Q1
今天能接上用吗   3 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   3 / 5
总分
7

HuggingFace 原始数据 (抓取于 2026-06-05)

作者
MisoLabs
任务类型
text-to-speech
推理库
pytorch
下载
0
点赞
76
许可证
other
标签
pytorch, safetensors, text-to-speech, speech-synthesis, voice, audio, sesame, mimi, llama, license:other, region:us

探索

源链接