模型 / Irodori-TTS-500M-v3 (Aratako)

Irodori-TTS-500M-v3 (Aratako)

日语TTS,表情符号控制风格,零样本克隆

作者 Aratako

仓库标识Aratako/Irodori-TTS-500M-v3

显存未知许可 可商用任务 语音合成最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
pytorch

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
有HF Space可试用;v3为同系列升级有改进。
对位
对标 Echo-TTS 及日语 TTS 方案
适合
零样本日语语音克隆 / 表情符号驱动风格与音效控制
不适合
非日语文本或需精确汉字阅读

独立证据与社区反馈

1 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

独立来源不足,尚未形成社区共识:在日语表达深度上被社区评价为优于 MOSS-TTS-Nano 和 Gemini TTS,尤其 emoji 与 VoiceDesign 的组合被认为在角色演绎和情感叙事上有突破性表现。

  • 通过输入文本中插入 emoji 控制语音的音效、说话风格和情感表现
  • 日语合成在表达深度上优于同类轻量开源方案(MOSS-TTS-Nano)及部分云端方案(Gemini TTS)
  • 支持角色演绎和富有情感层次的旁白生成

可信度67 赞,基于 Echo-TTS 架构,500M 参数,集成 SilentCipher 水印

完整规格

规模
500M · 权重格式未知,无法估算显存
授权
MIT · 可商用
框架
pytorch
血统
微调自 Irodori-TTS-500M-v2
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 0 → 0

观测时间线