模型 / Irodori-TTS-500M-v3 (Aratako)

Irodori-TTS-500M-v3 (Aratako)

日语TTS,表情符号控制风格,零样本克隆

作者
Aratako
对位
对标 Echo-TTS 及日语 TTS 方案
适合
零样本日语语音克隆 / 表情符号驱动风格与音效控制
不适合
非日语文本或需精确汉字阅读
入选理由
有HF Space可试用;v3为同系列升级有改进。
规模
500M · 最低 ~0.3GB · 4-bit(估算)
授权
MIT · 可商用
框架
pytorch
血统
微调自 Irodori-TTS-500M-v2
国内访问
需代理
可信度
67 赞,基于 Echo-TTS 架构,500M 参数,集成 SilentCipher 水印

社区实测

日文 TTS 基础模型,emoji 风格控制是最大差异化功能,社区围绕它做了 OpenAI 兼容服务和轻量微调方案。

  • 通过 emoji 控制日文语音的情感与风格(如😭带哭腔)
  • 提供了比 LoRA 更轻量的说话人嵌入训练方法(Speaker Inversion)
  • OpenAI TTS API 兼容服务器,方便接入现有工具链
  • 使用 whisper 音频做参考时,因 emoji 标注的 conditioning 方式可能导致参考音复现度偏低
  • 实际推理需要 CUDA 或 ROCm GPU,纯 CPU 不实用

截至 2026-06-21

本形态 ~0.3GB 4-bit · 国内 需代理 · 0 下载

仅 safetensors · 无 pickle 加载风险

本形态源 ↗

下载动量

30天下载 0 → 0 · likes +8

观测时间线