模型 / scenema-audio (ScenemaAI)

scenema-audio (ScenemaAI)

TTS 模型,面向语音合成开发者

作者
ScenemaAI
对位
对位 Bark、VITS 等 TTS 方案
适合
文本转语音合成 / AI 语音内容制作
不适合
高并发实时语音服务
入选理由
需自建Docker无现成API;情感控制与场景感知。
授权
other
框架
未公开
国内访问
需代理
可信度
Hugging Face 下载量 176,点赞 65

社区实测

项目宣称零样本表现力语音克隆,但社区关注度极低(109星、几乎无独立讨论),尚处早期阶段。

  • 零样本表现力语音克隆(zero-shot expressive voice cloning)
  • 将 TTS、通用音频生成与语音克隆整合进单一扩散管线(diffusion-based pipeline)
  • 原生克隆(native cloning)方案仍在探索替代路线,当前方案可能并非最终形态
  • 社区关注度极低,缺乏独立验证与实测反馈

截至 2026-06-21

国内 需代理 · 176 下载

仅 safetensors · 无 pickle 加载风险

本形态源 ↗

下载动量

30天下载 77 → 69 · likes +4

观测时间线