此页是 2026-09-11 的观测快照,查看该模型当前信息 → /m/tencent__auk/

归档 / 2026-09-11 / AuK (Tencent)

AuK (Tencent)

1.5B 语音生成与编辑模型,支持零样本 TTS

入选理由
开源统一语音生成与编辑模型,支持零样本TTS、歌声/情感/口音编辑及语音分离,提供在线Demo和SGLang-Omni接入,当天即可试用。
对位
对位 Fish Speech 1.5 / CosyVoice2
适合
零样本语音克隆 / 指令 TTS / 语音编辑、增强与分离
不适合
实时流式低延迟场景
规模
1.5B · 未知 · Q4 ~1GB / FP16 ~3.6GB
授权
MIT · 需自查
框架
sglang-omni
语种
未公开
可信度
MIT 许可,SGLang-Omni Day 0 支持,ModelScope 可用

仅 safetensors · 无 pickle 加载风险

快速上手示例

python -m sglang_omni.cli serve --model-path tencent/AuK

依赖版本和硬件参数请以源仓库说明为准。

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   5 / 5
总分
13

HuggingFace 原始数据 (抓取于 2026-09-11)

作者
tencent
任务类型
text-to-speech
推理库
未指定
下载
179
点赞
68
许可证
MIT
标签
audio, speech, text-to-speech, zero-shot-tts, voice-cloning, speech-generation, speech-editing, speech-enhancement, source-separation, speech-separation, instruction-guided, diffusion, arxiv:2609.08936, license:mit, region:us

探索

源链接