此页是 2026-09-11 的观测快照,查看该模型当前信息 → /m/tencent__auk/
归档 / 2026-09-11 / AuK (Tencent)
AuK (Tencent)
- 入选理由
- 开源统一语音生成与编辑模型,支持零样本TTS、歌声/情感/口音编辑及语音分离,提供在线Demo和SGLang-Omni接入,当天即可试用。
- 对位
- 对位 Fish Speech 1.5 / CosyVoice2
- 适合
- 零样本语音克隆 / 指令 TTS / 语音编辑、增强与分离
- 不适合
- 实时流式低延迟场景
- 规模
- 1.5B · 未知 · Q4 ~1GB / FP16 ~3.6GB
- 授权
- MIT · 需自查
- 框架
- sglang-omni
- 语种
- 未公开
- 可信度
- MIT 许可,SGLang-Omni Day 0 支持,ModelScope 可用
仅 safetensors · 无 pickle 加载风险
快速上手示例
python -m sglang_omni.cli serve --model-path tencent/AuK 点击复制
依赖版本和硬件参数请以源仓库说明为准。
评分详情
- Q1
- 今天能接上用吗 5 / 5
- Q2
- 有可信证据吗 3 / 5
- Q3
- 是新东西吗 5 / 5
- 总分
- 13
HuggingFace 原始数据 (抓取于 2026-09-11)
- 作者
- tencent
- 推理库
- 未指定
- 下载
- 179
- 点赞
- 68
- 许可证
- MIT
- 标签
- audio, speech, text-to-speech, zero-shot-tts, voice-cloning, speech-generation, speech-editing, speech-enhancement, source-separation, speech-separation, instruction-guided, diffusion, arxiv:2609.08936, license:mit, region:us
探索
源链接