此页是 2026-09-12 的观测快照,查看该模型当前信息 → /m/tencent__auk/

归档 / 2026-09-12 / AuK-1.5B (Tencent)

AuK-1.5B (Tencent)

开源语音生成与编辑基础模型,支持零样本 TTS

入选理由
开源语音生成与编辑基础模型,支持零样本TTS、指令编辑、增强分离,有在线Demo可即时试用,适合语音创作者。
对位
对位 CosyVoice2、F5-TTS
适合
零样本语音克隆与音色复刻 / 语音内容/情感编辑与降噪增强
不适合
音乐生成 / 作曲
规模
1.5B · 未知 · Q4 ~1GB / FP16 ~3.6GB
授权
MIT · 需自查
框架
sglang-omni
语种
未公开
可信度
HF 下载 554、点赞 100;MIT;SGLang Omni 支持

仅 safetensors · 无 pickle 加载风险

快速上手示例

python -m sglang_omni.cli serve --model-path tencent/AuK

依赖版本和硬件参数请以源仓库说明为准。

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   5 / 5
总分
11

HuggingFace 原始数据 (抓取于 2026-09-12)

作者
tencent
任务类型
text-to-speech
推理库
未指定
下载
554
点赞
100
许可证
MIT
标签
audio, speech, text-to-speech, zero-shot-tts, voice-cloning, speech-generation, speech-editing, speech-enhancement, source-separation, speech-separation, instruction-guided, diffusion, arxiv:2609.08936, license:mit, region:us

探索

源链接