指南 / 语音合成模型 / 8GB 显存能跑

8GB 显存能跑的语音合成模型

共 12 个

显存档为包含式:更低显存也能跑的模型一并列在此。数值取 Q4 量化后显存估算。

Gepard-1.0 (nineninesix) 流式自回归 TTS,面向实时对话与语音代理 Kokoro-82M (hexgrad) 82M 参数轻量 TTS 模型,支持多语言,可本地部署 Higgs TTS 3 (Boson AI) 对话式语音合成,100+语种,零样本克隆与内联控制 MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS) 零样本声音克隆多语言TTS模型,支持31种语言和本地部署 Inflect-Nano-v1 (owensong) 超小型英文TTS,总4.63M参数,适合本地/嵌入式实验 Higgs-Audio-v3-TTS-4B (Boson AI) 语音对话TTS:100+语种、零样克隆、情感/风格内联控制 MisoTTS-8B (MisoLabs) 基于 Sesame CSM 的对话 TTS 模型,支持语音上下文延续 Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen) 指令式多语言TTS,流式延迟低至97ms,9音色 MOSS-TTS-v1.5 (OpenMOSS) 零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。 Irodori-TTS-500M-v3 (Aratako) 日语TTS,表情符号控制风格,零样本克隆 OmniVoice (k2-fsa) 为开发者提供600+语言零样本语音合成 Supertonic 3 (Supertone) 31种语言本地TTS,面向AI应用开发者的语音合成