SummFlow 2026-07-09 Hugging Face

Kokoro-82M (hexgrad)

82M 参数轻量 TTS 模型,支持多语言,可本地部署

入选理由
82M参数轻量TTS,Apache许可,有在线Demo和pip一键安装,支持多语言,适合低成本生产部署。
对位
对位 Piper TTS / StyleTTS2 原版
适合
本地/边缘设备语音合成 / 成本敏感的 API 服务
不适合
声音克隆/自定义音色
规模
82M · 未知 · Q4 ~0.1GB / FP16 ~0.2GB
授权
apache-2.0 · 需自查
框架
kokoro
语种
8 种语言
血统
微调自 StyleTTS2-LJSpeech
可信度
HuggingFace 下载 1.35 千万次,Apache 2.0 许可,训练成本约 $1000

社区实测

仅 82M 参数却在 TTS Arena 排名第一,质量碾压 10-20 倍参数量的模型,Apache 2.0 开源且 CPU 可跑,社区普遍认为性价比极高。训练数据依赖合成语音存在版权隐忧,但对日常使用场景而言,其轻量、速度与多语言支持已足够实用。

  • 仅 82M 参数、占用不到 2GB VRAM,可在 CPU 或预算硬件上运行,无需 GPU
  • 推理速度达实时或更快,适合实时应用、聊天机器人与边缘部署
  • Apache 2.0 开源许可,权重完全开放,商用友好
  • TTS Spaces Arena 评分超过参数量大 14 倍的模型(如 Fish Speech 500M 参数)
  • 提供 ONNX 量化版本(约 80MB),便于生产环境集成
  • 支持美式/英式英语、西班牙语、法语、日语、中文、印地语等多语言
  • 朗读长文本/叙述性内容表现好,可用于校对文档
  • API 调用成本低,约 65-80 美分/百万字符
  • 训练数据主要来自 OpenAI 和 ElevenLabs 的合成输出,存在潜在版权与许可风险
  • 对长叙事文本表现优于日常对话,对话场景下自然度可能不足
  • 需要 espeak 作为系统依赖处理 OOD 回退及部分非英语语言,增加部署复杂度
  • 最快的推理配置不一定是最佳音质,需在速度与质量之间权衡
  • 现有托管 API 服务较少,不易找到现成的云端调用方案

截至 2026-07-12

快速上手

pip install kokoro && python -c "from kokoro import KPipeline; KPipeline('a'); print('Kokoro loaded')"