模型 / speaker-diarization-3.1 (pyannote)

speaker-diarization-3.1 (pyannote)

多说话人分割模型,从音频中区分谁在何时说话

作者
pyannote
对位
对位 NeMo Speaker Diarization,替代 pyannote 2.x
适合
会议转录说话人分离 / 多角色电话录音分割
不适合
低资源实时流式处理
入选理由
可通过HuggingFace pipeline一行代码跑通说话人分离。
规模
不适用(音频长度可分批)
授权
mit · 可商用
框架
pyannote.audio / HuggingFace Transformers
国内访问
需代理
可信度
HuggingFace 下载超 1000 万次,1946 赞

社区实测

Pyannote 3.1 被广泛视为开源说话人日志的事实标准,在准确率、实现难度与社区支持之间取得了最佳平衡;但社区反馈其非英语场景表现不佳,且已被后续社区版 community-1 在所有关键指标上大幅超越。

  • 提供开源、免费可用的说话人日志能力
  • 在准确率、实现难度和社区支持之间取得良好平衡,适合大多数开发者
  • 语音活动检测和重叠语音检测的切分性能被社区认可
  • 通过按说话人分段音频,可显著减少下游 ASR 任务的计算量
  • 可在中等配置 GPU 上运行,配合 Vast.ai 等平台实现低成本部署
  • 可与 Whisper 结合(如 WhisperX)实现转录与说话人日志的一体化流程
  • 非英语场景表现不佳,有用户反馈「does not work very well」
  • 说话人识别效果被部分用户评价为「lackluster」
  • 已被社区版 community-1 大幅超越,后者在所有关键指标上显著优于 3.1
  • 模型更适配英语,中文等非英语语言效果可能打折扣
  • 需要 GPU 才能获得较快的推理速度,纯 CPU 场景不理想
  • 部署配置难度为中等

截至 2026-06-21

国内 需代理 · 10,040,330 下载

快速上手

pip install pyannote.audio && from pyannote.audio import Pipeline; pipeline = Pipeline.from_pretrained('pyannote/speaker-diarization-3.1')

本形态源 ↗

下载动量

30天下载 8354.2k → 8095.8k · likes +357

观测时间线