speaker-diarization-3.1 (pyannote)
多说话人分割模型,从音频中区分谁在何时说话
社区实测
Pyannote 3.1 被广泛视为开源说话人日志的事实标准,在准确率、实现难度与社区支持之间取得了最佳平衡;但社区反馈其非英语场景表现不佳,且已被后续社区版 community-1 在所有关键指标上大幅超越。
- 提供开源、免费可用的说话人日志能力
- 在准确率、实现难度和社区支持之间取得良好平衡,适合大多数开发者
- 语音活动检测和重叠语音检测的切分性能被社区认可
- 通过按说话人分段音频,可显著减少下游 ASR 任务的计算量
- 可在中等配置 GPU 上运行,配合 Vast.ai 等平台实现低成本部署
- 可与 Whisper 结合(如 WhisperX)实现转录与说话人日志的一体化流程
- 非英语场景表现不佳,有用户反馈「does not work very well」
- 说话人识别效果被部分用户评价为「lackluster」
- 已被社区版 community-1 大幅超越,后者在所有关键指标上显著优于 3.1
- 模型更适配英语,中文等非英语语言效果可能打折扣
- 需要 GPU 才能获得较快的推理速度,纯 CPU 场景不理想
- 部署配置难度为中等
来源
Best Speaker Diarization Models Compared [2026]Community-1: Unleashing open-source diarizationAsk HN: What Speaker Diarization tools should I look into?Looking for diarization model better than Pyannote - RedditBest diarization model? : r/LocalLLaMATowards Approximate Fast Diarization: A CPU-Only Alternative to Pyannote 3.1Speaker Diarization with Pyannote on VASTCan YouTube Stream Recordings Improve Speech Recognition for ...
截至 2026-06-21
国内 需代理 · 10,040,330 下载
快速上手
pip install pyannote.audio && from pyannote.audio import Pipeline; pipeline = Pipeline.from_pretrained('pyannote/speaker-diarization-3.1') 下载动量
30天下载 8354.2k → 8095.8k · likes +357