指南 / 语音识别模型 / 可商用

可商用的语音识别模型

共 3 个

Mega-ASR (THU) 面向远场、混响、重叠语音等严重声学退化的鲁棒语音识别 speaker-diarization-3.1 (pyannote) 多说话人分割模型,从音频中区分谁在何时说话 Whisper Large v3 MLX (mlx-community) Apple Silicon 上运行的 Whisper 语音识别模型