AI 情报 · 每日更新
指南
/
语音识别模型
/ 可商用
可商用的语音识别模型
共 3 个
Mega-ASR (THU)
面向远场、混响、重叠语音等严重声学退化的鲁棒语音识别
speaker-diarization-3.1 (pyannote)
多说话人分割模型,从音频中区分谁在何时说话
Whisper Large v3 MLX (mlx-community)
Apple Silicon 上运行的 Whisper 语音识别模型
Esc
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索