指南 / 语音识别模型
语音识别模型
共 14 个 · 数据更新于 2026-09-07
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
当前运行配置
microsoft/VibeVoice-ASR-Streaming-7B- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
pyannote/speaker-diarization-community-1- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 缺少可用的显存依据
- 国内可达
- 需代理
当前运行配置
openai/whisper-large-v3- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 30s 音频
- 国内可达
- 需代理
- 其它形态
- 原生 · MLX
当前运行配置
nyralabs/CrisperWhisper2.0_large- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- 非商业研究许可
- 上下文
- 30s音频窗口,长音频自动拼接
- 国内可达
- 需代理
当前运行配置
microsoft/VibeVoice-ASR-BitNet- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
ai-sage/GigaAM-Multilingual- 显存
- 暂无估算
查看详情查看运行方式
python -c "from transformers import AutoModel; model=AutoModel.from_pretrained('ai-sage/GigaAM-Multilingual', revision='ctc', trust_remote_code=True); print(model.transcribe('example.wav'))"- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- mit
- 国内可达
- 需代理
- 其它形态
- 原生 · MLX
GigaAM-Multilingual MLX INT8 (ai-babai)
量化自 gigaam-multilingual-mlx
Apple Silicon 本地离线俄哈吉乌语 ASR,MLX 量化
- 参数量
- 224M
- 商用
- 可商用
当前运行配置
ai-babai/gigaam-multilingual-mlx-int8-g64- 显存
- ~0.2GB 8-bit(估算)
查看详情查看运行方式
uvx gigaam-multilingual-mlx gigaam-stt <audio> --variant int8- 许可证
- MIT
- 国内可达
- 需代理
GigaAM-Multilingual-MLX INT4 (ai-babai)
量化自 gigaam-multilingual-mlx
俄语及中亚语言离线语音转录,Apple Silicon 用
- 参数量
- 161M
- 商用
- 可商用
当前运行配置
ai-babai/gigaam-multilingual-mlx-int4-g64- 显存
- ~0.1GB 4-bit(估算)
查看详情查看运行方式
uv tool install gigaam-multilingual-mlx==0.2.0 && gigaam-stt audio.wav --variant int4- 许可证
- MIT
- 上下文
- 不适用
- 国内可达
- 需代理
当前运行配置
CohereLabs/cohere-transcribe-arabic-07-2026- 显存
- 暂无估算
查看详情查看运行方式
python -c "from transformers import pipeline; pipe = pipeline('automatic-speech-recognition', 'CohereLabs/cohere-transcribe-arabic-07-2026'); print(pipe('audio.wav'))"- 为何暂无估算
- 权重格式未知,无法估算显存
- 国内可达
- 需代理
当前运行配置
mlx-community/whisper-large-v3-turbo- 显存
- 暂无估算
查看详情查看运行方式
pip install mlx-whisper && mlx_whisper audio.wav --model mlx-community/whisper-large-v3-turbo- 为何暂无估算
- 权重格式未知,无法估算显存
- 上下文
- 30s
- 国内可达
- 需代理
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 社区实测反馈 Whisper Large v3 准确度不如 v2,且 v2、v3 都容易幻觉 —— openai/whisper-large-v3
- 追求最快转写速度时社区更推荐 faster-whisper —— openai/whisper-large-v3
- 速度优势仅在 Apple Silicon 上成立:4090 上 insanely-fast-whisper 转写 10 分钟文件不到 8 秒 —— openai/whisper-large-v3
- 项目似乎已停止开发维护 —— nyralabs/CrisperWhisper2.0_large
- 可能需要独立显卡才能运行 —— nyralabs/CrisperWhisper2.0_large
- 部分用户反馈识别效果很差 —— microsoft/VibeVoice-ASR-BitNet
- 9B 大模型曾被微软从 GitHub/HuggingFace 下架,获取不便 —— microsoft/VibeVoice-ASR-BitNet
- 9B 版本重且慢 —— microsoft/VibeVoice-ASR-BitNet
展开其余 33 条
- 非英语 WER 明显高于英语,如葡萄牙语 24.87、越南语 22.38 —— microsoft/VibeVoice-ASR-BitNet
- AISHELL4 中文会议场景 WER 达 27.45,弱于 SenseVoice 和 FunASR —— microsoft/VibeVoice-ASR-BitNet
- 单线程 RTF 达 1.98,未达实时 —— microsoft/VibeVoice-ASR-BitNet
- GPU 推理时存在内存泄漏问题 —— ai-sage/GigaAM-Multilingual
- 不支持 vllm/sglang 推理框架 —— ai-sage/GigaAM-Multilingual
- 英文识别表现仅为中等水平 —— ai-sage/GigaAM-Multilingual
- 缺少 safetensors 格式 —— ai-sage/GigaAM-Multilingual
- 词级时间戳功能尚不完善 —— ai-sage/GigaAM-Multilingual
- 英语识别效果不如其他语言,表现中等 —— ai-babai/gigaam-multilingual-mlx-int8-g64
- MLX 方案更适合小规模使用和研究,大规模场景下未必有优势 —— ai-babai/gigaam-multilingual-mlx-int8-g64
- 英语识别质量仅为中等,WER 明显高于 Whisper 和 Omnilingual —— ai-babai/gigaam-multilingual-mlx-int4-g64
- 长尾语言面临严重的数据稀缺问题 —— ai-babai/gigaam-multilingual-mlx-int4-g64
- 对静音和底噪敏感,容易产生幻觉转录 —— CohereLabs/cohere-transcribe-arabic-07-2026
- 需要前置 VAD 或噪声门控才能避免非语音幻觉 —— CohereLabs/cohere-transcribe-arabic-07-2026
- 标准 transcribe() 接口报错 'Unknown prompt key: None',需手动传入语言参数 —— nvidia/nemotron-3.5-asr-streaming-0.6b
- 德语转录表现不佳 —— nvidia/nemotron-3.5-asr-streaming-0.6b
- 希腊语词尾 sigma (ς) 映射为 <unk> 导致系统性错误 —— nvidia/nemotron-3.5-asr-streaming-0.6b
- from_pretrained() 加载时报 ModuleNotFoundError: 'rnnt_bpe_models_prompt' —— nvidia/nemotron-3.5-asr-streaming-0.6b
- 不支持 Python 3.10 —— nvidia/nemotron-3.5-asr-streaming-0.6b
- Windows 下存在目录错误 —— nvidia/nemotron-3.5-asr-streaming-0.6b
- 若不启用路由而强制走 LoRA 分支,可能在干净音频上产生不必要的文本改动 —— zhifeixie/Mega-ASR
- 社区实测样本极少,缺乏大规模多场景的第三方验证 —— zhifeixie/Mega-ASR
- CPU 上推理极慢,处理单次通话耗时很长,MacBook 风扇狂转 —— pyannote/speaker-diarization-3.1
- CPU 运行时的负载比替代方案 diarize 高约 3 倍 —— pyannote/speaker-diarization-3.1
- 在高品质、非重叠的音频样本中仍无法正确检测不同说话人 —— pyannote/speaker-diarization-3.1
- 有用户反馈 pyannote 准确度不够,转而使用付费方案 —— pyannote/speaker-diarization-3.1
- community-1 在所有关键指标上均已显著超越 3.1 —— pyannote/speaker-diarization-3.1
- 实时说话人分离场景中表现不理想,社区仍在寻找替代方案 —— pyannote/speaker-diarization-3.1
- 主要错误来源于漏检语音片段,其次是说话人混淆 —— pyannote/speaker-diarization-3.1
- 部分用户反映转写质量明显不如 large-v3 —— mlx-community/whisper-large-v3-turbo
- 标点处理方式与 large-v3 存在明显差异 —— mlx-community/whisper-large-v3-turbo
- 核心代码仍在合并进 ESPnet 主仓库,尚未稳定 —— espnet/xeus
- 需下游微调才能用于识别/翻译等具体任务,不可开箱即用 —— espnet/xeus