指南 / 语音识别模型

语音识别模型

共 14 个 · 数据更新于 2026-09-07

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

  • 流式说话人归属语音转写,支持10语言与热词

    参数量
    7B
    商用
    可商用

    当前运行配置 microsoft/VibeVoice-ASR-Streaming-7B

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • 社区版说话人分离,用于会议/访谈音频

    商用
    需自查

    当前运行配置 pyannote/speaker-diarization-community-1

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    缺少可用的显存依据
    国内可达
    需代理
  • 多语言语音识别与翻译,零样本泛化

    参数量
    1.55B
    商用
    需自查

    当前运行配置 openai/whisper-large-v3

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    30s 音频
    国内可达
    需代理
    其它形态
    原生 · MLX
  • 可控逐字/意图风格的多语言ASR,精准词级时间戳

    参数量
    1.55B
    商用
    需自查

    当前运行配置 nyralabs/CrisperWhisper2.0_large

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    非商业研究许可
    上下文
    30s音频窗口,长音频自动拼接
    国内可达
    需代理
  • 边缘CPU实时多语言语音识别,压缩至1.58GB

    参数量
    323M
    商用
    可商用

    当前运行配置 microsoft/VibeVoice-ASR-BitNet

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • GigaAM-Multilingual (ai-sage)

    量化自 GigaAM-Multilingual

    70+语言语音识别,关注俄语、哈萨克语等小语种

    参数量
    220M / 600M
    商用
    可商用

    当前运行配置 ai-sage/GigaAM-Multilingual

    显存
    暂无估算
    查看详情
    查看运行方式
    python -c "from transformers import AutoModel; model=AutoModel.from_pretrained('ai-sage/GigaAM-Multilingual', revision='ctc', trust_remote_code=True); print(model.transcribe('example.wav'))"
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    mit
    国内可达
    需代理
    其它形态
    原生 · MLX
  • GigaAM-Multilingual MLX INT8 (ai-babai)

    量化自 gigaam-multilingual-mlx

    Apple Silicon 本地离线俄哈吉乌语 ASR,MLX 量化

    参数量
    224M
    商用
    可商用

    当前运行配置 ai-babai/gigaam-multilingual-mlx-int8-g64

    显存
    ~0.2GB 8-bit(估算)
    查看详情
    查看运行方式
    uvx gigaam-multilingual-mlx gigaam-stt <audio> --variant int8
    许可证
    MIT
    国内可达
    需代理
  • GigaAM-Multilingual-MLX INT4 (ai-babai)

    量化自 gigaam-multilingual-mlx

    俄语及中亚语言离线语音转录,Apple Silicon 用

    参数量
    161M
    商用
    可商用

    当前运行配置 ai-babai/gigaam-multilingual-mlx-int4-g64

    显存
    ~0.1GB 4-bit(估算)
    查看详情
    查看运行方式
    uv tool install gigaam-multilingual-mlx==0.2.0 && gigaam-stt audio.wav --variant int4
    许可证
    MIT
    上下文
    不适用
    国内可达
    需代理
  • 阿拉伯语自动语音识别 (ASR) 模型

    参数量
    2.1B
    商用
    需自查

    当前运行配置 CohereLabs/cohere-transcribe-arabic-07-2026

    显存
    暂无估算
    查看详情
    查看运行方式
    python -c "from transformers import pipeline; pipe = pipeline('automatic-speech-recognition', 'CohereLabs/cohere-transcribe-arabic-07-2026'); print(pipe('audio.wav'))"
    为何暂无估算
    权重格式未知,无法估算显存
    国内可达
    需代理
  • 覆盖40种语言的流式ASR,600M,可调延迟,面向实时语音代理

    参数量
    600M
    商用
    需自查

    当前运行配置 nvidia/nemotron-3.5-asr-streaming-0.6b

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    nemo_asr.models.ASRModel.from_pretrained('nvidia/nemotron-3.5-asr-streaming-0.6b')

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    NVIDIA Open Model License
    国内可达
    魔搭可用
  • Mega-ASR (THU)

    微调自 Qwen3-ASR-1.7B

    面向远场、混响、重叠语音等严重声学退化的鲁棒语音识别

    参数量
    1.7B
    商用
    可商用

    当前运行配置 zhifeixie/Mega-ASR

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    from MegaASR.model.megaASR import MegaASR

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • 多说话人分割模型,从音频中区分谁在何时说话

    商用
    可商用

    当前运行配置 pyannote/speaker-diarization-3.1

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    pip install pyannote.audio && from pyannote.audio import Pipeline; pipeline = Pipeline.from_pretrained('pyannote/speaker-diarization-3.1')

    其它 2 种运行方式见详情页

    为何暂无估算
    缺少可用的显存依据
    许可证
    mit
    上下文
    不适用(音频长度可分批)
    国内可达
    需代理
  • Mac端Whisper large-v3-turbo,MLX低延迟转写

    参数量
    809M

    当前运行配置 mlx-community/whisper-large-v3-turbo

    显存
    暂无估算
    查看详情
    查看运行方式
    pip install mlx-whisper && mlx_whisper audio.wav --model mlx-community/whisper-large-v3-turbo
    为何暂无估算
    权重格式未知,无法估算显存
    上下文
    30s
    国内可达
    需代理
  • 覆盖4000+语言的语音基础模型,供ASR/翻译微调

    参数量
    577M
    商用
    不可商用

    当前运行配置 espnet/xeus

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    python -c "from espnet2.tasks.ssl import SSLTask; model, _ = SSLTask.build_model_from_file(None, 'espnet/XEUS/checkpoint.pth', 'cuda')"

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    CC BY-NC-SA 4.0
    国内可达
    需代理

常见坑

  • 社区实测反馈 Whisper Large v3 准确度不如 v2,且 v2、v3 都容易幻觉 —— openai/whisper-large-v3
  • 追求最快转写速度时社区更推荐 faster-whisper —— openai/whisper-large-v3
  • 速度优势仅在 Apple Silicon 上成立:4090 上 insanely-fast-whisper 转写 10 分钟文件不到 8 秒 —— openai/whisper-large-v3
  • 项目似乎已停止开发维护 —— nyralabs/CrisperWhisper2.0_large
  • 可能需要独立显卡才能运行 —— nyralabs/CrisperWhisper2.0_large
  • 部分用户反馈识别效果很差 —— microsoft/VibeVoice-ASR-BitNet
  • 9B 大模型曾被微软从 GitHub/HuggingFace 下架,获取不便 —— microsoft/VibeVoice-ASR-BitNet
  • 9B 版本重且慢 —— microsoft/VibeVoice-ASR-BitNet
展开其余 33 条
  • 非英语 WER 明显高于英语,如葡萄牙语 24.87、越南语 22.38 —— microsoft/VibeVoice-ASR-BitNet
  • AISHELL4 中文会议场景 WER 达 27.45,弱于 SenseVoice 和 FunASR —— microsoft/VibeVoice-ASR-BitNet
  • 单线程 RTF 达 1.98,未达实时 —— microsoft/VibeVoice-ASR-BitNet
  • GPU 推理时存在内存泄漏问题 —— ai-sage/GigaAM-Multilingual
  • 不支持 vllm/sglang 推理框架 —— ai-sage/GigaAM-Multilingual
  • 英文识别表现仅为中等水平 —— ai-sage/GigaAM-Multilingual
  • 缺少 safetensors 格式 —— ai-sage/GigaAM-Multilingual
  • 词级时间戳功能尚不完善 —— ai-sage/GigaAM-Multilingual
  • 英语识别效果不如其他语言,表现中等 —— ai-babai/gigaam-multilingual-mlx-int8-g64
  • MLX 方案更适合小规模使用和研究,大规模场景下未必有优势 —— ai-babai/gigaam-multilingual-mlx-int8-g64
  • 英语识别质量仅为中等,WER 明显高于 Whisper 和 Omnilingual —— ai-babai/gigaam-multilingual-mlx-int4-g64
  • 长尾语言面临严重的数据稀缺问题 —— ai-babai/gigaam-multilingual-mlx-int4-g64
  • 对静音和底噪敏感,容易产生幻觉转录 —— CohereLabs/cohere-transcribe-arabic-07-2026
  • 需要前置 VAD 或噪声门控才能避免非语音幻觉 —— CohereLabs/cohere-transcribe-arabic-07-2026
  • 标准 transcribe() 接口报错 'Unknown prompt key: None',需手动传入语言参数 —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • 德语转录表现不佳 —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • 希腊语词尾 sigma (ς) 映射为 <unk> 导致系统性错误 —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • from_pretrained() 加载时报 ModuleNotFoundError: 'rnnt_bpe_models_prompt' —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • 不支持 Python 3.10 —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • Windows 下存在目录错误 —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • 若不启用路由而强制走 LoRA 分支,可能在干净音频上产生不必要的文本改动 —— zhifeixie/Mega-ASR
  • 社区实测样本极少,缺乏大规模多场景的第三方验证 —— zhifeixie/Mega-ASR
  • CPU 上推理极慢,处理单次通话耗时很长,MacBook 风扇狂转 —— pyannote/speaker-diarization-3.1
  • CPU 运行时的负载比替代方案 diarize 高约 3 倍 —— pyannote/speaker-diarization-3.1
  • 在高品质、非重叠的音频样本中仍无法正确检测不同说话人 —— pyannote/speaker-diarization-3.1
  • 有用户反馈 pyannote 准确度不够,转而使用付费方案 —— pyannote/speaker-diarization-3.1
  • community-1 在所有关键指标上均已显著超越 3.1 —— pyannote/speaker-diarization-3.1
  • 实时说话人分离场景中表现不理想,社区仍在寻找替代方案 —— pyannote/speaker-diarization-3.1
  • 主要错误来源于漏检语音片段,其次是说话人混淆 —— pyannote/speaker-diarization-3.1
  • 部分用户反映转写质量明显不如 large-v3 —— mlx-community/whisper-large-v3-turbo
  • 标点处理方式与 large-v3 存在明显差异 —— mlx-community/whisper-large-v3-turbo
  • 核心代码仍在合并进 ESPnet 主仓库,尚未稳定 —— espnet/xeus
  • 需下游微调才能用于识别/翻译等具体任务,不可开箱即用 —— espnet/xeus

收藏本页,或 订阅 RSS 追踪每日更新。