模型 / Mega-ASR (THU)

Mega-ASR (THU)

面向远场、混响、重叠语音等严重声学退化的鲁棒语音识别

作者 zhifeixie

仓库标识zhifeixie/Mega-ASR

显存未知许可 可商用任务 语音识别最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
PyTorch

Hugging Face 源仓库 ↗

适合与不适合

入选理由
基于Qwen3-ASR的鲁棒ASR新方案,有论文和代码示例。
对位
对位Whisper等常规ASR在恶劣声学条件下
适合
严重噪声、混响、剪切、限带语音转录 / 远场、重叠语音、低质量录音识别
不适合
安静环境下的高保真转写

独立证据与社区反馈

1 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

独立来源不足,尚未形成社区共识:Brian Roemmele 将其作为日常音频转文字的主力工具,称效果“惊人”,但社区反馈目前仅此一例,尚未形成广泛共识。

  • 在真实恶劣声学环境下仍能稳定输出可用转录,减少空白输出和幻觉
  • 智能路由机制在干净音频上自动回退基座模型,避免 LoRA 对高质量音频造成不必要的改动
  • 若不启用路由而强制走 LoRA 分支,可能在干净音频上产生不必要的文本改动
  • 社区实测样本极少,缺乏大规模多场景的第三方验证

可信度arXiv论文2605.19833,仓库含模型权重、路由器和评估脚本

完整规格

规模
1.7B · 权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
PyTorch / Transformers
血统
微调自 Qwen3-ASR-1.7B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 0 → 0

观测时间线