Mega-ASR (THU)
面向远场、混响、重叠语音等严重声学退化的鲁棒语音识别
仓库标识zhifeixie/Mega-ASR
显存未知许可 可商用任务 语音识别最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- PyTorch
适合与不适合
独立证据与社区反馈
独立来源不足,尚未形成社区共识:Brian Roemmele 将其作为日常音频转文字的主力工具,称效果“惊人”,但社区反馈目前仅此一例,尚未形成广泛共识。
- 在真实恶劣声学环境下仍能稳定输出可用转录,减少空白输出和幻觉
- 智能路由机制在干净音频上自动回退基座模型,避免 LoRA 对高质量音频造成不必要的改动
- 若不启用路由而强制走 LoRA 分支,可能在干净音频上产生不必要的文本改动
- 社区实测样本极少,缺乏大规模多场景的第三方验证
可信度arXiv论文2605.19833,仓库含模型权重、路由器和评估脚本
完整规格
下载动量
30天下载 0 → 0