讲师中心 微信公众号
AI工具推荐 视频效率加速

Mega-ASR— NTU、NUS、上海AI Lab开源的语音识别模型

大宇姑娘_6971

大宇姑娘_6971

发布时间:2026-05-24 11:21:19

|

643人浏览过

|

来源于php中文网

原创

Mega-ASR是什么

mega-asr 是南洋理工大学(ntu)、新加坡国立大学(nus)与上海人工智能实验室联合开源的全场景鲁棒语音识别基座模型,模型以 qwen3-asr 1.7b 为底层架构,针对真实世界中复杂声学环境(如噪音、远场、回声、遮挡、传输丢包等复合场景)下的语音识别难题,提出了可扩展的复合数据构建与渐进式声学到语义优化框架。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Mega-ASR— NTU、NUS、上海AI Lab开源的语音识别模型

Qwen Logo Designer
Qwen Logo Designer

商业LOGO设计技能:依据用户描述,使用阿里云百炼千问图像模型(qwen‑image‑2.0‑pro)生成专业商业LOGO图片。适用场景:设计公司/品牌LOGO、生成商业标识图标、创建品牌视觉符号、按描述生成logo图片。支持自定义尺寸、风格、负面提示词等。

下载

Mega-ASR的主要功能

  • 全场景鲁棒语音识别:覆盖 7 种原子声学效应(噪音、远场、遮挡、回声混响、录音染色、电子失真、传输丢包)及 54 种物理合理的复合声学场景,实现单一模型应对多种真实环境。
  • 渐进式声学到语义优化(A2S-SFT):三阶段渐进训练,先训练编码器与对齐器适应中等退化语音(WER
  • 双粒度动态奖励优化(DG-WGPO):针对 WER>30% 时模型错误模式从”词级混淆”突变为”句级幻觉/丢句”的问题,引入 Token 级精修奖励与句子级重构奖励,通过 WER 门控动态融合,强化极端条件下的语义保持能力。
  • 环境感知即插即用路由:内置轻量级音频质量分类器(单层 Transformer),自动判断输入音频为”干净”或”退化”状态,干净语音走原始 Qwen3-ASR backbone,退化语音走 Mega-ASR 鲁棒 LoRA 分支,实现零侵入式增强。
  • 开源数据集 Voices-in-the-Wild-2M:发布包含 240 万条合成音频及 5,000 条评测音频(含 1,500 条真实录音)的大规模鲁棒 ASR 数据集,覆盖 7 大元场景与 54 种混合场景,难度分布经过可控实验校准。

Mega-ASR的技术原理

  • Voices-in-the-Wild-2M 数据构建:采用频谱级代码仿真,先独立模拟 7 种原子声学效应作为基础,再通过智能体验证物理合理性(如”教堂=远场+回声”),组合生成 54 种复合场景;通过统一严重程度参数 k∈[0,1] 控制难度分布,并剔除 WER>70% 的不稳定样本。
  • A2S-SFT 三阶段训练:第一阶段仅训练音频编码器与对齐器,按 WER
  • DG-WGPO 动态奖励机制:静态奖励由 WER 奖励与反重复惩罚组成;动态奖励核心包含 Token 级精修奖励(区分软/硬替换错误)和句子级重构奖励(基于最长公共子序列与长度惩罚),通过 WER 门控(阈值 τ=0.3)镜像融合,低 WER 时侧重局部精修,高 WER 时侧重整体语义保持。
  • 环境感知路由模型:基于 80 维 log-Mel 特征,采用轻量级卷积前端 + 单层 Transformer 编码器 + 注意力池化结构,二分类准确率超过 99.5%,推理开销极低,实现清洁/退化语音的自动分流。

如何使用Mega-ASR

  • 环境准备与依赖安装:基于 Qwen3-ASR 开源生态搭建运行环境,安装相关音频处理库及模型推理依赖(如 transformers、torchaudio 等),确保支持 80 维 log-Mel 谱特征提取与模型权重加载。
  • 加载双模型权重:同时加载两个组件,原始 Qwen3-ASR 1.7B backbone 作为基座模型,以及 Mega-ASR 的鲁棒性 LoRA 权重;另外需加载轻量级环境感知路由模型(单层 Transformer,隐藏维度 128,基于 LoRA 微调)。
  • 音频预处理后送入路由模型:对输入音频提取 80 维 log-Mel 谱特征,经过轻量级卷积前端编码后,送入路由模型的单层 Transformer 进行二分类判断,自动识别当前音频属于”干净语音”还是”退化语音”(准确率超 99.5%)。
  • 自动分流推理:路由模型判定为干净语音时,直接调用原始 Qwen3-ASR backbone 进行标准识别,保证 LibriSpeech 等干净域性能不受损;判定为退化语音时,自动切换至 Mega-ASR 鲁棒 LoRA 分支,激活复合声学场景下的强抗噪与语义恢复能力。
  • 获取识别结果:模型输出文本转写结果,在极端退化场景(如远场峰值 -5.2dB、NOIZEUS 0dB)下仍能避免空白输出或语义幻觉,保持高完整度的语音识别结果。

Mega-ASR的核心优势

  • 复合场景性能领先:在 Voices-in-the-Wild-Bench 混合退化场景下,WER 达到 2.73/4.57,相对 Whisper-Large-v3 降低 65.8%/69.1%,相对 Gemini-3-Flash 降低 65.8%;在 NOIZEUS 0dB 极端条件下,WER 降至 19.80,相对 Qwen3-ASR 降低 17.4%,相对 Gemini-3-Flash 降低 64.5%。
  • 语义恢复能力突出:在远场峰值 -5.2dB 的极端案例中,Qwen3-ASR 输出空白(WER 100%),Gemini-3-Pro 产生流畅但无关的幻觉内容(WER 86.1%),而 Mega-ASR 精确恢复参考文本(WER 0.0%)。
  • 干净域性能无损:通过环境感知路由,LibriSpeech 等干净基准 WER 从 1.78/3.57 进一步优化至 1.63/3.37,热词识别、流式推理等原有能力不受影响。
  • 训练稳定性高:数据集构建过程中过滤 WER>70% 的不可学习样本,A2S-SFT 采用课程学习策略逐步扩展难度,避免模型在极端退化条件下训练崩溃。
  • 完全开源可复现:模型权重、训练代码、数据集构建流程及评测基准均开源,基于成熟的 Qwen3-ASR 生态,社区接入门槛低。

Mega-ASR的项目地址

  • 项目主页:http://xzf-thu.github.io/Mega-ASR/
  • GitHub仓库:http://github.com/xzf-thu/Mega-ASR
  • Hugging Face 模型库:http://huggingface.co/zhifeixie/Mega-ASR
  • arXiv技术论文:http://arxiv.org/pdf/2605.19833

Mega-ASR的同类竞品对比

对比维度 Mega-ASR Whisper Large-v3 Qwen3-ASR 1.7B Gemini-3-Flash
开源状态 完全开源 完全开源 完全开源 闭源
底层架构 Qwen3-ASR 1.7B Whisper Qwen3-ASR 1.7B Gemini
复合场景覆盖 7种原子+54种复合 有限 有限 有限
NOIZEUS 0dB WER 19.80 ~55.78 23.97 55.78
VOiCES R4-B-F WER 45.69% ~60%+ 54.01% ~50%+
干净语音性能 1.63/3.37 (LibriSpeech) 1.78/3.53 1.78/3.57 1.52/3.29
语义恢复能力 强(极端条件下WER可降至0%) 弱(易丢句/幻觉) 中等 弱(易产生幻觉)
即插即用增强 支持(环境感知路由) 不支持 不支持 不支持

Mega-ASR的应用场景

  • 车载语音交互:应对发动机噪音、风噪、多人交谈等复合声学环境,提升导航与指令识别准确率。
  • 远场会议/课堂转写:解决会议室回声、距离衰减、设备录音染色等问题,实现高质量自动纪要。
  • 户外采访与直播字幕:在街道噪音、风声、遮挡等恶劣条件下保持字幕生成的完整性与准确性。
  • 智能家居语音控制:提升远距离、多房间混响环境下的唤醒词与指令识别鲁棒性。
  • 电话客服与 VoIP 通话分析:针对传输丢包、码率压缩、电子失真等信道退化问题,保障通话内容识别质量。

热门AI工具

更多
Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

80

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

40

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

60

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

280

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

160

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

140

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

80

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn