阿里千问于9月23日对语音技术栈完成全面升级。qwen-audio-3.1系列一次性发布五款全新模型,覆盖语音识别、语音合成、实时交互、音频创作与音频理解五大方向,构建起“理解—生成—交互—创作”全链路音频能力体系,并同步大幅下调全线服务价格:tts成本直降约70%,realtime服务降幅达85%,asr费用更是锐减95%。这一轮密集动作释放出明确信号——语音技术正加速走向普惠,使用门槛被前所未有地拉低。
在语音识别维度,Qwen-Audio-3.1-ASR正式接棒成为新一代端到端语音识别大模型。其核心突破在于“语境感知力”显著增强:原生支持转写后自动润色,可智能剔除冗余语气词、合并重复表达、重构松散语义,输出更通顺、更具逻辑性的文本,而非原始粗粒度转录结果;分角色转写能力则完整还原“谁在何时说了什么”,为会议纪要、深度访谈及多轮对话分析提供结构清晰、可回溯的文本档案。该模型采用联合建模架构,同步输出说话人标签、毫秒级时间戳与规范化文本,既支持有序轮流发言识别,也能精准捕捉短促插话与多人重叠语音,实现个体话语颗粒度级分离。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

语言覆盖能力同样跃升:单模型兼容30种国际语言与16类中文方言,行业术语、专业实体及分级热词识别能力全面提升,且能依托长音频历史上下文维持人名、术语的一致性表达。首字响应延迟压缩至约160毫秒,边说边转写流畅无卡顿。实测表现扎实:在KeSpeech与WSYue两大公开方言数据集共11个子任务上,平均字错误率(CER)仅为4.55%;针对中文16种方言内部测试,平均CER为10.38%,其中温州话等高难度方言识别准确率提升尤为突出;方言语音转普通话语义级句子准确率高达82.10%。

更具前瞻性的探索来自基于下一代架构的Qwen-Audio-3.1-ASR-Next。它不再局限于提取语音中的文字信息,而是迈向“全音频语义理解”——可识别并解析人物情绪状态、环境背景音、机械运作声等非语言要素,支持声音内容描述、关键事件时间定位及基于整段音频的多跳问答推理。面对一段混杂对话、BGM与街道环境音的复杂音频,它不仅能生成精准字幕,还可输出声音成分清单、标注各类事件发生时刻,并回答关于音频整体内容的深层问题。在分角色ASR基准测试中,ASR-Flash-Next与ASR-Flash分别在八项核心指标中斩获五项与三项第一,全面超越此前业界领先的Fun-ASR级联方案。
从零搭建飞书机器人。支持 MiniMax/MiMo 等模型、工具调用(搜索/天气/百科/记忆)、Skill 架构。一站式交付可上线运行的飞书群聊 bot。基础版本,后续可自行升级能力
语音合成方面,Qwen-Audio-3.1-TTS聚焦“真实表达力”,不止于发音准确,更强调语调、节奏与情感的真实还原。支持多语种与多方言合成,同一音色跨语言时具备自然迁移能力,实现“一音多语”无缝切换;同时可通过自然语言指令灵活调控情绪倾向、语速快慢与表达风格,使合成语音高度适配具体场景与内容调性。
真正实现范式跃迁的是Qwen-Audio-3.1-TTS-Next——它依托下一代通用音频生成架构,将音频生产从“单一语音合成”拓展为“端到端全要素音频生成系统”。传统流程需由主播、音效师、混音师、剪辑师协同完成再人工拼接;而该模型仅需输入文本、时间戳及参考音频,即可统一生成人声、环境音、拟音与背景音乐。支持多人音色克隆与多轮角色对话,确保连续内容中各角色音色稳定不漂移,并能自然演绎停顿、抢话、附和、情绪转折等真实对话特征;支持多声源融合建模,精准呈现材质质感、空间距离与声场层次——例如有声书制作中,可同步生成旁白、双角色对白,并叠加城市底噪、晚风轻拂、易拉罐碰撞等环境细节,让听感完全沉浸于故事设定空间。专业能力亦全面进阶:支持自然语言控制语气强度、语速变化、音量起伏、音乐流派与配器组合;提供细粒度时间戳对齐、高保真声音复刻及48kHz高质量输出;对白启停、声音事件节奏均可毫米级编排,充分满足播客、有声书、影视配音、游戏语音与广告制作等多元专业需求。
实时语音交互方向,Qwen-Audio-3.1-Realtime彻底摆脱“ASR→LLM→TTS”线性串接模式,转向全双工原生架构:用户可随时插话、打断、修正,交互体验无限趋近真人通话。模型理解对象已从纯文本扩展至语音信号所承载的情绪波动、意图倾向与潜台词——当检测到用户语气低落,它不会机械回应“我理解”,而是主动放缓语速、选用更温和措辞;跨语言对话中,上下文连贯性、语调自然度与节奏稳定性全程在线;面对模糊信息拒绝臆测,对高风险内容坚守安全边界。其底层采用多教师蒸馏框架,在保障超低延迟前提下同步提升推理质量与内容安全性,并支持在实时对话流中直接调用Agent工具链,无缝接入API、知识库或企业业务系统,执行查询、操作与反馈闭环,让AI真正成为“听得懂、想得到、办得成”的对话伙伴。
规模化落地已全面启动。Qwen-Audio-3.1-Realtime正深度集成至Qoder、千问办公等智能体平台,以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等终端硬件,用户无需唤醒手机或打开电脑,仅凭语音即可发起任务、动态追加条件或即时调整需求。从ASR的智能润色与方言泛化能力,到ASR-Next的泛音频语义理解;从TTS的跨语言音色一致性,到TTS-Next的全要素音频生成;再到Realtime的拟人化共情交互与工具链调用——千问此次发布的五款模型,沿着五条明确技术主线并行演进,将“听得清、说得像、聊得真、创得全”整合为语音这一最自然的人机接口。而高达95%的ASR降价,则近乎彻底抹平了语音技术大规模应用的最后一道准入壁垒。

















