通义千问于当日正式推出 qwen-audio-3.1 系列语音大模型。此次更新不仅对语音识别(asr)、语音合成(tts)和实时语音交互(realtime)三大基础模型进行了全方位升级,更首次发布两款全新能力模型:面向高质量音频内容生成的 qwen-audio-3.1-tts-next,以及聚焦多模态音频深层理解的 qwen-audio-3.1-asr-next。五款模型同步上线,构建起涵盖“感知理解—智能生成—自然交互—专业创作”的全链路音频ai能力体系。为加速技术普惠,qwen-audio 全系列语音模型服务价格全面下调,其中 tts 降幅约 70%,realtime 下调约 85%,asr 降价幅度高达 95%。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

五大模型齐发,ASR 成本直降九成五
Qwen-Audio-3.1-ASR 是新一代高精度语音识别模型,首次集成原生转写后编辑能力,可自动过滤冗余语气词、修正重复表达,并对语义逻辑进行智能重组;其分角色说话人识别功能精准标注“谁在何时说了什么”,为会议纪要、访谈整理等场景提供具备时间轴与身份标签的结构化文本记录。该模型单套系统支持 30 种全球主流语言及 16 类中文方言,兼容行业专有词汇与分级热词识别,并支持低延迟流式处理,首字响应时间低至约 160 毫秒。实测数据显示,在 KeSpeech 与 WSYue 两大权威基准的 11 个子测试集上,平均字符错误率(CER)为 4.55%;在中文方言内部验证集上平均 CER 为 10.38%;AST 语义级句子准确率达 82.10%。
而基于下一代音频表征架构打造的 ASR-Next,则突破传统文字转录边界,将建模对象拓展至“完整声学信号”——不仅能识别语音内容,还可解析说话人情绪状态、环境背景音(如雨声、键盘敲击)、工业机械声等非语音信息,实现声音场景描述、关键事件时间定位及音频内容问答推理。在分角色语音识别专项评测中,其 Flash-Next 与 Flash 两个版本分别斩获五项与三项指标第一,整体性能显著超越此前业界领先的 Fun-ASR 联合系统。
在语音合成方向,Qwen-Audio-3.1-TTS 支持多语种及多方言统一音色合成,同一声音克隆模型可在跨语言发音中保持自然连贯性,并可通过文本指令灵活调控情感倾向、语速节奏与表达风格。升级版 TTS-Next 更进一步,以文本、时间戳与参考音频为联合输入,同步生成人声、音效与环境氛围音,一次性输出完整音频作品;支持 48kHz 高保真采样率输出及毫秒级细粒度时间戳控制,全面适配播客制作、有声读物、影视配音、游戏音效等专业级应用场景。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。

从“听清”到“创出”,语音正成为 AI 的天然交互界面
Qwen-Audio-3.1-Realtime 实时语音交互模型采用全双工通信架构,支持边听边说、即时插话与自然打断。其能力已从基础语音转文字,跃迁至对用户情绪状态、对话意图与上下文语境的深度理解——例如检测到用户语调低沉时,会主动放缓语速、选用更具共情力的措辞。模型还支持多语种无缝切换,并能在对话过程中动态调用外部 API、知识图谱或企业业务系统完成复杂任务;依托多教师知识蒸馏架构,在保障端到端延迟低于行业标准的同时,大幅提升了事实准确性与安全合规边界。
目前,Qwen-Audio-3.1-Realtime 已深度集成至 Qoder、千问办公等智能体平台,以及 QwenNote、A2、Eva、千问 AI 眼镜、乐奇 AI 眼镜等终端硬件生态。在这些落地场景中,用户无需依赖手机或电脑持续在线,仅通过语音即可发起任务指令,并在持续对话中实时追加条件、调整需求或查询执行进度。千问团队指出,本次 Qwen-Audio 3.1 的演进并非单一指标提升,而是沿着五大技术主线协同推进,旨在让语音真正成为连接人类、数字内容与人工智能系统的自然入口——听得懂、说得准、聊得深、创得出、反应快。

















