阿里千问今日正式发布全新同声传译大模型 qwen3.8-livetranslate。该模型采用创新的 interleave 架构,对实时同传全流程进行底层重构,在翻译准确率、语句流畅性与表达简洁性三方面同步提升;字均延迟(laal)由原来的2.8秒进一步压缩至2.3秒——在同传这种“迟半拍就断链”的强实时场景中,这0.5秒的突破,直接左右听众的自然听感体验。
在已支持60种语言的基础上,本次升级重点补全了三项关键能力,让AI同传真正迈向实用化落地:其一为实时说话人分离,可精准将每句话归属至对应发言者,并实现更稳定的音色复刻,彻底规避“张冠李戴”“声线混淆”等常见问题;其二为原文与译文同帧同步输出,双语内容实时并列呈现,便于听众边听原声、边对照译文,大幅提升信息接收效率;其三为长上下文语义消歧,模型能主动关联历史语境理解当前语句,显著提升人名、专有名词、领域术语等高风险点的翻译准确性。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

技术底座采用基于 Hybrid MoE 的 Thinker–Talker 双模块协同架构,并通过 Interleave 机制将流式语音理解、文本翻译生成与语音合成三大环节无缝串联。其中,Thinker 模块将视频画面、音频信号、原始文本及目标译文统一编码进单条因果序列,按时间轴交替排布、端到端联合建模,使“听懂”与“译出”在同一推理路径中完成;Talker 模块则基于译文结果与源语音特征,合成高度还原原说话人音色的语音输出——即最终听到的译语声音,仍是讲话者本人的声音。
从零搭建飞书机器人。支持 MiniMax/MiMo 等模型、工具调用(搜索/天气/百科/记忆)、Skill 架构。一站式交付可上线运行的飞书群聊 bot。基础版本,后续可自行升级能力

在涵盖14个语向的多说话人长时音频评测集 Omnilingua-MSpeaker 上,Qwen3.8-LiveTranslate 在翻译忠实度、流畅度、简洁度及说话人分离错误率(DER)四大指标上全面超越当前主流实时同传系统;在公开基准 FLEURS 测试集所覆盖的70个语言方向中,其在翻译质量、字均延迟、语音识别准确率与语音合成自然度四项核心维度上,亦显著优于上一代模型及行业现有方案。目前,模型试用入口与API服务均已开放,这座曾长期由专业口译员牢牢守卫的高壁垒技术高地,正被大模型持续瓦解,加速演变为普惠、开箱即用的通用基础设施。

















