openai近期被曝正秘密研发一款代号为“gpt-bidi-1”的全新双向语音模型,计划借此对chatgpt的语音交互能力实现质的飞跃。该模型最显著的技术革新在于其原生支持双向(bidirectional)语音处理架构,一举突破传统ai语音系统“你讲我听、我讲你听”的单向轮替模式。借助这一能力,系统可在用户说话的同时持续收音、实时理解,并即时响应——即使遭遇中途插话、语义打断或突发修正,也能无缝衔接、不卡顿、不崩溃,从而让对话节奏更贴近真人交流。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

据内部代码线索显示,OpenAI已在网页版与移动客户端中悄然植入多项适配逻辑,为GPT-Bidi-1的正式部署铺平道路。上线后,该功能将作为独立语音模式与现有“高级语音模式(Advanced Voice Mode)”共存,用户可通过设置一键切换至标注为“Bidi(最新)”的选项。更值得注意的是,此次升级首次在语音维度引入精细化响应分级体系,提供“高(High)”、“中(Medium)”、“即时(Instant)”三档配置——分别对应深度推理、平衡体验与极速响应,让用户可根据会议速记、创意讨论或日常问答等不同场景灵活选择。

此次演进远不止于音色优化或语调润色,而是OpenAI多模态技术蓝图中的战略性补强。
当前,其文本大模型已迈入GPT-5.5阶段,具备更强的逻辑推演与上下文整合能力;相比之下,语音模型长期处于能力洼地,致使图文、语音协同体验存在明显割裂。GPT-Bidi-1的落地,不仅填补了语音侧的智能断层,更清晰传递出OpenAI将语音交互确立为下一代AI主入口的战略意图——也为未来面向消费端的音频优先(Audio-first)硬件生态,以及面向企业的实时语音分析、智能座席等专业工具,构建起坚实可靠的核心底座。


















