openai近日正式推出全新一代超旗舰级大模型——gpt-6astra。公司联合创始人兼总裁格雷格·布罗克曼(greg brockman)在面向媒体的闭门发布会上给予该模型极高评价,甚至明确表示:人类极有可能正借由这一模型、在此关键历史节点,真正踏入通用人工智能(agi)时代。
从权威基准测试结果来看,Astra在多项核心能力维度实现了跨代式突破。数学与科学推理方面,其在FrontierMath Tier4和GPQA Diamond两项高难度评测中分别斩获97.6%与96%的惊人得分;在实操类任务中,于长周期软件工程测试DeepSWE、CAD建模基准BenchCAD及漏洞利用挑战ExploitBench中,准确率分别达74.1%、95.9%与100%,后者更实现全题满分;尤为突出的是,在极具挑战性的抽象推理测试ARC-AGI-3中,Astra依托专设的保留推理机制与压缩上下文架构,取得99.9%的近乎完美表现,展现出与人类认知水平高度一致的环境建模与动态推理能力。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

作为定位超旗舰的产品,Astra配备高达105万token的超宽上下文窗口,单次最大输出长度达12.8万token,知识覆盖截止至2026年4月30日,并支持low、medium、high、xhigh与max共五级可调推理强度。相应地,其商业化定价也刷新行业纪录:标准模式下,每百万输入token收费10美元、输出token收费50美元;当单次输入超过27.2万token时,输入与缓存费用翻倍,输出单价升至75美元;另提供“双倍计费+极速响应”的加速模式。据第三方权威评测机构Artificial Analysis报告显示,尽管Astra在通用智能综合指数上与当前顶尖竞品基本持平,但其Coding Agent专项得分为67分,幻觉率显著压降至51%,充分印证了其卓越的token利用率与突出的投入产出比。
Astra最具革命性的技术跃迁,集中体现在对图形用户界面(GUI)的原生操作能力上。区别于传统AI严重依赖API接口或MCP协议进行软件适配,Astra可直接通过屏幕图像、键盘输入与鼠标动作这组沿用数十年的人机通用交互通道,像真实用户一样感知界面状态、理解当前上下文并执行精准操作。在OSWorld2.0跨平台GUI操作基准中,Astra以72.6%的高分领跑,平均任务耗时较上一代缩短约47%。无论是数分钟内完成猫咪寄养服务匹配与岗位信息检索,还是依据一张照片在Blender中重建高保真3D模型并无缝导入Unreal Engine 5,抑或在Excel、Power BI及各类垂直领域专业工具中高效处理多源异构数据,Astra均能跳过API封装层,实现从自然语言指令到终端执行结果的端到端直通。

在真实场景落地验证中,多位参与内测的开发者与专业机构一致确认了Astra所具备的强生产力交付能力。从一次性生成高拟真度Minecraft演示世界、构建可在浏览器中直接运行的完整可玩游戏,到快速审阅数万字财务审计报告并精准识别人为植入的逻辑矛盾与数据偏差,Astra已成功横跨游戏开发、税务申报、建筑可视化渲染与财务合规核查等多个差异显著的专业赛道,切实达成“零人工干预、全流程自主闭环”的复杂任务执行目标。
伴随模型能力持续跃升,安全治理与价值对齐问题亦引发广泛关注。OpenAI强调,Astra在指令遵循精度、行为一致性及对齐鲁棒性方面进行了系统性增强,并强化了沙箱隔离测试机制、网络访问管控策略以及模型权重加密保护体系。然而,首席科学家雅库布·帕霍基(Jakub Pachocki)亦坦诚指出:随着智能层级不断逼近甚至局部超越人类理解阈值,模型内部决策逻辑将日趋黑盒化,未来或将出现主动规避评估、反向监控测试流程乃至尝试误导验证系统的潜在风险。
目前,Astra已率先面向少量经严格筛选的战略合作伙伴企业开放试用权限;ChatGPT各层级订阅用户及API开发者,预计将在未来数日内陆续获得接入资格;此外,一款专为网络安全机构定制的强化防御版Astra亦同步启动定向部署。随着Astra全面登场,AI与人类数字基础设施之间的交互范式,正经历一场前所未有的结构性重构。


















