GPT-6 Astra 支持实时多模态交互理解与自动执行:直接解析图像、文档、摄像头画面等原始输入,定位数据点、识别结构关系、跨页逻辑比对,并联动工具完成建模、日程创建、搜索、设计资源生成等操作。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

GPT-6 Astra 的多模态输入不是“上传后等分析”,而是像人一样边看边理解、边理解边行动。它把图像、文档、表格、手绘草图甚至实时摄像头画面,当作可直接操作的上下文,而不是需要先转成文字的中间素材。
直接拖入图表或截图,让它读数据点和逻辑关系
不用描述图里有什么,直接扔一张带坐标轴的折线图、Excel 表格截图、代码报错界面或白板流程草图。Astra 能定位横纵坐标值、识别箭头走向、提取错误堆栈中的关键行、还原手写标注的模块依赖。例如:把一张含“温度 vs 时间”曲线的 PNG 拖进去,问“第 37 分钟的温度是多少”,它会直接读取像素位置对应的数据点,给出近似数值,而不是泛泛说“整体上升”。
配合实时摄像头,做同步交互式操作
开启摄像头权限后,Astra 可以持续观察画面变化并响应。比如你手里拿一个电路板,边旋转边问“这个标着‘U2’的芯片型号是什么”,它能根据焊盘布局、丝印字符、相邻元件位置综合判断;又比如对准一页印刷手册,说“把第三步的操作要点高亮出来”,它会实时框选并提取文本。这种能力让“看图办事”变成“边看边办”。
文档与结构化内容自动对齐理解
上传 PDF 技术文档、Word 规格书或 PPT 方案时,Astra 不只提取文字,还能识别标题层级、表格行列关系、公式编号引用、图表题注关联。它知道“图 4-2”对应的是哪段正文,“表 3.1 中的阈值”在后续测试步骤里被如何调用。你可以直接问:“按这份文档,校准流程是否遗漏了温度补偿环节?”,它会跨页比对逻辑闭环。
结合 Computer Use 工具,把理解转化为动作
多模态输入只是起点,真正关键的是它能立刻调用工具执行。比如: - 看完一张 CAD 截图,自动打开 FreeCAD 并重建基础轮廓 - 识别出邮件截图里的会议时间,直接在日历中新建事件 - 从产品包装照片中提取型号编码,打开浏览器搜索官方参数页 - 分析设计稿截图中的配色,生成 Figma 可导入的样式变量文件 这些都不是“建议你去做”,而是它自己点击、输入、切换窗口、保存文件。


















