讲师中心 微信公众号
AI工具推荐 视频效率加速

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

梦晨君_4258

梦晨君_4258

发布时间:2026-07-04 09:39:39

|

976人浏览过

|

来源于php中文网

原创

视觉-语言-动作(vla)模型在实际部署中常面临一个关键挑战:当相机视角、安装位置或机器人本体结构发生微小变动时,其性能往往显著下滑。

传统采用的“上下文学习”(In-Context Learning)方法,通常将上下文视为人工提供的任务示范样本,机器人仅模仿示例行为,却无法理解底层系统配置逻辑。一旦环境发生变化,研究人员往往不得不重新采集数据、重新训练模型,耗时耗力且难以快速响应。

为应对这一瓶颈,复旦大学邱锡鹏教授团队创新性地提出“上下文世界建模”(In-Context World Modeling,ICWM)。该方法要求机器人在正式执行任务前,先进行一段与任务无关的随机交互探测,并将整个交互过程作为上下文输入送入模型,从而让模型自主推断当前系统的整体运行状态。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

论文链接:https://www.php.cn/link/b263abe5072c23fa8bda9d66807508cf

仿真与真实机器人实验验证表明,ICWM 在多项指标上全面超越现有主流方法。该方法仅需极少量随机探测即可实现对新环境的自适应,无需额外人工示范,也无需更新模型参数,显著增强了跨视角与跨硬件配置的泛化能力。

ICWM 的核心设计思路

相较于传统 VLA 模型,ICWM 在动作生成前会先基于交互上下文识别当前系统配置,再据此规划后续行为,全程不依赖新示范或参数微调。其完整流程分为训练与推理两个阶段:

训练阶段:研究者在每个任务样本前拼接一段与任务无关的交互片段,作为模型的上下文输入。模型通过分析该片段中视觉观测的变化规律,学习判断当前系统所处的配置状态。ICWM 并未引入独立的世界模型模块,而是直接利用 VLA 主干网络处理交互历史序列——既降低了模型复杂度,又确保上下文信息能高效服务于动作预测。

推理阶段:机器人不会立即执行目标任务,而是首先开展主动探测(active probing),记录探测过程中动作施加前后对应的观测变化,构建出交互上下文(interaction context)。随后,模型将该上下文、当前观测图像以及任务指令三者联合编码,完成动作决策。

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

图|ICWM 的训练与推理流程概览。

实验结果

研究团队围绕跨视角迁移、真实机器人平台验证及多种分布外(OOD)扰动场景展开系统性评测。结果证实,ICWM 能有效借助交互上下文提升环境适应性,并展现出向语义变化、机器人形态差异等复杂场景拓展的潜力。

1. 仿真环境测试

团队首先在 LIBERO 仿真基准上开展跨视角泛化实验。结果显示,ICWM 在已见视角和未见视角下均优于所有基线方法。相比仅依靠多视角数据训练的传统方案,ICWM 在已见视角下平均成功率高出 8.1%,在未见视角下更达 13.0% 的优势。

值得注意的是,即便将真实的相机内参与外参显式输入模型,其泛化性能仍明显弱于 ICWM。此外,在长时序操作任务中,ICWM 对累积误差的抑制能力也更为突出。

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

图|LIBERO 基准上,已见与未见视角下的任务成功率(%)。

2. 真实机器人平台验证

在 UR5e 真实机器人平台上,ICWM 同样展现出压倒性优势。评估采用一套由 12 台相机组成的多视角系统,覆盖堆叠、抓取、拾取与放置等多种典型操作任务。

实验数据显示,标准 VLA 模型对视角变化极为敏感:当从训练视角切换至测试视角时,平均成功率从 68% 断崖式跌落至 17%;而 ICWM 则保持了高度稳定性。

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

图|UR5e 平台上的真实世界性能评测。

定性分析进一步佐证了该结论:在新环境中,普通 VLA 模型常出现定位偏差、夹爪过早闭合等问题;ICWM 的行为则更加鲁棒、连贯。

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

图|定性效果对比。

3. 消融研究与深入分析

消融实验明确指出,ICWM 的性能增益源自交互上下文的有效建模,而非简单的统计模式匹配。

若移除图像观测信息,模型平均成功率从 25.0% 急剧下降至 10.9%;若剔除动作序列信息,或完全不提供交互上下文,性能亦明显受损。更关键的是,当人为注入错误上下文时,模型表现甚至比无上下文情况更差。对照实验还表明,只有经过专门训练的模型才能真正利用交互上下文实现环境适配;未经训练的模型即使接收相同上下文,性能几乎归零。

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

图|交互上下文消融实验结果。

从可视化分析可见,模型已具备区分不同视角与配置的能力:相同视角下的隐空间表征高度聚集,不同视角间则呈现清晰分离趋势。

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

图|不同分布外(OOD)视角下 Ψ(T) 的 t-SNE 可视化结果。

研究还发现,ICWM 的有效性不依赖特定探测策略:无论是纯随机运动,还是仅沿 XY 平面、Z 轴或旋转方向进行探测,ICWM 均稳定优于对照方法,成功率提升幅度达 15%–27%。泛化性测试进一步显示,ICWM 对机器人形态变化具备较强鲁棒性,在语义扰动场景中亦表现出一定适应能力。

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

图|分布外(OOD)视角下,不同探测策略的成功率(%)。

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

图|对语义场景扰动与机器人形态变化的鲁棒性评估。

局限性与未来展望

尽管 ICWM 显著增强了VLA 模型在未知环境中的自适应能力,但研究团队也坦诚指出当前存在的若干限制:

第一,在部分极端视角条件下(如严重遮挡、目标频繁脱离视野),ICWM 的性能提升仍较为有限。根本原因在于这些场景下视觉信号质量大幅下降。未来工作可融合多视角协同感知、主动视角重定位机制以及更强大的遮挡建模模块加以改进。

第二,在语义扰动实验中,ICWM 的增益尚不显著。这主要源于当前训练数据集中场景语义多样性与组合配置丰富度不足。若能在后续训练中引入更广泛的语义组合与物理配置样本,ICWM 在语义层面的泛化能力有望进一步跃升。

更多技术细节,请参阅原始论文。

本文来自微信公众号“学术头条”(ID:SciTouTiao),作者:夏千斯,36氪经授权发布。

热门AI工具

更多
Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
C++运算符基础入门
C++运算符基础入门

本专题详细讲解了C++运算符的类型、语法与使用方法,涵盖算术运算符、关系运算符、逻辑运算符、位运算符、赋值运算符、条件运算符及其他特殊运算符,并通过代码示例解析优先级与结合性。

0

2026.10.09

PixPix官网入口合集
PixPix官网入口合集

本专题汇总了PixPix官网在线使用入口及平台功能详解,涵盖文生图、图生图、AI图片编辑、AI视频创作等核心能力,并整理了AI爆款图片复刻、商品套图、详情页生成、视频变清晰与去水印等电商专项工具的使用教程。同时收录了PixPix MCP接入Codex、Claude Code等主流Agent的操作指南,助您一站式完成AI图片与视频创作。

0

2026.10.09

FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

60

2026.10.08

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

160

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

140

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

100

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

100

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

120

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

320

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn