文 | 智能相对论
作者 | 叶远风
2026年5月,具身智能圈内悄然流传一则并不好笑的虚构段子:某VLA模型在公开演示中,被指令“把桌上那个苹果拿给我”。机械臂流畅伸出,精准握住了旁边一只马克杯。全场鸦雀无声。工程师额角渗汗,迅速在平板上敲出一行字:“重新定义苹果”。
过去半年,类似“翻车”桥段频频上演——主角既包括国内估值领跑的几家明星独角兽,也涵盖远在太平洋彼岸的Figure AI、Physical Intelligence等头部玩家,无一幸免。
两年前,行业还在为VLA(Vision-Language-Action,视觉-语言-动作模型)高呼助威。Covariant推出RFM-1时,媒体几乎迫不及待将“通用机器人奇点”的桂冠扣上它的头顶;谷歌DeepMind发布RT-2论文后,二级市场分析师连夜重写研报,硬生生把具身智能商业化时间表提前了整整三年。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

而今,“奇点”二字早已无人提起。
大家真正揪心的是:这系统能不能在真实产线里稳稳把螺丝拧进孔位,而不是一激动就把螺丝刀捅进自己的关节电机里。VLA在现实任务中暴露的笨拙与脆弱,甚至让英伟达机器人业务核心人物Jim Fan公开断言:“VLA已死。”
但这句话,下得有点早。
VLA不会消亡,真正该退出历史舞台的,是那种妄图仅靠互联网图文视频+零星几小时机械臂遥操作数据,就想一步登天造出通用机器人的空想式VLA。与此同时,一种新范式正在悄然成形——它正将被业界反复提及却长期搁置的“世界模型”,真正嵌入VLA的底层逻辑。这或许将成为未来三年内,具身智能唯一可行的突围路径。
困在屏幕里的“缸中之脑”
要读懂VLA为何屡屡失手,必须先看清它的先天短板。
当前主流VLA架构,无论是谷歌RT-2,还是星尘智能等国内团队所构建的系统,其底层逻辑高度趋同:先用海量互联网图文数据完成视觉与语言的对齐,使模型具备“看图识物、听懂人话”的能力;再接入少量机器人动作轨迹数据,做端到端微调,使其可输出控制指令。
这套路线的最大卖点,是“省”。它试图复用大语言模型与多模态模型的既有基建,把机器人学习压缩为一次轻量级适配任务。
投资人乐于买单:无需从零采集昂贵的真实物理交互数据,只需站在互联网巨头的肩膀上“借力”。
可问题恰恰出在这里。互联网教会模型“苹果是红的、圆的、可吃的”,却从未告诉它“施加10牛顿压力时,苹果果肉会塌陷、表皮会滑动、整体重心偏移后可能滚落”。
网络上的视频,是经过剪辑、美化、符合人类观看习惯的产物,充斥着平滑转场与跳跃式因果链。
一个杯子从桌沿滑落,下一帧画面不是它在空中翻转的瞬间,而是已碎裂于地,或被一只手从容接住。那个决定成败的关键帧——指尖打滑的毫秒、桌面摩擦系数不足的临界点、倾斜角度突破稳定阈值的一瞬——永远被剪掉了。

VLA所习得的“物理”,是一种基于表层统计关联的“伪物理”。它知道“掉落”常伴随“破碎”,却无法推演:一个盛满滚烫咖啡的玻璃壶,在倾斜至多少度时,壶盖会因重心失衡自行滑脱。就连谷歌DeepMind在RT-2论文中也坦承,面对全新物体组合或需精细力控的任务,模型泛化能力会断崖式下滑。
更严峻的是,Physical Intelligence近期研究指出:即便将模型参数扩大十倍、喂入更多网络图像,其对真实物理交互的预测精度,依然近乎一条水平线。在这个维度上,AI领域惯用的“规模定律”(scaling law),已然撞墙。
因此,当下的VLA演示,更像一场精密编排的魔术秀。
你只能在实验室那0.5平方米的限定区域内,使用固定三五种道具,在恒定光照与纯色背景下,看到机器人行云流水地抓取。一旦背景稍有变化,或放入一个反光、透明、半透明的物体,“缸中之脑”的本质便立刻暴露无遗。
它只记得答案,却不知答案如何诞生。
世界模型不是万能钥匙,却是唯一锁孔
“世界模型”这个词近来的热度,堪比几年前的元宇宙——人人挂在嘴边,却少有人真正见过它落地的模样。Yann LeCun在Meta AI部门反复强调,这是通向真正智能的必经之路;黄仁勋也在GTC大会上为其站台背书。
在具身智能语境中,世界模型被寄予厚望。但在部分团队手中,它却险些沦为文字游戏:简单粗暴地在VLA输出端“套壳”一个现成物理仿真引擎,用于事后拦截明显违背常识的动作。
例如,模型指令机械臂“穿桌取物”,仿真器立刻弹出“碰撞检测失败”,强行中止动作。
这叫融合世界模型?这叫给故障代码打补丁。
真正的融合,关键在于“内化”。
一个强健的世界模型,应成为VLA的“潜意识”与“直觉中枢”,而非一个外挂式的安全守门员。
它需在VLA生成动作前,即以极高速度在内部模拟未来数秒的物理演化,并反向约束、引导动作决策的生成。
当我伸手去接一枚抛来的钥匙,大脑并不会先计算手指每一关节的精确轨迹,再依赖视觉反馈实时修正。我的脑中早已内建一套关于“钥匙飞行抛物线、空气阻力影响、落点预判”的隐性模型——它直接驱动肌肉记忆,让我本能调整身体姿态,完成接取。

李飞飞团队的RoboAgent项目,以及近期一批前沿探索,正朝此方向迈进:他们不再满足于“看见杯子→输出抓取指令”的单向映射,而是强制模型在学习动作的同时,同步预测下一帧深度图、物体分割掩码,乃至接触力的空间分布。
这不只是输入/输出通道的简单扩展。它是在倒逼模型挣脱二维像素间的浅层关联,主动构建一个内在的、三维的、具备因果推理能力的物理心智表征。
当模型能准确推演:“若以该角度与速度推动此瓶,0.5秒后它将向右倾倒”,它才算真正“理解”了瓶子的动力学特性。此时的抓取动作,才不会如当下这般——要么迟疑不前、畏首畏尾,要么用力过猛、一击掀翻。
前景清晰可见。大小机器人公司均已启动此类融合实践。“VLA+世界模型”将披上不同外衣,成为行业共识。
Jim Fan高呼的“WAM万岁”,本质上正是这一组合的另一种命名。
用不了多久,所有严肃的具身智能企业,都会在技术白皮书中郑重写下:“我们构建了端到端的世界模型”,或类似表述——名称各异,甚至仍称VLA,但内核已然统一。
沉默的数据工厂,才是终极战场
争论VLA是否已死、世界模型是否灵验,终究隔靴搔痒。
所有顶层架构之争,最终都沉降为最底层、也最乏味的较量:数据。
一位头部人形机器人公司数据采集负责人曾私下向“智能相对论”坦言:眼下最棘手的并非算法调优,而是如何防止远程遥操作标注员在镜头前打盹。
为获取高质量操作数据,他们特聘退休老工程师,戴着手套全天重复拧紧同一枚零件。可老人手部震颤难以避免,导致精细动作的遥操作映射频频出错。一天采集的数据,清洗、对齐、标注后,真正能喂入模型训练的不足10%。
而这,仅是一个单一动作。若想让VLA+世界模型真正学会冲泡一杯咖啡,它还需掌握水壶重量随水量减少的变化曲线、蒸汽温度的空间梯度分布、水流冲击杯壁的瞬时压强、茶杯材质对热传导的影响……这些信息,没有任何互联网图文数据库能够提供。
这是一场史无前例的“数据工厂战争”。
特斯拉Optimus团队之所以备受瞩目,不仅因马斯克光环加持,更因其正将自动驾驶成熟的“影子模式”与数据引擎体系,全盘迁移至机器人领域。Optimus在工厂中每一次成功拧紧螺丝、每一次失手滑脱,均被自动记录、标注、回传、迭代——构成一个恐怖的、自我强化的数据飞轮。
相较之下,国内多数机器人公司仍在沿用“堆人力”的原始模式:租下数千平米场地,仿照当年数据标注村的形态,密集招募人员进行遥操作。数据质量良莠不齐,采集成本居高不下。
结果显而易见:VLA+世界模型虽将成为技术共识,但真正的护城河,将迅速从模型结构本身,转向数据工厂的规模化能力与工程效率。
未来的竞争呈三层结构:
- 顶层,是OpenAI、谷歌DeepMind、英伟达等机构,致力于打造能理解基础物理规律的VLA基座模型;
- 中层,是拥有高效、海量、场景化私有数据工厂的机器人公司,它们依托自身真实场景的“私域数据”,在基座上深度微调,锻造出面向3C组装、餐饮服务等垂直领域的超级专家模型;
- 底层,则是缺乏数据基础设施的企业,或将沦为基座模型厂商的渠道分销商,或只能困守于巡检、导引等低门槛应用场景中内卷求生。
物理交互的高质量数据,是VLA最终落地的唯一弹药。没有弹药,再先进的模型,也不过是一根烧火棍。
看看Physical Intelligence——这家由顶尖学术力量组建的明星公司,今年以来密集与制造业、物流企业签署合作协议。其所图,并非短期服务费,而是那些产线、仓库、物流节点中,最真实、最“脏”、最充满不确定性的物理交互数据。Uber当年崛起的核心,并非算法优势,而是全球城市街道上千万辆私家车共同构筑的数据护城河。
具身智能的“Uber时刻”,尚未到来,但倒计时已然启动。
结语
VLA并未死去,它只是正在蜕变。这场蜕变的标志,正是它必须被连根拔起,彻底告别互联网的温室,扎进物理世界的泥泞土壤之中。
它需要长出“世界模型”这一全新的认知器官,以真正理解并预测物理世界的因果律。而这一切能否实现,取决于那些最不被聚光灯照亮的角落——数据工厂里,工人的动作是否标准,传感器的噪声是否被有效滤除,每一次失败的操作是否被完整、诚实地记录下来。
具身智能的宏大叙事已然落幕。一场更枯燥、更残酷、也更真实的工程战役,才刚刚拉开帷幕。
*本文图片均来源于网络


















