讲师中心 微信公众号
AI工具推荐 视频效率加速

VLA不会死,但不融合世界模型的除外

千明酱_4783

千明酱_4783

发布时间:2026-06-02 14:00:54

|

333人浏览过

|

来源于php中文网

原创

文 | 智能相对论

作者 | 叶远风

2026年5月,具身智能圈内悄然流传一则并不好笑的虚构段子:某VLA模型在公开演示中,被指令“把桌上那个苹果拿给我”。机械臂流畅伸出,精准握住了旁边一只马克杯。全场鸦雀无声。工程师额角渗汗,迅速在平板上敲出一行字:“重新定义苹果”。

过去半年,类似“翻车”桥段频频上演——主角既包括国内估值领跑的几家明星独角兽,也涵盖远在太平洋彼岸的Figure AI、Physical Intelligence等头部玩家,无一幸免。

两年前,行业还在为VLA(Vision-Language-Action,视觉-语言-动作模型)高呼助威。Covariant推出RFM-1时,媒体几乎迫不及待将“通用机器人奇点”的桂冠扣上它的头顶;谷歌DeepMind发布RT-2论文后,二级市场分析师连夜重写研报,硬生生把具身智能商业化时间表提前了整整三年。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

VLA不会死,但不融合世界模型的除外

而今,“奇点”二字早已无人提起。

大家真正揪心的是:这系统能不能在真实产线里稳稳把螺丝拧进孔位,而不是一激动就把螺丝刀捅进自己的关节电机里。VLA在现实任务中暴露的笨拙与脆弱,甚至让英伟达机器人业务核心人物Jim Fan公开断言:“VLA已死。”

但这句话,下得有点早。

VLA不会消亡,真正该退出历史舞台的,是那种妄图仅靠互联网图文视频+零星几小时机械臂遥操作数据,就想一步登天造出通用机器人的空想式VLA。与此同时,一种新范式正在悄然成形——它正将被业界反复提及却长期搁置的“世界模型”,真正嵌入VLA的底层逻辑。这或许将成为未来三年内,具身智能唯一可行的突围路径。

困在屏幕里的“缸中之脑”

要读懂VLA为何屡屡失手,必须先看清它的先天短板。

当前主流VLA架构,无论是谷歌RT-2,还是星尘智能等国内团队所构建的系统,其底层逻辑高度趋同:先用海量互联网图文数据完成视觉与语言的对齐,使模型具备“看图识物、听懂人话”的能力;再接入少量机器人动作轨迹数据,做端到端微调,使其可输出控制指令。

这套路线的最大卖点,是“省”。它试图复用大语言模型与多模态模型的既有基建,把机器人学习压缩为一次轻量级适配任务。

投资人乐于买单:无需从零采集昂贵的真实物理交互数据,只需站在互联网巨头的肩膀上“借力”。

可问题恰恰出在这里。互联网教会模型“苹果是红的、圆的、可吃的”,却从未告诉它“施加10牛顿压力时,苹果果肉会塌陷、表皮会滑动、整体重心偏移后可能滚落”。

网络上的视频,是经过剪辑、美化、符合人类观看习惯的产物,充斥着平滑转场与跳跃式因果链。

一个杯子从桌沿滑落,下一帧画面不是它在空中翻转的瞬间,而是已碎裂于地,或被一只手从容接住。那个决定成败的关键帧——指尖打滑的毫秒、桌面摩擦系数不足的临界点、倾斜角度突破稳定阈值的一瞬——永远被剪掉了。

VLA不会死,但不融合世界模型的除外

VLA所习得的“物理”,是一种基于表层统计关联的“伪物理”。它知道“掉落”常伴随“破碎”,却无法推演:一个盛满滚烫咖啡的玻璃壶,在倾斜至多少度时,壶盖会因重心失衡自行滑脱。就连谷歌DeepMind在RT-2论文中也坦承,面对全新物体组合或需精细力控的任务,模型泛化能力会断崖式下滑。

更严峻的是,Physical Intelligence近期研究指出:即便将模型参数扩大十倍、喂入更多网络图像,其对真实物理交互的预测精度,依然近乎一条水平线。在这个维度上,AI领域惯用的“规模定律”(scaling law),已然撞墙。

因此,当下的VLA演示,更像一场精密编排的魔术秀。

你只能在实验室那0.5平方米的限定区域内,使用固定三五种道具,在恒定光照与纯色背景下,看到机器人行云流水地抓取。一旦背景稍有变化,或放入一个反光、透明、半透明的物体,“缸中之脑”的本质便立刻暴露无遗。

它只记得答案,却不知答案如何诞生。

世界模型不是万能钥匙,却是唯一锁孔

“世界模型”这个词近来的热度,堪比几年前的元宇宙——人人挂在嘴边,却少有人真正见过它落地的模样。Yann LeCun在Meta AI部门反复强调,这是通向真正智能的必经之路;黄仁勋也在GTC大会上为其站台背书。

在具身智能语境中,世界模型被寄予厚望。但在部分团队手中,它却险些沦为文字游戏:简单粗暴地在VLA输出端“套壳”一个现成物理仿真引擎,用于事后拦截明显违背常识的动作。

例如,模型指令机械臂“穿桌取物”,仿真器立刻弹出“碰撞检测失败”,强行中止动作。

这叫融合世界模型?这叫给故障代码打补丁。

真正的融合,关键在于“内化”。

机器人客服服务公司网站模板
机器人客服服务公司网站模板

机器人客服服务公司网站模板是一款适合提供机器人客服服务公司宣传网站模板下载。提示:本模板调用到谷歌字体库,可能会出现页面打开比较缓慢。

下载

一个强健的世界模型,应成为VLA的“潜意识”与“直觉中枢”,而非一个外挂式的安全守门员。

它需在VLA生成动作前,即以极高速度在内部模拟未来数秒的物理演化,并反向约束、引导动作决策的生成。

当我伸手去接一枚抛来的钥匙,大脑并不会先计算手指每一关节的精确轨迹,再依赖视觉反馈实时修正。我的脑中早已内建一套关于“钥匙飞行抛物线、空气阻力影响、落点预判”的隐性模型——它直接驱动肌肉记忆,让我本能调整身体姿态,完成接取。

VLA不会死,但不融合世界模型的除外

李飞飞团队的RoboAgent项目,以及近期一批前沿探索,正朝此方向迈进:他们不再满足于“看见杯子→输出抓取指令”的单向映射,而是强制模型在学习动作的同时,同步预测下一帧深度图、物体分割掩码,乃至接触力的空间分布。

这不只是输入/输出通道的简单扩展。它是在倒逼模型挣脱二维像素间的浅层关联,主动构建一个内在的、三维的、具备因果推理能力的物理心智表征。

当模型能准确推演:“若以该角度与速度推动此瓶,0.5秒后它将向右倾倒”,它才算真正“理解”了瓶子的动力学特性。此时的抓取动作,才不会如当下这般——要么迟疑不前、畏首畏尾,要么用力过猛、一击掀翻。

前景清晰可见。大小机器人公司均已启动此类融合实践。“VLA+世界模型”将披上不同外衣,成为行业共识。

Jim Fan高呼的“WAM万岁”,本质上正是这一组合的另一种命名。

用不了多久,所有严肃的具身智能企业,都会在技术白皮书中郑重写下:“我们构建了端到端的世界模型”,或类似表述——名称各异,甚至仍称VLA,但内核已然统一。

沉默的数据工厂,才是终极战场

争论VLA是否已死、世界模型是否灵验,终究隔靴搔痒。

所有顶层架构之争,最终都沉降为最底层、也最乏味的较量:数据。

一位头部人形机器人公司数据采集负责人曾私下向“智能相对论”坦言:眼下最棘手的并非算法调优,而是如何防止远程遥操作标注员在镜头前打盹。

为获取高质量操作数据,他们特聘退休老工程师,戴着手套全天重复拧紧同一枚零件。可老人手部震颤难以避免,导致精细动作的遥操作映射频频出错。一天采集的数据,清洗、对齐、标注后,真正能喂入模型训练的不足10%。

而这,仅是一个单一动作。若想让VLA+世界模型真正学会冲泡一杯咖啡,它还需掌握水壶重量随水量减少的变化曲线、蒸汽温度的空间梯度分布、水流冲击杯壁的瞬时压强、茶杯材质对热传导的影响……这些信息,没有任何互联网图文数据库能够提供。

这是一场史无前例的“数据工厂战争”。

特斯拉Optimus团队之所以备受瞩目,不仅因马斯克光环加持,更因其正将自动驾驶成熟的“影子模式”与数据引擎体系,全盘迁移至机器人领域。Optimus在工厂中每一次成功拧紧螺丝、每一次失手滑脱,均被自动记录、标注、回传、迭代——构成一个恐怖的、自我强化的数据飞轮。

相较之下,国内多数机器人公司仍在沿用“堆人力”的原始模式:租下数千平米场地,仿照当年数据标注村的形态,密集招募人员进行遥操作。数据质量良莠不齐,采集成本居高不下。

结果显而易见:VLA+世界模型虽将成为技术共识,但真正的护城河,将迅速从模型结构本身,转向数据工厂的规模化能力与工程效率。

未来的竞争呈三层结构:

  • 顶层,是OpenAI、谷歌DeepMind、英伟达等机构,致力于打造能理解基础物理规律的VLA基座模型;
  • 中层,是拥有高效、海量、场景化私有数据工厂的机器人公司,它们依托自身真实场景的“私域数据”,在基座上深度微调,锻造出面向3C组装、餐饮服务等垂直领域的超级专家模型;
  • 底层,则是缺乏数据基础设施的企业,或将沦为基座模型厂商的渠道分销商,或只能困守于巡检、导引等低门槛应用场景中内卷求生。

物理交互的高质量数据,是VLA最终落地的唯一弹药。没有弹药,再先进的模型,也不过是一根烧火棍。

看看Physical Intelligence——这家由顶尖学术力量组建的明星公司,今年以来密集与制造业、物流企业签署合作协议。其所图,并非短期服务费,而是那些产线、仓库、物流节点中,最真实、最“脏”、最充满不确定性的物理交互数据。Uber当年崛起的核心,并非算法优势,而是全球城市街道上千万辆私家车共同构筑的数据护城河。

具身智能的“Uber时刻”,尚未到来,但倒计时已然启动。

结语

VLA并未死去,它只是正在蜕变。这场蜕变的标志,正是它必须被连根拔起,彻底告别互联网的温室,扎进物理世界的泥泞土壤之中。

它需要长出“世界模型”这一全新的认知器官,以真正理解并预测物理世界的因果律。而这一切能否实现,取决于那些最不被聚光灯照亮的角落——数据工厂里,工人的动作是否标准,传感器的噪声是否被有效滤除,每一次失败的操作是否被完整、诚实地记录下来。

具身智能的宏大叙事已然落幕。一场更枯燥、更残酷、也更真实的工程战役,才刚刚拉开帷幕。

*本文图片均来源于网络

热门AI工具

更多
豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

PixTV
PixTV Hot

PixTV是一款面向AIGC内容创作的AI视频生成工具。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

100

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

100

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

60

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

80

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

280

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

180

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

140

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

80

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn