作者|黄楠
编辑|袁斯来
6月24日,通用具身智能企业RoboScience正式发布其机器科学通用具身大模型,首次全面公开自研Visics大模型的技术架构——VLOA(Vision-Language-Object-Action),并同步展示了该模型在家具组装、灵巧抓取、动态流水线作业等多项真实物理场景中的实际应用效果。
大语言模型依赖标准化的文本Token,自动驾驶则依托统一的视觉或点云表征体系,这些基础性数据格式的确立,使得模型与数据得以跨任务、跨平台复用。然而,具身智能领域至今尚未形成被业界广泛采纳的基础表征单元。这一缺失直接影响着数据采集方式、模型训练路径,以及训练成果能否有效迁移到全新任务或环境中。
过去两年间,行业主流方案普遍采用“轨迹模仿”策略:即让模型直接学习特定机器人在特定任务中关节运动的时序坐标。该方法的根本局限在于泛化能力薄弱——一旦更换硬件平台、操作对象或应用场景,模型此前积累的能力便难以直接复用。它所习得的,是“某款夹爪如何抓起某个杯子”,而非对“抓取”这一动作本质的理解:何为抓取?需施加多大作用力?物体受力后将产生何种形变或位移?
RoboScience机器科学创始人兼CEO田野指出,当前机器人操作面临三大共性瓶颈:泛化能力不足、精细操控困难、长程任务中误差持续累积。为此,团队决定回归底层逻辑,构建一套面向通用具身智能的基础表征范式。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

RoboScience机器科学创始人兼CEO田野(图源/企业)
作为整套技术体系的核心底座,RoboScience自主研发了Visics通用具身大模型,并首次提出以Object Trajectory(物体三维点云轨迹)作为统一中间表征标准,进而构建分层解耦的VLOA架构。该架构以“物体”为认知与执行中心,重构机器人对环境的理解逻辑与行为生成机制。
田野进一步阐释:“‘Object’一词兼具‘物体’与‘目标’双重语义,既能清晰界定机器人与对象之间的交互关系,又能准确描述操作完成后物体应达成的运动状态变化。”
Visics通用具身大模型采用双引擎协同架构:具身世界模型与通用操作模型各自独立运行、分别预训练、按需迭代,互不耦合。其中,具身世界模型以海量互联网视频为预训练数据源,聚焦建模物体状态演化、三维运动轨迹、接触力分布及物理因果关系,从而掌握真实世界中物体运动的基本规律。

Visics通用具身大模型,VLOA架构(图源/企业)
将小说章节转换为电影分镜剧本。用户上传txt/md/docx文本,AI分析场景、角色、情绪、镜头语言,输出专业分镜脚本。适用于用户提及“分镜”“storyboard”“小说转分镜”“影视改编”“镜头脚本”或需要将小说改编为分镜的场景。
通用操作模型则专注于将“物体运动轨迹”映射为“机器人具体执行指令”。它依托高保真物理仿真引擎持续生成大规模合成数据进行迭代优化,可适配刚体、铰链结构件、软质可变形体等多种物理属性对象;支持跨本体部署与闭环控制,并兼容视觉、触觉、力觉等多模态感知输入。
两大引擎通过VLOA架构实现层级化协同:Object Trajectory作为统一中间接口,上层具身世界模型负责预测与推演物体合理运动路径,下层通用操作模型则生成适配不同机器人硬件平台的底层控制指令,确保轨迹精准落地执行。
这种分层解耦设计,最终实现了三大维度的全域泛化能力:适配任意机器人本体、操作任意类型物体、自主完成多样化任务。以抓取任务为例,相较传统绑定单一机械臂与单一物体的训练范式,基于VLOA架构的模型在抓取成功率、姿态多样性、响应实时性等方面均显著提升。

搭载Visics通用具身大模型的机械臂执行拼家具任务(图源/企业)
在具身智能发展进程中,高质量数据是模型性能跃升的根本前提,但传统数据获取路径正遭遇成本高昂与产能见顶的双重制约。
RoboScience机器科学以自研高精度仿真引擎RoboMirage为核心,融合全自动视频数据标注与清洗流水线,打造“仿真+视频”双轮驱动的数据飞轮体系。该体系可将单条操作数据的采集成本压缩至传统方式的1/20至1/200,数据产能达每周数十万小时,预计到2026年将建成超1T高质量manipulation操作轨迹数据集。

RoboScience机器科学联合创始人汪涛(图源/企业)
自创立以来,RoboScience已获得京东集团、商汤科技、达晨财智、招商局创投、零一创投、普华资本等多家产业资本与财务投资机构的战略支持与资源协同,在北京、深圳、苏州、杭州设立研发与生产基地。公司以大模型为中枢,纵向贯通自研机器人本体、运动控制器与RobotOS系统,横向拓展模型泛化能力、低门槛开发工具链及多层次生态合作,构建软硬一体化、全链路闭环协同的商业路径。
联合创始人汪涛表示,具身智能的大规模商业化落地仍处于前夜阶段。公司选择从“物体维度”切入,优先攻克对刚性体、柔性体及其他复杂材质物体的通用操作能力,而非过早卷入工业自动化解决方案的同质化竞争。例如商超补货、电商仓配等典型场景,天然具备SKU海量、品类繁杂、拣选频次高等特点,正是验证物体级泛化能力的理想试验场。
目前,RoboScience已与多家零售企业、物流服务商、康养机构,以及机器人本体厂商、灵巧手研发公司展开试点合作,计划于今年内推出面向工业与商业场景的标准化机器人本体产品,并实现量产交付。

















