【深圳,2026年9月21日】亮源新创正式推出面向物理世界的全身智能基础模型light-o1。该模型深度融合互联网视频中蕴含的人类动作序列,并融合语言语义与视觉感知信息,实现人类动作知识向多样化机器人本体的高效迁移,显著增强机器人全身协同控制与复杂任务执行能力。light-o1首次实证了人类全身动作预训练所遵循的跨本体迁移扩展规律(transfer scaling law):预训练阶段使用的人类动作数据量越大,模型在适配至不同机器人结构、传感器视角及运动模态后,其动作预测精度越高——为大规模利用人类行为数据提升机器人通用运动智能提供了关键理论支撑与工程依据。继此前在规模化对齐(scalable alignment)与规模化部署(scalable deployment)方向取得突破性进展后,light-o1标志着亮源新创physical ai“三段范式”中最后一环——规模化预训练(scalable pre-training)——正式迈入可复现、可验证、可扩展的模型实践阶段。
机器人预训练从有限采集跃迁至海量人类行为 --------------------当前主流机器人动作模型高度依赖遥操作、UMI平台等定制化手段采集训练样本。此类方式不仅人力投入大、周期长,且每新增一类任务或场景,均需重新设计采集流程、协调专业人员、部署专用设备,并持续应对操作门槛高、硬件兼容性差等现实约束。随着任务维度与环境复杂度持续上升,数据采集的组织管理难度呈指数级增长,导致行为覆盖广度与数据规模难以同步演进,成为制约机器人基础模型走向通用化的根本性瓶颈。
Light-O1另辟路径,直接调用互联网公开视频中天然存在的海量人类行为片段作为预训练原料。这些视频真实记录了人类在居家、办公、户外等多元场景下的行走、抓取、工具使用及社会交互等全过程,在数据体量、行为粒度与情境丰富性上,全面补足了人工采集数据的结构性短板,使机器人预训练的数据供给摆脱对“一事一采”的路径依赖,迈向“全域行为自生长”的新范式。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
Light-O1利用视频中已有的海量人类行为拓展机器人预训练的数据来源
在此基础上,亮源新创构建了一套端到端的人类动作知识迁移技术体系,涵盖多源异构视频的动作解构、统一表征建模、自回归式大规模预训练,以及面向目标机器人的轻量化适配。其本质在于:从纷繁的人类行为中提炼出可泛化、可重组、可迁移的动作先验知识,再将其解耦映射至结构差异显著、观测视角各异、执行动力学迥然不同的各类机器人本体。具体流程包括——首先将原始视频解析为时空对齐的多模态动作序列;继而通过超大规模自回归建模,习得“在何种上下文条件下应采取何种身体状态与运动轨迹”的隐式策略;最终仅需少量目标机器人真实交互数据,即可完成跨本体的知识蒸馏与动作生成微调,真正实现“人类经验即机器人能力”。
首次验证人类全身动作预训练的跨本体迁移扩展规律(Transfer Scaling Law)
依托上述技术框架,亮源新创系统性开展了人类全身动作预训练的迁移能力边界研究。实验采用不同规模(从千小时至十万小时)的视频驱动人类动作数据集进行预训练,随后分别在三类异构目标域开展零样本或小样本适配:第一视角人类动作捕捉数据、开源人形机器人仿真与实机数据、以及亮源自研机器人LightBot在真实环境中采集的全身移动-操作联合任务数据。评估重点聚焦于预训练规模变化对跨视角、跨本体动作重建精度的影响。
Light-O1首次验证人类全身动作预训练的跨本体迁移扩展规律
实验结果表明:当基于视频的人类动作预训练数据量扩展至10万动作小时,模型在各目标域的动作预测损失呈现稳定幂律衰减趋势;同时,离线开环测试中的全身关节姿态误差亦随预训练规模增大而持续下降。这有力证实——人类动作先验知识具备强跨本体可迁移性,其增益不因机器人形态、传感配置或控制接口差异而被显著削弱。该发现首次在全身尺度上确立了Physical AI领域关键的“迁移扩展规律”,为后续构建PB级人类行为知识库、推动机器人动作智能进入数据驱动的规模化跃迁阶段奠定基石。
从理解意图到全身行动,构建通用全身智能
依托规模化人类动作预训练与精准本体适配双轮驱动,Light-O1打通了“语言指令→环境感知→全身决策→实时执行”的全栈闭环,从两大维度展现通用全身智能的核心能力:一是面向开放物理环境的连续任务协同能力;二是面向自然语言意图的具身推理与行动生成能力。
在真实物理空间中,LightBot搭载Light-O1后可自主完成递送毛巾、开合鞋柜并归置拖鞋、识别并拾取散落垃圾等多步骤任务。整个过程无缝融合高层任务规划、中层导航避障与底层全身关节协同控制,形成端到端的连续执行流。当遭遇执行失败、突发干扰或物品位姿/类别动态变化时,机器人能基于实时感知反馈动态重规划动作序列,必要时主动发起重试,展现出对非结构化环境的鲁棒适应性与跨物体、跨空间的强泛化表现。
Light-O1构建从理解意图到全身行动的通用全身智能
面对用户输入的自然语言指令(如“把桌上的空水瓶扔进厨房垃圾桶”),Light-O1不仅能解析字面语义,更能结合场景上下文推断隐含需求(如判断水瓶是否可回收、识别厨房方位、预估手臂伸展范围等),进而推理出达成目标所需的最优身体构型、动作时序、接触力约束及安全规避策略,最终生成高保真、可执行的全身动作序列。为加速社区共建与技术普惠,亮源新创同步在官网开源轻量版通用动作生成模型Light-O1-Preview:用户仅需输入目标描述,即可即时获得模型生成的动作方案及其完整推理链路,直观体验“语义理解→具身推理→动作合成”的全流程智能涌现。
开拓Physical AI规模化预训练,三段范式形成完整技术布局
围绕“规模化预训练(Scalable Pre-Training)—规模化对齐(Scalable Alignment)—规模化部署(Scalable Deployment)”三位一体的技术演进范式,亮源新创已完成全链条核心技术成果落地:Light-O1填补预训练环节空白,此前发布的Light-Align系列解决多模态对齐难题,Light-Deploy平台则支撑百台级机器人集群的低延迟、高一致性在线服务。至此,“三段范式”已形成从数据基座构建、能力对齐优化到真实世界规模化落地的完整技术闭环。
更深层的价值在于,该范式并非简单划分研发阶段,而是构建了一条可持续自我强化的Physical AI能力进化通路:预训练层持续沉淀跨任务、跨本体的基础运动先验;对齐层通过多源监督信号将抽象能力锚定至物理约束与人类偏好;部署层则反哺真实世界反馈,驱动模型在更广泛任务、更复杂环境、更多样本体中持续迭代升级。三者环环相扣、正向循环,使Physical AI的发展逻辑从依赖单点技术突破,转向依托数据、算法与物理交互共同演进的系统性工程。

















