
允中 发自 凹非寺 量子位 | 公众号 QbitAI江西防火门胶厂家
过去年,具身智能的技术迭代明显加快。VLA、世界模型持续演进,强化学习重新成为机器人学习的重要技术路径,Sim2Real 加速从仿真走向真机,全身控制能力也在快速突破。
机器人会做的事情也越来越多:能走、能跑、能抓、能航,甚至可以完成越来越复杂的长程任务。
但如果把这些能力放到真实世界里,个基础的问题正在浮现:
机器人"会做"件事,和机器人能够在开放环境中长期、稳定、泛化地把事情做成,其实是两回事。
个机器人能跨过固定度的障碍,不意味着换种障碍还能完成;能在个房间里航,不意味着换个场景、换种机器人本体仍然有;正常状态下能稳定行走,也不意味着受到撞击、跌倒甚至关节损伤之后还能继续工作。
这也是为什么,随着具身智能从 Demo 走向真实世界,行业的评价标准正在发生变化。
如果说上阶段关注的是机器人到底"会多少技能",那么下阶段重要的问题是:这些能力能不能持续规模化扩展。
这里所说的 Scaling,不只是模型参数量,也不只是机器人数据量,而是模型能否经历多环境、覆盖多任务、迁移到多机器人本体,并在真正进入物理世界之后,继续适应那些训练阶段没有见过的状态。
过去个多月,亮源新创连续发布了三项技术:LightParkour、LightNav-0 和 Light REACT。
LightParkour 从简短的人类动作片段出发,通过物理仿真与课程学习扩展复杂接触技能;
LightNav-0 基于 Real2Sim2Real 数据引擎,将 2,000+ 个互联网来源的真实场景转化为可反复使用的仿真环境,生成 4,000+ 小时视觉、语言和动作经验,并用于通用航后训练;
Light REACT 则面向外力扰动、跌倒和硬件损伤条件下的全身韧控制,研究机器人如何依据自身交互历史调整运动式。
△亮源新创连续发布三项技术:LightParkour、LightNav-0 和 Light REACT
看起来,这是跑酷、航和全身控制三个不同向。
但把三项技术放在起,会发现亮源新创实际上直在回答同个问题:如何让 Physical AI 从单点能力,逐步形成可以规模化训练、规模化对齐和规模化部署的基础模型体系。
三项技术向不同,但都在围绕亮源新创"三段范式"所指向的核心问题展开:如何让 Physical AI 的能力持续规模化扩展,并终形成从训练、对齐到真实部署的学习闭环。
具身智能真正要解决的,是能力如何持续规模化扩展
过去的机器人研发,大量建立在任务分解之上。航解决航,运动控制解决运动控制,机械臂操作解决机械臂操作。任务和环境越明确,工程系统往往越容易针对优化。
这套法并没有问题。工业机器人能够在度结构化的环境中稳定工作,本身已经证明了它的价值。
但通用机器人面对的是另种问题。现实世界不是个固定 Benchmark,环境会变,任务会变,机器人本体会变,甚至机器人自己的身体状态也会变。
如果每增加个任务就重新训练个模型,每换个机器人就重新适配次,每出现种异常状态就重新设计套控制规则,那么系统能力虽然在增加,开发和部署成本也会同步增长。
终,能力没有真正实现规模化扩展,工程复杂度反而先增长起来。这也是基础模型给机器人行业带来的真正启发。
大语言模型的重要意义,并不只是把某个 NLP 任务做得好,而是通过统模型、统表示和规模化训练,让越来越多能力进入同个模型体系。
如果 Physical AI 也要沿着类似向发展,那么需要解决的核心问题,同样不是不断增加孤立技能,而是建立套可以持续扩展能力边界的学习机制。
亮源新创将这套机制概括为三个阶段:规模化预训练(Scalable Pre-Training)、规模化对齐(Scalable Alignment)和规模化部署(Scalable Deployment)。
规模化预训练通过大规模数据训练建立基础能力;规模化对齐通过强化学习等式进步提升模型能力;规模化部署则动基础模型进入真实世界,并持续产生质量真实世界数据,形成驱动模型持续优化的数据飞轮。
三个阶段并非彼此割裂,而是共同构成个持续迭代的学习闭环。亮源新创过去个多月连续发布的三项技术,则从不同向展现了他们围绕这套技术路径展开的研发进展。
LightParkour:先解决个动作如何变成类能力
先从 LightParkour 开始。跑酷是全身运动学习中涉及复杂接触的典型任务之。普通行走主要依赖双腿和地面形成支撑,但当机器人需要攀爬、撑越或跨越较障碍物时,环境本身会成为身体支撑的部分。
手应该在哪里接触,什么时候承重,身体重心如何移动,障碍物度变化之后动作如何跟着变化,这些都会直接决定任务能否完成。
传统动作模仿在这里会遇到个明显问题:动作记录了"人怎么动",却没有完整记录"这个动作为什么在这个环境里成立"。
如果直接通过动作重定向(Motion Retargeting)将人类动作映射到机器人本体上,可能出现手掌悬空、身体穿过障碍物,甚至整个轨迹出机器人动力学能力的问题。
另种办法是针对每种障碍重新采集动作。但这样来,数据成本会随着技能、地形和接触式线增长。
LightParkour 选择的式是:只给机器人个起点江西防火门胶厂家,然后让技能自己生长。
具体来说,LightParkour 先从真实人类动作中恢复段简短的动作种子,再把动作和对应的障碍物起放入物理仿真。仿真负责重新建立动作、障碍物、接触力和机器人执行器约束之间的关系。机器人成功完成当前动作之后,系统继续提障碍物难度,并把成功轨迹作为下轮训练的参考。
于是,从段针对 45 厘米障碍物的初始动作出发,可以逐步生成覆盖至 75 厘米障碍的参考轨迹,对应 90 厘米的 Lightbot 0 约 83 的身。
整个扩展过程中,只有初的动作和障碍物需要人工对齐,之后的能力增长主要由物理仿真和课程学习完成。
这件事真正重要的地,不是机器人跨得了,而是个动作样本开始变成个技能分布。
过去需要针对不同障碍重新采集示范,现在模型开始利用物理世界本身的规律,自动生成新的有经验。
△ LightParkour 完整训练流程
这已经出现了基础模型实现 Scaling 的个关键特征:能力不再和人工数据绑定。
会很多动作还不够,要把它们放进同个模型
技能扩展之后,二个问题随之出现。
如果行走是个模型,攀爬是个模型,快速撑越又是个模型,那么技能数量增加之后,机器人仍然需要个上层系统决定什么时候调用哪个模型。
LightParkour 进步使用多蒸馏,把行走和三项复杂接触技能整到个统策略中。
关键的是,技能切换本身也不再依赖人工规则。系统进步对不同技能之间的切换进行训练,让机器人自主学习什么时候保持行走、什么时候进入全身动作,以及什么时候重新回到普通运动。
部署时,不需要外部提供技能标签,也没有人工编写的状态机负责切换。
终,LightParkour 在 Lightbot 0 上运行的是个统的循环度视觉策略。模型只使用胸前度相机、本体感知和速度指令,以 50 Hz 在机载计平台上运行,不需要运行时参考轨迹、外部运动捕捉或机外状态估计。
这让 LightParkour 的意义从"人形机器人会跑酷",进步变成:机器人能不能把多个孤立技能压缩成个统模型,并根据当前环境自主决定什么时候使用什么能力。
LightParkour 展示了亮源新创在感知驱动的全身运动、多技能统策略和真机迁移向上的阶段进展。
但仅仅解决身体如何运动,还远远不够。机器人真正进入开放世界之前,还须知道自己在哪里、目标在哪里,以及接下来应该往哪里走。
LightNav-0:让具身模型经历足够大的世界
航是机器人进入真实世界之后绕不开的项基础能力。
但通用航与传统航之间存在个非常大的区别。传统系统可以提前建图,可以依赖定位,可以针对摄像头和机器人本体进行标定。
但个真正面向基础模型的航系统,需要面对不同环境、不同任务、不同视角甚至不同机器人本体。
换句话说,它不能只"记住怎么走",而要形成可以迁移的空间智能。
这先是个数据问题。语言模型拥有互联网文本数据,但机器人没有存在的"机器人互联网"。如果所有航经验都依靠真机遥操作采集,那么每增加个环境、个机器人本体,都意味着新的数据成本。
LightNav-0 的做法,是把互联网中的真实世界,转化成机器人可以反复经历的训练世界。
通过 Real2Sim2Real 数据引擎,亮源新创将 2,000+ 个互联网来源的真实场景转换为可复用仿真环境,形成 4,000+ 小时视觉、语言和动作后训练经验。
同个场景可以产生不同目标、不同路线、不同视角和不同任务,摄像机几何也可以随训练变化,从而避模型只适应某种固定机器人视角。
这里有个值得关注的实验结果。LightNav-0 发现,在当前实验范围内,扩大环境覆盖度,比单纯增加相同环境里的轨迹数量能稳定提升泛化能力。
△在真实场景的仿真环境中生成航经验
这意味着,Physical AI 的数据 Scaling 可能和大语言模型有所不同。机器人不仅需要多数据,需要在多样化的环境中积累经验。
航不是识别目标,而是理解空间之后产生动作
数据规模解决的是"见过多少世界",但航还有二个问题:如何把视觉和语言理解真正变成行动。
例如,机器人接到"走到沙发右边"的指令,理解"沙发"并不困难。真正困难的是,它还需要判断沙发在哪里、右边在哪里、哪里可以通行,以及接下来应该生成怎样的运动轨迹。
LightNav-0 因此引入 Point CoT。模型先在图像空间预测目标点和可通行点江西防火门胶厂家,再生成后续动作 token。理过程因此从"视觉 + 语言直接生成动作",变成"视觉语言理解→空间理→动作生成"。在公开的 8 项消融评测中,引入 Point CoT 后,平均任务成功率提 8.4 个百分点,SPL 提 5.7 个百分点。
随后,LightNav-0 通过 RVQ 动作编码器,将连续机器人轨迹压缩为 3 个动作 token,使视觉、语言、空间位置和机器人动作能够进入统的模型训练框架。
这实际上在做件基础模型非常熟悉的事情:建立统表示。只不过语言模型统的是不同语言任务,而 Physical AI 需要进步把视觉、语言、空间和动作统起来。
真正检验基础模型的,不是训练集表现,而是样本迁移
终,LightNav-0 没有把验证停留在个机器人或者个 Benchmark 里。
在 10 个仿真设置中,LightNav-0 覆盖指令跟随、目标航和具身视觉跟踪等任务;在真实机器人部署中,同个模型进步样本迁移到人形、四足、轮式和飞行机器人等不同本体。
官同时发布了模型、代码和技术报告。这验证考察模型在环境、任务和机器人本体变化条件下的样本泛化能力。
LightParkour 从个动作示例出发,将其扩展为能够适应不同环境条件的技能分布,PVC管道管件粘结胶LightNav-0 则把这种泛化进步到环境、任务和机器人本体。
但机器人进入真实世界以后,还有后个很难通过 Benchmark 提前解决的问题。世界会变化,机器人自己也会变化。
Light REACT:环境会变,机器人自己的身体也会变
机器人正常运行时,大多数控制系统都可以工作得很好。
真正困难的是异常状态。人可能撞到机器人,机器人可能跌倒,执行器可能出现故障,关节可能锁死,环境也可能限制它原本的运动式。
这类异常在单次实验中可能并不频,但随着部署规模扩大,其对发生次数也会增加,对系统韧、故障恢复能力和运维率提出要求。
如果异常频繁致任务中断,并且需要依赖人工恢复,部署规模扩大后,运维压力也会相应增加。
因此,规模化部署不只是增加部署数量,还需要提机器人在真实环境中的持续运行和异常恢复能力。
Light REACT 就是从这个问题出发。它的全称是 REsilient humAnoid ConTrol(韧人形机器人控制),目标不是让机器人永远保持种标准步态,而是在身体条件发生变化之后,尽可能利用剩余的全身能力继续移动。
正常走可以,跛行可以,单腿跳可以;如果双腿已经法维持直立运动,就让手臂参与支撑,切换到爬行。目标始终是同个:在当前身体条件允许的范围内,继续完成运动。
关键不是拿到故障标签,而是从历史状态判断身体发生了什么变化
事实上,如何让机器人在面对新任务、新环境和新状态时减少显式人工适配,正在成为近期机器人基础模型研究中值得关注的向。
今年 8 月,Skild AI 发布 S1。模型观看次新任务的示范后,不修改模型权重,也不针对该任务重新进行后训练,就可以尝试直接执行。
在其公开的未见长程任务实验中,同样使用 10 万小时预训练数据时,上下文版本成功率达到 66,语言提示基线则为 9。Skild AI 将传统机器人面对新任务时仍需要"收集数据—微调模型"的式,类比为机器人仍处在" BERT 时代"。
Generalist AI 随后发布的 GEN-1.5 同样展示了次示范下的任务适应能力。模型通过 3 — 12 秒的单次示范,在不进行梯度新的情况下,在 10 类短程任务中取得 59 的平均成功率;使用每项任务约 5 分钟数据进行 10 步梯度新后,平均成功率进步提升至 83。Generalist AI 将这种能力归因于大规模物理经验预训练之后形成的单次示范学习和少样本适应能力。
另条线上,RoboTTT 把机器人可以利用的历史信息进步扩展到 8K 个时间步。同模型使用 8K 上下文训练,相比 1K 版本闭环表现提升 62,论文由此将上下文长度(Context Length)提出为机器人基础模型个新的 Scaling 维度。
这些工作的架构、数据和任务并不相同,也没有要把它们归为同条技术路线。
但它们都在触及个共同问题:当机器人面对变化时,能否多依靠模型已有能力和上下文完成适应,而不是每次都重新依赖人工采集数据、微调模型或编写规则。
Light REACT 把这个问题进步进到了机器人自身的身体状态。S1 和 GEN-1.5 使用的上下文,核心信息来自外部提供的任务示范,模型需要理解的是"这次要做什么";Light REACT 使用的上下文,则来自机器人近期自身的交互历史,它试图判断的是"我现在的身体处于什么状态,接下来还能怎么动"。
严格来说,它们处理的并不是同种上下文学习。S1 和 GEN-1.5 接近从上下文中获得新的任务条件;Light REACT 则是在训练所覆盖的损伤分布内,通过时序交互信息断当前身体与动力学条件。它们共享的是利用上下文减少显式人工适配的思路,而不是同种能力。
如果提前知道哪个关节损坏,那么可以针对每种故障设计套控制器。
但真实部署的问题在于,机器人不定提前知道自己哪里出了问题。Light REACT 因此将全身上下文学习(Whole-Body In-Context Learning)作为核心机制。
训练阶段,系统针对不同损伤状态建立多个教师策略,覆盖执行器失、关节锁定和膝部折叠约束三类损伤。随后,通过多教师蒸馏,将不同教师策略的能力整到个可部署的学生策略中。
但到了部署阶段,个关键的信息被拿掉了:模型不会获得故障标签。它只能看到自己的本体感知、动作指令以及过去段时间内身体如何响应。这意味着机器人须通过自己的交互历史判断身体状态发生了什么变化。
亮源新创比较了多层感知机(MLP)、循环经网络(RNN)和 Transformer 三种策略结构。结果显示,使用 64 帧因果上下文窗口的 Transformer,能够充分地覆盖教师策略的行为能力。
会多少技能是回事,知道什么时候用又是另回事
多教师蒸馏之后,Light REACT 还遇到了个很典型的大模型问题。
模型已经会走、会跛行、会跳、会爬,但不定知道什么时候应该调用哪种能力。例如,机器人明明还能站立,却可能直接趴下开始爬行。从任务励看,这也许能够完成移动,但从真实部署看并不理。
所以 Light REACT 又加入偏好强化学习(Preference RL),对不同能力的调用式进行进步对齐。
模型终形成个清晰的行为偏好:身体条件允许时优先保持直立运动,只有当直立运动法继续时,再切换到爬行等替代式。
经过这阶段,公开实验中的直立行为比例从约 42 提到约 76,爬行行为从约 45 下降至约 16。
这步很像大模型对齐(Alignment)真正解决的问题。预训练决定模型"会什么",对齐决定模型"什么时候应该怎么做"。
到了 Physical AI,这种对齐进步从语言偏好扩展到了空间、动作和身体状态。
三项技术连起来,亮源真正要做的是 Physical AI 基础模型
现在再回头看 LightParkour、LightNav-0 和 Light REACT,三项工作之间的关系就清楚了。
LightParkour 解决的是技能如何实现 Scaling。段人类动作不再对应条固定机器人轨迹,而是通过强化学习和课程学习扩展为能够适应不同环境条件的技能分布,再通过多蒸馏进入个统策略。
LightNav-0 解决的是经验和泛化如何实现 Scaling。2,000+ 个真实场景被转化成 4,000+ 小时视觉、语言和动作经验,模型进步通过具身理(ER)中期训练、具身监督微调(SFT)和在线强化学习(RL)获得跨场景、跨任务、跨本体的样本航能力。
Light REACT 解决的是部署阶段的韧问题。机器人不再假设自身始终处于训练时的正常状态,而是根据历史交互断当前动力学条件,在扰动和硬件损伤后调整行为,为降低任务中断和人工介入提供技术基础。
三个向采用的具体法并不相同,但有些共同倾向:扩大训练数据与状态分布,引入强化学习产生新的经验,并尽量减少部署阶段对人工规则和预定义标签的依赖;其中 LightParkour 和 Light REACT 还通过蒸馏将多项能力整进统策略。
三段范式,开始从技术判断变成研发体系
作为对 Physical AI 技术路径的系统思考,"三段范式"正在随着具体技术成果的进逐步落到研发实践中。
规模化预训练解决的是基础能力如何建立。机器人不可能只依赖昂贵的真机遥操作数据,还需要进步利用互联网、多模态数据以及大规模的物理世界信息,通过规模化数据训练建立基础能力,为后续的能力对齐和真实部署提供基础。
规模化对齐解决的是如何在预训练基础上,通过强化学习等式进步提升模型能力。LightParkour 从全身智能出发,将有限的人类动作示例扩展为可泛化的复杂全身运动能力;LightNav-0 则通过具身理(ER)中期训练、具身监督微调(SFT)和在线强化学习(RL),进步提升模型在不同场景、任务和机器人本体上的航泛化能力。
两项技术分别从全身运动与通用航两个向,探索如何将基础模型能力进步转化为物理世界中的行动能力。
规模化部署解决的是模型进入真实机器人和真实环境后,如何持续、可靠地运行。Light REACT 从控制层验证了其中个关键问题:面对外力扰动、硬件状态变化以及训练阶段未穷举的情况,机器人能否利用近期交互历史断当前身体与环境状态,并据此调整全身行为,为降低真实部署中的任务中断和人工介入提供技术基础。
而三段范式真正形成闭环的关键,在于真实世界数据能够持续回流到模型训练体系。模型通过规模化预训练建立基础能力,在规模化对齐阶段进步提升面向物理世界的能力,随后进入真实环境部署。
部署过程中产生的成功、失败、异常状态、环境变化以及机器人交互数据,又可以成为后续预训练和对齐的数据来源,动模型持续迭代。
随着部署范围扩大,模型能够接触到多样化的环境、任务和交互状态;真实世界经验的持续积累,可以进步拓展训练数据所覆盖的状态分布,为下轮模型训练和能力提升提供新的数据基础。
随着模型能力提升,其能力又有机会进步扩展到多机器人本体、多任务和多真实环境。
由此,预训练、对齐和部署不再是彼此割裂的阶段,而是逐步形成个由真实世界数据持续驱动的 Physical AI 学习闭环。
具身智能的大模型竞争,终比的是谁能形成自己的闭环
过去两年,行业已经证明机器人可以获得越来越多能力。
接下来难的问题,是这些能力能不能被统起来,并随着数据、训练和真实部署不断增长。
这也是为什么,只看个机器人能不能跑酷、能不能航,或者跌倒以后能不能爬起来,已经很难完整判断 Physical AI 公司的技术能力。真正需要观察的是这些能力背后的学习系统。
它能不能把个样本扩展成类技能,能不能把多个压缩成个统模型,能不能跨环境和跨本体泛化,能不能从自己的行为结果中继续学习,能不能在身体状态发生变化之后仍然完成任务,以及终能不能把真实部署产生的经验重新送回训练体系。
从 LightParkour 到 LightNav-0,再到 Light REACT,亮源新创过去个多月公开的三项技术成果,实际上沿着这条路线逐层展开。个从全身运动开始,个把能力扩展到通用空间智能,个继续向真实世界中的韧部署进。
它们还不是 Physical AI 的终点,但已经让亮源新创的技术路线变得加完整:不是围绕个机器人产品不断增加,而是围绕具身智能基础模型建立从数据、训练、对齐到真实部署的完整能力栈。这也是三段范式真正想解决的问题。
大模型的上轮竞争证明,智能可以随着数据、力和训练规模持续增长。
而 Physical AI 的下轮竞争,需要回答个难的问题:当模型真正拥有身体、进入现实世界之后,这套 Scaling 还能不能继续成立。
亮源新创正在做的,就是把这个闭环跑起来。
* 本文系量子位获授权刊载,观点仅为原作者所有。
键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!相关词条:罐体保温 塑料挤出设备 钢绞线 超细玻璃棉板 万能胶
奥力斯 万能胶生产厂家 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述江西防火门胶厂家,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。