你的位置:任丘市奥力斯涂料厂 > 产品中心 > 泉州pvc管道胶水 探索RSI,生数新世界模型让机器人开始自我进化

泉州pvc管道胶水 探索RSI,生数新世界模型让机器人开始自我进化

发布日期:2026-09-13 15:37 点击次数:55
PVC管件胶

林舟 发自 凹非寺 量子位 | 公众号 QbitAI泉州pvc管道胶水

机器人学习拧灯泡,如果拧歪了,谁来告诉它问题出在哪,下次又该怎么改?

这正是机器人"自进化"让人期待的原因:人类不可能替它示范所有情况,想让机器人越干越好,就需要它有办法评价动作的结果,并从反馈中继续学习。

生数科技新发布的 Motus2,在这面做了次不错的尝试,走入了当前具身智能研究中的水区。

除了"自进化",它还颇有些集大成的意味:触觉、灵巧操作、Ego 数据……当前具身圈的几个热门关键词,几乎都能在这个世界模型中找到对应。

今年 2 月,它的前代 Motus 发布时,世界动作模型的概念甚至还不成熟,而 Motus 在 50 项通用任务测试里,较 Pi-0.5 对成功率出 35 以上。

在前代模型基础上,Motus2 进步拓展视觉、语言、动作与触觉等模态,在个模型里同时点亮三棵技能树:行动、预测、评估。

它既能撸起袖子干活,又能提前脑补"动作之后会发生啥",还能事后给自己分。三种能力缝衔接,形成闭环。

世界模型终于实现自我进化了。

模型实现闭环自进化迭代

我用三个关键词,带你迅速看懂 Motus2。

个关键词是:自进化,这是 Motus2 相比上代核心的变化。

传统的机器人策略模型学习的是:现在看到这个状态,下步该做什么。

这也是当前行业的主流范式,模型只记住了"看到 A 就做 B "的统计关联,却不理解 B 为何能致期望的结果 C。旦环境变了,这种缺乏因果认知的策略便会迅速失。

而 Motus2 则把三种能力放在了同个模型中:

行动:WAM(世界动作模型)生成动作,负责回答"接下来做什么"的问题;

预测:AC-WM(条件动作世界模型)预测后果,负责回答"做完会发生什么"的问题;

评估:VM(价值模型)评估结果,负责回答"这个结果好不好"的问题。

关键的是,行动、预测、评估这三种能力不再彼此立,而是开始形成闭环:

生成动作→预测后果→评估结果→新策略

模型自己预测和评估出的结果,成为改进自身策略的反馈;改进后的策略,又进入下轮迭代。这也是 Motus2 对递归自我改进(Recursive Self-Improvement,简称 RSI)的次初步探索。

需要说明的是,这里的"自进化",指的是利用模型自身的预测和价值反馈持续改进策略,并不意味着机器人已经能在开放环境里限自主学习。

这是怎么做到的?

想让同个模型既能"上手干活"又会"预判未来"泉州pvc管道胶水,就得先解决个核心问题:不能让它在做动作之前,就提前"偷看"到动作执行后的结果。

这是时序上的作弊,旦发生,即便模型在训练集上看着很聪明,换到真实场景就会立刻露馅。这也是此前许多"生成 + 动作控制"训练案折戟的原因——模型学会了用未来的视觉帧来"反"当前动作,而非真正学会决策。

因此,Motus2 从机器人域中间训练阶段,开始采用 Action-first(动作优先)的信息流。

这相当于给模型定好了顺序:先根据当前观测生成动作,再预测动作带来的结果,后评估结果好坏。

当模型明确了信息流的先后关系后,接下来是把预测结果真正变成决策和学习信号。Motus2 分别从理阶段和训练阶段入手。

理阶段,Motus2 用了种叫 Best-of-N 规划的办法:模型先想好几个候选动作,分别脑补执行后的画面,再由价值模型分,挑个分数的去执行。执行完小段,机器人重新观察真实世界,再开启下轮。

这相当于给机器人次比较案的机会,用于优化当次动作选择。

这种做法在强化学习和规划法里并不新鲜,Dreamer 类的 model-based RL 法早就验证过"先在脑内模拟、再挑优动作"的思路;Motus2 的新意在于把这套逻辑塞进了个原本只用来生成动作的 - 动作大模型里,而不是单训个轻量的模拟器。

训练阶段,候选动作的分会被转化成策略新的信号,分数的案得到强的正向引,分数低的逐渐被模型放弃。团队称之为"基于模型的强化学习(MBRL)"。

该阶段只新动作相关的参数,预测和评估部分保持不动,避反馈信号把已经学好的模型带偏。

个比,理时规划像是做题时多想几种解法,争取把眼前这道题做对;训练时新策略,则像是通过练习掌握了好的解题法,下次容易做对。两者都能表现,但后者才真正改变了模型学到的东西。

这种机制也改变了具身域对数据价值的定义,失败数据也有了不同于成功示范的用途。

过去,行业度依赖"轨迹",失败的轨迹大多被当成噪声过滤掉;但在 Motus2 的闭环中,成功轨迹告知机器人"正向解法",而失败轨迹则用于学习动作后果与结果评价,帮助模型识别哪些动作未能进任务。

让机器人从失败中学习,其他团队也在探索。例如 Physical Intelligence 的 RECAP,会让机器人先跟人学,再自己练习;做错时,人可以接管纠正,模型也会根据执行结果判断哪些动作值得保留、哪些应该少做。

Motus2 则进步利用世界模型,让些候选做法不在现实中逐个试过,也能先预测后果、分比较,再用这些反馈改进策略。

真机实测数据验证了这套闭环的果。

在手机放置和多指操作两项真机任务中,基础策略平均成功率为 65;单加入规划,提升至 67.5;单加入基于模型的强化学习,达到 72.5;两者结,达到 75,比基础策略 10 个百分点。

触觉和记忆补上视觉缺失的信息

二个关键词是"全模态"。Motus2 新增了两块拼图:触觉和记忆。

先说触觉。灵巧操作中,视觉能看到物体在哪、姿态如何,却很难完整判断机器人与物体之间的接触状态。

就拿撕厨房纸来说,两只手的位置看起来正确,也不代表纸已经被稳稳夹住。接触处是否滑、受力怎样变化,都会影响接下来的动作。

对灵巧操作而言,触觉信息是关键环,也正是现在市面上触觉技术路线和硬件设备"百花齐放"的原因。

Motus2 为此加入了个轻量触觉模块。在短动作片段执行之前,它可以读取新触觉反馈,进步细化动作。

这里有个务实的设计:触觉模块复用了主模型已经出来的中间结果,不用每次都重新跑遍完整的骨干,兼顾了反馈频率和计开销。

而这恰恰是不少团队的痛点,接入触觉信号往往意味着额外挂套立的小模型,模型越重,万能胶厂家反馈就越慢,而灵巧操作讲究的正是手感泉州pvc管道胶水,慢拍动作就可能变形。

在抽取纸杯、撕纸两项真机任务中,加入触觉后,平均成功率从 60 提升至 72.5,提升 12.5 个百分点。

说完触觉,再聊聊记忆,它解决的是另类问题。

个块被藏进三个杯子中的个,杯子重新摆放之后,只看当前这帧画面已经判断不出目标在哪,机器人须记得刚才发生过什么。

Motus2 默认缓存近期的真实观测,在寻找隐藏块、根据历史提示操作按钮这两项测试中,保留完整历史信息的案平均成功率达到 57.5,明显于压缩历史信息的案。

这个结果说明:对于依赖长期上下文的任务,历史信息本身就是决策的部分,不能被简单压缩。

但有个矛盾,如果把历史都保留下来,需要多存储和计;压缩历史,又可能漏掉关键线索。而记忆机制需要解决的,正是这种取舍。

业内其他团队也在探索解决这个难题。有的只保留近小段观测,相当于不断覆盖的行车记录仪;有的给历史信息"划",会保留开头和近的部分画面,把早的中间过程压缩成简短的记忆。思路不同,但目的都是在"记得多"和"跑得快"之间找到平衡。

这跟语言模型的上下文窗口问题有点像,区别在于,语言模型可以靠长的注意力窗口或者检索机制去缓解,物理世界里的记忆问题目前还没有那么优雅的解法。

Motus2 默认缓存近期的真实观测,同时测试了保留完整历史和压缩历史信息的案。在寻找隐藏块、根据历史提示操作按钮这两项测试中,保留完整历史信息的案平均成功率达到 57.5,明显于压缩历史信息的案。

这组实验并不能说明"记忆压缩行不通",Motus2 目前保存完整观测的法,像是找到终答案之前的阶段妥协。

将人类操作经验迁移到灵巧手

三个关键词:自由度灵巧手。

Motus2 已经部署在单手 22 自由度的 Sharpa Wave、单手 20 自由度的 WUJI Hand 2 等平台上,展示了拧灯泡、翻书、多指操作等任务。

Sharpa Wave 和 WUJI Hand 2 都属于较自由度的灵巧手。自由度增加,让机器人有了多操作可能,也让学习变得复杂。同个物体可以换着手指抓,接触位置和手指配稍有变化,后续动作就可能不同。

这里面,真正的难点其实在于数据。

数据金字塔的概念不用再多讲了。这里面真正值得关注的,是 Ego 数据和真机数据的配。

Motus2 选择的路径,是把人类的视角操作经验当成主要数据来源,再逐步迁移到机器人身上。

英伟达发布的数据与训练框架 EgoScale 也采用了类似思路。这类工作的共同出发点是:人每天都在用双手操作物体,机器人能不能先从这些经验中学习,而不用所有事情都亲自示范遍?

Motus2 这条路径背后是套多层次的 Ego 数据体系,训练分为三步走:

步是单目 Ego 预训练,用大规模人类操作学习基础的物体和场景变化规律。

二步引入双目和人类动作数据,学习细粒度的手部与物体交互信息。

三步是机器人域的适配训练,靠机器人轨迹和人机对齐数据,把前两步学到的经验迁移到机器人自己的控制空间里。

整套 Ego 数据体系的规模约为 13 万小时人类视角数据,配上百小时的机器人及人机对齐数据。

团队做了组对照实验,显示在同样的目标任务微调流程下,只经过人类 Ego 数据预训练的模型,五项真机任务平均成功率是 51,加入机器人域的中间训练之后,成功率跳到 84,提升了 33 个百分点。

这个结果体现了这两种不同类型数据的分工思路:用人类数据提供规模化的世界知识和操作经验,再用机器人数据完成控制适配。

人手和灵巧手的尺寸、关节活动范围、控制式并不样。人用拇指轻轻拨就能完成的动作,换到机器人身上,可能需要重新调整手指位置。人类经验提供了学习基础,具体怎么用这只机器手做出来,还要经过机器人数据适配。

团队还做了组数据规模对比实验,把双目数据从 2000 小时路加到 20000 小时,发现模型在人类动作预测任务上的验证误差持续下降,没有看到明显的天花板。

这至少说明,靠堆人类数据来提升模型能这条路,目前还没走到头。

从"能行动"到"会反思",中间还有多远

作为世界模型域的引者之,生数科技致力于构建连接数字世界与物理世界的通用世界模型。

李飞飞团队将世界模型分为三类:输出像素的渲染器、输出几何与物理状态的模拟器、输出动作的规划器。

而生数科技把通用世界模型演进路线分为五:L1 生成世界,L2 与世界交互,L3 在世界中行动,L4 自主世界智能体,L5 世界组织者。

生数科技关注的是:如果目标不是完成某个局部,而是让机器逐步获得通用的世界智能,它需要沿着怎样的能力路径成长?

L1-L5 并不是五类彼此立的模型,而是条能力不断累积的演进路径。

按照这套分,Motus2 已经具备 L3 "在世界中行动"的核心能力:理解当前状态、预测动作后果,并输出真实机器人动作。

从 L3 继续向 L4 迈进,个关键问题是:模型能否利用自己的能力,参与改进自身?

这与递归自我改进(RSI)的思路相呼应。在 Motus2 中,模型预测不同动作的后果,再通过价值评估产生策略新信号;新后的策略继续生成候选动作,进入下轮预测、评估与优化。

由此,Motus2 开始触碰 L4 "自主世界智能体"核心的部分——自主决策、自主反馈、持续自我改进。

但须承认,从单次任务中的策略优化,到开放世界中的长期自主学习和持续进化,还有很长的路要走。

比如,触觉数据在不同机器人本体之间的迁移还很困难,长任务中的预测可靠、长期记忆的率,以及开放世界里的持续学习,都需要继续探索。

但 Motus2 至少验证了点,从预测行动后果,到利用后果改进策略,评价与反馈开始真正进入世界模型的闭环。

Motus2,是生数的新答卷,也代表着世界模型又向前走了步。

传送门:

项目主页与真机演示:https://motus-robotics.github.io/motus2/

论文链接:https://arxiv.org/abs/2608.30237

键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!相关词条:不锈钢保温施工     塑料管材生产线     钢绞线厂家    玻璃棉板    泡沫板橡塑板专用胶

奥力斯    泡沫板橡塑板专用胶报价    联系人:王经理    手机:18232851235(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定泉州pvc管道胶水,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。

友情链接:

产品中心 新闻资讯 联系奥力斯

Powered by 任丘市奥力斯涂料厂 RSS地图 HTML地图

Copyright Powered by站群 © 2025-2054