# 机器人运动会散场后，自变量给机器人建了一座「虚拟训练场」

- 作者：李超凡
- 发布时间：2026-08-27 18:34
- 分类：产品
- 原文：https://www.ifanr.com/1677048

![](https://s3.ifanr.com/wp-content/uploads/2026/08/3-7.png)

我已经被机器人刷屏一周了。

机器人刷新了人类百米纪录、「原地起飞」近三米、「害羞跑」的姿势火到海外、赛博张三丰腾空外摆 540°…….

![](https://s3.ifanr.com/wp-content/uploads/2026/08/1-2.gif)  
今年的世界人形机器人运动会更热闹了，来自六大洲 16 个国家的 666 支队伍，带着 2056 台机器人来到北京，比赛也从田径、武术等项目，一路延伸到家庭、酒店、工业和应急救援等真实场景。

不过机器人在赛场上的翻车，大家笑笑就过去了。而机器人真正进入家庭后，可能就是打翻水杯、撞倒家具，或者把刚收好的衣服重新扯到地上，那就笑不出来了。

真实的世界里没有固定的跑道和统一摆放的道具，杯子被人挪了一点，桌面多出一块抹布，原本训练好的动作就可能失效。

把机器人这些试错搬进虚拟世界，正是当下世界模型想做的事。它试图还原一个符合物理规律的环境，让机器人真正在动手前先预演：手往左偏一点会不会抓空，夹爪提前闭合会不会碰倒杯子。

但实际上不少世界模型无法实现可靠的「虚拟测试」。它们可能看懂了画面，却没有真正听从动作。推演时间一长，物体和位置开始漂移。虚拟世界里表现更好的策略，到了真机上也未必奏效。

就在机器人开始从竞技场走向真实场景时，自变量机器人发布了自回归世界模型 WALL-SS。

[![](https://s3.ifanr.com/wp-content/uploads/2026/08/img_6a901137827d0.png)](https://s3.ifanr.com/wp-content/uploads/2026/08/img_6a901137827d0.png)

WALL-SS 构建的这座「虚拟训练场」终于突破了世界模型的瓶颈，动作能否真正改变结果，长任务中能否保持连贯，虚拟成绩能否经得起真机检验，都有了新的解法和答案。

它可以推演持续60秒的倒水和物品整理任务，来测试不同动作的结果：按照不同的方式抓水杯，是抓空、碰倒水杯，还是成功抓起？

研究团队还把多套机器人策略分别放进 WALL-SS 和真实世界测试，在虚拟世界里执行效果很好的动作策略，搬到物理世界往往也有好的结果。

**这就有意思了，机器人做的「梦」，开始能够用来练习和筛选真实动作。**

*相关🔗*  
*项目主页：*  
*http://x2robot.com/pages/ss*  
*论文链接：*  
*https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf*  
*Github 链接：*  
*https://github.com/X-Square-Robot/wall-ss*

### 机器人「做梦」的方式，会决定现实里是否翻车

世界模型是目前具身智能最受关注的方向之一。

它可以理解成机器人脑中的预演系统。给它当前画面和一组准备执行的动作，它会预测接下来会发生什么。

机械臂向左移动 1 厘米，杯子会被抓住还是被碰倒？抽屉已经打开，下一步应该继续取东西，还是先调整手腕角度？机器人可以比较多个未来，再决定采用哪条动作路径。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/3-7.png)

机器人公司也可以把不同版本的动作策略放进世界模型测试。表现更好的版本再上真机，省下在真实世界测试动作效果的昂贵成本。

问题是，很多世界模型很多时候更像一位过分乐观的导演。

机器人训练数据通常以成功示范为主。如果模型看到的大部分夹爪闭合动作，后面都跟着物体被拿起，它就容易走捷径：只要夹爪闭合，物体就应该被抓起来。

即使夹爪与物体之间还有明显空隙，生成画面里的物体也可能主动贴进夹爪。论文把这类现象称为类似「磁铁式抓取」的错误。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/0.png)

这类偏差在跑步、跳舞等大动作里未必显眼，到了精细操作中却会直接决定成败。夹爪与杯把差几毫米，机器人可能抓空。插头角度偏了一点，也很难顺利插入接口。

机器人从「会做」走到「做成」，往往就卡在最后几毫米。

世界模型如果直接把这几毫米抹平，给出的未来越流畅，机器人越容易高估一套动作的可靠性。

推演时间一长，还会出现新的麻烦。

世界模型生成完一段画面后，还要把它作为下一段预测的依据。前面一点小误差，会在后续不断累积。物体可能慢慢偏离原位，夹爪与杯子的接触关系也会发生变化。

只保留最近几帧，模型会忘记之前做过什么，但要是保留全部历史，计算量和显存占用又会持续增长。

视频看起来逼真，不代表模型选出的策略真的更好。机器人研发需要知道，虚拟测试里的优胜者，到了真机上能不能继续领先。

**世界模型需要让不同动作确实通向不同结果，流畅画面只完成了最表面的一步。**

### 机器人怎么动，未来就该怎么变

WALL-SS 预测接下来几秒的画面时，会先搭出一版「低清预览」。

在这版预览里，模型先确定大方向：机械臂往哪里走，物体大概会怎么移动。随后，它把同一段画面一层层调清，补上物体轮廓、夹爪开合和接触位置。

论文把这种从大轮廓到小细节的层级叫做「尺度」。**已经生成的画面和发生过的动作，会成为下一段预测的历史，这就是「下一尺度自回归」。**

**画面每清晰一些，动作也会再影响一次未来。**

手臂往左还是往右，会先改变低清画面里的运动方向。夹爪何时闭合，会继续影响清晰画面里有没有碰到杯子。

一小段未来生成完成后，它会连同已经发生的动作一起进入记忆，成为模型继续往后推演的依据。

过去一些世界模型更像在开拍前看一眼动作要求，但后面它还是容易依赖任务描述和视觉经验，把剩下的剧情把剧情自己脑补出来。

WALL-SS 把动作和画面放在同一条时间线上。哪只夹爪在什么时候移动到哪里，头部相机和腕部相机应该看到什么变化，都要相互对得上。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/4-7.png)

同一张初始画面配上不同动作后，模型会生成不同未来。夹爪偏离物体时，它需要表现抓空。路径碰到障碍物时，它也不能直接跳到任务成功的结局。

结果怎么验证呢，WALL-SS 会固定初始画面，只换一条动作轨迹，看未来有没有跟着改变。模型如果只改变画面细节、始终生成同一个成功结局，很难在这项测试中获得高分。

WALL-SS 在这项评测中得到 0.290，Cosmos3 为 0.044，其他模型则是0分。这项指标衡量模型对动作变化的敏感程度。两者之间的差距表明，WALL-SS 更愿意按照输入动作改变后续画面。

模型愿意随着动作改变画面还不够。生成画面里的机械臂，也要真正走在给定路线上。

在衡量这件事的「轨迹精度」上，WALL-SS 得到 0.539，是全部对比模型中的最高分。它的视觉骨干 InfinityStar 得分为 0.251。换成人话，虚拟机械臂既「听见」了动作指令，也更能沿着指令指定的路线移动。

[![](https://s3.ifanr.com/wp-content/uploads/2026/08/img_6a90115191067.png)](https://s3.ifanr.com/wp-content/uploads/2026/08/img_6a90115191067.png)

▲固定初始画面，只改变动作条件，三组分支会生成不同轨迹和不同未来。蓝线是给定动作，橙线是生成画面中实际出现的轨迹.



这些能力也来自一批过去容易被丢掉的数据。

研究团队保留了抓空、滑落、碰撞、重新抓取、人工接管和失败恢复等过程。其中一种采集方式，是先保留机器人发生错误的动作，再回到接近出错前的状态，由操作员执行一套纠正动作。

**如果训练数据里没有失败，世界模型很容易把「任务目标」误当成「必然结局」。**

### 做一分钟家务，机器人怎么才能不「断片」

上面说的这些，只能保证机器人没有从第一步开始跑偏。

而家庭任务往往包含多个连续步骤，打开抽屉、拿起物品、放进抽屉、再把抽屉关上，可能持续几十秒。机器人还要记住抽屉是否已经打开，物品目前在桌面还是手里。

WALL-SS 没有让模型把每一帧都永远背下来。它会让记忆随着时间自动变得“模糊”。

刚刚发生的动作保留更多细节：机器人几秒前有没有碰到杯子，夹爪是否已经闭合，都需要精确记住。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/6-9.png)

更早的历史会被压缩。模型不必一直保存几十秒前每一帧的细节，只要记住桌上有哪些物体、它们大致在哪里、任务已经进行到哪一步。

最初的观察画面会被保留下来，作为场景和物体身份的锚点。视觉历史被压缩时，对应的动作历史也会一起压缩。

这就是「尺度压缩的长时间跨度记忆」，它像一份会自动整理的工作记录，刚刚发生的事情才保留详尽细节，更久以前的事情只留下摘要。

**模型不需要记住过去的每个像素，它只要了解哪些变化还会影响下一步。**

即便如此，预测画面的过程中仍不可避免地积累小的误差。机器人需要学会自己纠正误差。为此 WALL-SS 拿出了「逐尺度梦境强迫」的大招。训练时，研究团队会给历史信息加入扰动，要求基于有误差的信息，预测正确的未来。

这相当于让机器人平时就在「有小错误的梦」里继续往下走，学会别把一个小错滚成整段任务崩溃。

在长时测试中，WALL-SS 连续推演了 60 秒，轨迹误差、片段衔接、物体状态和视觉质量，都比对照模型更稳定。

其中倒水任务包含接近水瓶、抓握、抬起、倾倒和放回等阶段。在 60 秒推演中，机械臂逐帧轨迹误差保持在画面对角线的 0.5% 以下。

[![](https://s3.ifanr.com/wp-content/uploads/2026/08/img_6a901163cf75d.png)](https://s3.ifanr.com/wp-content/uploads/2026/08/img_6a901163cf75d.png)

▲上方记录从接近水瓶、抓取、倒水到放回的连续过程，下方比较生成轨迹与给定轨迹



只保留最近片段的版本，在 20 至 30 秒后开始明显恶化。去掉梦境强迫后，长期状态一致性也会持续下降。

这就能验证一项持续 1 分钟的操作里，机器人仍能记得自己做过什么，能够稳定地推演未来。

### 虚拟成绩，能不能替真机筛策略

不过就算动作对了，记忆也没断片，虚拟世界仍然可能和现实存在偏差。

你想如果一个机师只做过模拟飞行，你敢坐他的飞机吗？

而 WALL-SS 则想了一个办法，是给自己的预测安排两位长期在线的「裁判」。

在相同动作条件下，模型会生成多条未来支线。一个裁判会检查动作，比如画面里的机械臂是否按照给定方向移动，物体是否产生了对应变化。

另一个裁判负责审核长期一致性，看机器人和物体的状态有没有漂移，前后片段能否接上，多个摄像头看到的世界是否一致。

最后模型会根据评分调整下一次生成不同未来的概率，这套过程叫「视觉动力学的在线策略对齐」。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/8-6.png)

简单来说就是用来专门优化视觉世界的变化规律。机器人控制器不会收到任务成功率奖励。参考模型约束和真实轨迹回放也会同时加入，防止模型为了获得高分而牺牲原有画面质量。

对齐之后，动作跟随从 0.264 提升至 0.290，轨迹精度从 0.512 提升至 0.539，跨片段边界误差从 0.118 降至 0.104。动作与轨迹更贴近指令，前后视频也更容易接上，画面质量基本没有变化。

我们直接看看论文里虚拟测试和真机测试的对比。

研究团队选取 5 个不同训练阶段的 WALL-WM 策略，在 6 项任务、20 组匹配初始状态下，分别进入 WALL-SS 和真实机器人执行，共得到 600 对闭环结果。

600 对实验中，有 527 对的最终成败一致。WALL-SS 在虚拟世界里选出的较好版本，有 89% 的优劣关系与真机测试相同。

如果把 30 个「任务与策略版本」组合的成功率放在一起比较，虚拟结果和真机结果的相关系数为 0.926，平均绝对误差为 0.062。

这个 0.926 衡量虚拟与真实结果的整体变化趋势，不能理解成单次预测有 92.6% 的命中率。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/9-5.png)

▲左图比较虚拟与真机成功率，数据越接近对角线，代表两者越一致。右图比较 6 项任务中 5 个策略版本的虚拟与真机成.



**世界模型无需彻底取代真机测试，它只要能先筛掉较差的版本，就已经可以省下大量现实试错。**

WALL-SS 还在同一套系统中加入了动作专家。

外部动作给定时，视觉生成器负责预测「这样做会发生什么」。需要模型自主行动时，动作专家可以根据当前状态生成下一段控制指令。两个部分共享已经确认的世界状态和动作接口。

动作专家可以直接控制真实机器人。在论文的桌面双臂任务中，WALL-SS 的平均任务进度得分为 69.1。作为对比，π 0.5 为 49.6，DreamZero 为 44.1，LingBot-VA 为 34.0。

模拟器负责预演，动作专家负责执行。两者在同一份世界状态上来回接力，形成「提出动作—预演结果—继续行动」的闭环。

WALL-SS 主要作用在机器人认知和训练这一侧：怎样预演动作、记住长任务、评测策略。真正拧紧一颗螺丝、把插头稳定送进接口，还依赖关节精度、灵巧手、触觉和力控。

世界模型可以提前发现哪条动作更可能失败，也能减少较差策略直接上真机的次数。末端执行器能否稳定落位，仍取决于整套软硬件的配合。

### 具身智能的「ChatGPT 时刻」，看谁能更快走进现实

前几年，人们还在关注机器人能不能站稳、跑起来。今年的赛场开始把衣物整理、家庭清洁、酒店服务和应急救援放进长流程任务。

当机器人从舞台演示走向真实服务，行业判断技术的方式也会改变。一个成功 Demo 只是一张入场券。机器人能否重复完成任务，换个环境是否还能工作，模型每次更新要花多少真机成本，都会变得更重要。

**下一轮具身智能竞争，会看谁能让机器人学得更便宜、测得更可靠，并走进更多陌生环境。**

![](https://s3.ifanr.com/wp-content/uploads/2026/08/10-7.png)

WALL-SS 给我们提供了一种具体的解法：动作必须真正改变预测结果，长任务中不能轻易失忆，虚拟策略排名还要接受真机验证。

**当世界模型能预测真机策略的相对优劣，它就开始从内容生成能力变成研发系统的一部分。**

这会改变世界模型在机器人公司里的位置。失败和纠正数据先帮助模型认识现实的边界。随后，虚拟环境批量筛选策略，少量真机结果再回来检查和修正这个虚拟世界。

虚拟训练场由此兼任练习场、考场和校准台。真机数量决定数据入口，每一小时真机数据能换来多少轮模型迭代，也会影响研发速度。

真机需要占用设备、布置场景，还要有人处理失败后的复位。涉及碰撞、液体或易碎物品时，测试本身也有风险。

世界模型可以先承担大规模初筛。真机只需要验证虚拟考场里更有希望的候选策略。

这有点像汽车碰撞仿真。它不会取消最后的实车测试，却能减少为了筛选设计而撞掉的真车。

世界模型与 VLA 可以分工协作。VLA 负责根据视觉和语言生成动作，世界模型负责提前演一遍「这样做会发生什么」。一个负责出主意，一个负责看后果。

真机产生的成功、失败和人工接管数据，还能继续回流。世界模型变得更准后，又可以测试更多策略，再把更好的版本送回真机。

前段时间，自变量在一次物流分拣直播中，让搭载 WALL-B 的双臂机器人使用标准夹爪，处理纸箱、软袋、圆柱形快件和泡沫封装生鲜件等随机包裹。它完成了 1911 件有效分拣，准确率超过 98%。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/11.gif)

以后 WALL-SS 会让机器人走向工位之前准备更充分，它先在虚拟世界里检查它会不会抓空、碰撞，或者在连续作业中逐渐跑偏。对按吞吐量和停机时间计算成本的仓库，这类虚拟筛选有机会减少设备占用和现场复位。

这样一来，用户或者企业就可以尽量避免成为最早一轮试错的「小白鼠」，倒水、递物和收纳等动作，也有机会在执行前先比较不同后果。

王兴兴最近谈到他理解的具身智能「ChatGPT 时刻」：机器人能够在约 80% 的陌生场景中，只靠语言或文字指令，完成约 80% 的任务。对于这个时刻，他判断快则 2 至 3 年，慢则 5 年甚至 10 年。

当然 WALL-SS 还没有把机器人直接带到这个阶段，这篇论文的真机实验主要集中在桌面双臂任务，验证的连续推演时长为 60 秒，但自变量至少提供了一个抵达「ChatGPT 时刻」更现实的方向。

等到机器人真正走进家门，少摔一次杯子，比多拿一块金牌要重要得多。
