世界模型已经成为具身智能的重要技术范式。它试图构建一个符合物理规律的“虚拟世界”,作为试验机器人动作的“训练场”,让机器人提前看到动作带来的结果,从而决定要执行哪些动作。
然而现有世界模型仍面临三大瓶颈:首先是模型更习惯按照视觉画面“猜测”未来,却忽略动作指令;其次是推演时间一长,画面就开始崩溃,出现物体变形、位置错乱等问题;第三是在虚拟世界中可行的动作策略,到了真实物理世界却无法复现,导致世界模型无法成为可靠的评测环境。
今日,自变量机器人正式发布 WALL-SS,即下一尺度自回归世界模型。它突破传统扩散模型以单片段生成视频的方式,创新采用“下一尺度自回归”架构:如同画家作画一般,先勾勒粗尺度轮廓,再逐层细化画面与物理细节,从而实现对未来画面更稳定、更精细的预测。
WALL-SS 实现了三方面突破:预测锚定动作,生成的未来严格遵循动作指令;长时间稳定,推演较长时间仍能保持画面和物体状态连贯;可验证性,在虚拟世界验证的动作能够作为真实世界中的有效参考。
测试结果显示,WALL-SS 的“动作跟随”得分达到 0.29,是所有对比模型中唯一不为零的模型;推演时长达到 60 秒,画面仍未出现明显崩溃;虚拟世界与真实世界的任务成功率吻合度达到 93%。
![[MD:Title]](http://img1.mydrivers.com/img/20260827/ec66e1af-3e52-4782-9e87-441718772d03.png)
WALL-SS 学习“动作—画面变化”的物理规律,并通过下一尺度自回归,从粗到精生成未来画面。
预测画面不听动作“指挥”?WALL-SS 让动作真正控制画面生成
现有世界模型在预测未来状态时,往往高度依赖对背景和物体的先验模式,而对动作信号的细微变化不够敏感。
以机械臂抓杯子为例,手指的位置相差 1 毫米,在物理世界中就可能对应“成功抓起”和“撞翻杯子”两种完全不同的结果。然而,由于两种情况在视觉上高度相似,模型很容易忽略这 1 毫米的动作偏差,依据视觉惯性和先验经验,直接生成“稳稳抓住杯子”的虚假结果。
WALL-SS 提出了“尺度对齐的动作条件注入”:将机器人动作指令严格对齐到不同生成尺度中,让动作从生成画面的“辅助信号”变为必须遵循的核心条件。
在不同尺度的画面预测中,动作都直接参与决策:粗尺度决定机器人的大致位置,精尺度决定手指是否合拢,动作信号贯穿画面生成的全过程。同时,WALL-SS 对动作与画面进行严格对齐,统一时间轴和坐标系,并通过多摄像头信息协同,确保动作、视角与画面状态保持一致。
![[MD:Title]](http://img1.mydrivers.com/img/20260827/5d847b6d-5628-4cab-bc24-2ede030fe416.jpg)
分别输入向左、向前、向右三种动作指令,蓝色虚线为指令轨迹,橙色实线为生成轨迹,两者高度重合,表明模型生成能够遵循动作指令。
在“动作跟随”测试中,WALL-SS 得分 0.29,是所有对比模型中唯一得分不为零的模型。也就是说,此前的模型都难以让预测画面中的虚拟机器人真正遵循给定的动作指令。不仅如此,生成视频与给定动作轨迹指令的重合度也从 0.251 提升至 0.539,提升 115%。
时间一长画面就崩坏?WALL-SS 让模型分层处理记忆
世界模型面临的另一大挑战是,如何保持在长时间的稳定预测。模型需要连续生成未来的多个画面,而后续画面又建立在前面的预测基础上,因此任何细微的误差都会不断累积,最终导致预测崩溃:物体突然消失,桌面变得扭曲,机器人手中的物体瞬间回到原位。
预测崩溃的根本原因,在于模型必须将历史画面作为上下文。历史信息保留得太少,模型就容易“忘记”早先发生的事情;保留得太多,又会让上下文长度和内存开销快速增长。因此,如何在有限的资源下,持续保留对未来预测真正有用的历史信息,成为世界模型实现长时间稳定预测的关键。
WALL-SS 提出了“尺度压缩的长时间跨度记忆”:并非所有历史信息都需要被同等精细地保留,越近的记忆保留得越精细,越久远的则压缩为更粗粒度。比如,模型可以记住机器人几秒前“用左手抓住了杯子”,几十秒前“移动到了桌子旁边”,对于更久远的信息,只需保留“场景中有桌子和杯子”这样的概括。如此一来,模型不论推演多久,内存占用始终恒定。
![[MD:Title]](http://img1.mydrivers.com/img/20260827/5e429975-2f6c-4d65-9dfa-441a292db7b9.jpg)
WALL-SS 推演至 60 秒,画面仍保持清晰,物体位置稳定;通用视频模型在约 30 秒后物体消失。
不仅如此,WALL-SS 还会记住“是什么动作导致了这个画面”,在压缩视觉信息时同步压缩动作历史,让动作与结果之间的因果关系始终保持清晰。此外,自变量还提出“尺度级梦境强迫”,在训练时故意给模型“喂错题”,让它学会从错误中恢复,从而在推理过程中及时发现并修正误差。
在“流式推演”测试中,WALL-SS 能稳定推演 60 秒,画面依然清晰,物体位置也保持准确。作为比较,仅保留最近几帧信息的模型,推演 20-30 秒后就开始出现明显的画面崩坏。
虚拟世界预测“不足信”?WALL-SS 让模型成为可靠“试验场”
世界模型面临的第三个关键问题是:在虚拟世界里验证成功的动作策略,到了真实世界里是否依然有效?世界模型预测未来的目的,就是为物理世界中的动作提供依据。如果虚拟世界与真实世界存在明显偏差,预测结果就很难帮助机器人决策。
WALL-SS 提出了“视觉动力学的在线策略对齐”:让模型在自己预测的轨迹上通过强化学习“实战练习”,并根据两个裁判的反馈不断修正:一个检查“动作对不对”,即画面预测是否遵循动作指令;另一个检查“长期一致性”,即不同时间尺度下的画面是否保持连贯。通过这两重约束,WALL-SS 能进一步缩小虚拟世界预测与物理现实之间的差距。
在“闭环策略一致性”测试中,自变量在 6 个任务、5 个训练阶段分别进行测试,发现同一策略在虚拟世界和真实世界中的任务成功率,吻合度达到 93%。这意味着,虚拟世界中的测试结果已经具备较高的现实参考价值,可以将世界模型作为检验机器人动作策略的“试验场”,大幅提升筛选效率。
![[MD:Title]](http://img1.mydrivers.com/img/20260827/b24be773-ae2d-4d4a-80aa-ba061b9f3ee8.jpg)
同一个策略在虚拟世界与真实世界中分别测试,任务成功率高度吻合,相关系数达到 0.93。
不仅如此,WALL-SS 的同一个网络既能充当模拟器,也能充当规划器:模拟器根据给定的动作预测未来,规划器则根据任务目标自主生成动作路径。这样一来,就可以利用模型生成动作方案,再立即通过模拟器验证结果,整个“生成方案—验证效果—筛选最优”的闭环都在同一个模型里完成。
WALL-SS 还内置了动作解码头,可以从预测的未来画面中直接读取机器人下一步动作。传统世界模型只能回答“未来会发生什么”,还需要另一个模型将预测画面转换为动作指令;WALL-SS 则能够直接输出动作。这使 WALL-SS 不仅是一个可以预测和仿真的“虚拟试验场”,也能直接驱动机器人执行任务。
结语
具身智能要真正走进现实世界、服务于人,很大的挑战是在真实环境中试错,成本高、周期长且存在风险。世界模型能够让机器人在动手之前“先想一步”,提前推演不同动作带来的结果,再择优执行;WALL-SS 则让这个过程更可信、更稳定、更接近真实,有望大幅缩短机器人策略开发与筛选的周期。
WALL-SS 推动的不只是一项世界模型技术的突破,更为机器人构建了一条低成本、高效率的能力成长路径——让机器人先在虚拟环境中学习和验证,再将成熟的操作能力迁移到家庭、工厂和养老院等真实场景,让机器人拥有服务千家万户的能力。

