机器人的想象力也有“算力定律”了,AI还学会了更准的物理直觉
机器人世界模型能力随算力可预测增长,并能零样本执行任务;AI物理建模也更准确。
一句话
最近两项研究很有意思:一个是 RoboJEPA,证明机器人的“想象力”(预测未来状态的能力)会随着算力增加而有规律地提升,甚至可以零样本规划真实任务;另一个是 STRIKE,让 AI 先学会预测“状态变化”而不是直接生成视频,从而对物理世界的理解更准确。
为什么重要
机器人也有“规模法则”了。 大语言模型(比如 ChatGPT)的能力会随着模型大小、数据量和算力增加而可预测地提升,这被称为“规模法则”(scaling law)。现在 RoboJEPA 发现,机器人的世界模型(可以理解为机器人的“想象力”)也遵循类似规律:它的“想象误差”(预测未来和实际的差距)会随算力增加按照幂律下降。这意味着我们可以像预测大模型性能一样,提前预估机器人模型在更大规模下的表现,而不必真的训练出来。更厉害的是,这种世界模型还能直接当成机器人“大脑”来用——只给它一张目标图片,它就能规划出一系列动作,在真实硬件上完成需要长时间推理的任务,而且没有经过专门训练(零样本)。
AI 的物理直觉更扎实了。 传统的视频生成模型只是让画面看起来连贯,但未必真正理解物理规则(比如物体碰撞后应该怎么动)。STRIKE 把任务拆成两步:先预测场景的“状态变化”(比如一个方块被推了一下后位置会怎样),再根据这些状态生成视频。这样 AI 学到的不是表面的像素运动,而是更深层的物理规律。实验显示,在多个物理推理和机器人操作基准上,STRIKE 都明显提升了物理一致性和操控视频的逼真度。
对我意味着什么
这些进展离普通人的生活并不遥远。更可预测的机器人世界模型,意味着未来家庭机器人、自动驾驶车辆能更可靠地“预演”动作后果,减少试错和风险;更准确的物理建模,则会让 AI 在模拟、游戏、电影特效甚至科学研究中表现得更加真实可信。虽然现在还在实验室阶段,但方向已经清晰:AI 正在从“看着像”走向“真理解”。