世界评论家模型WCM:让VLA强化学习学会“预判未来”

方法贡献与验证

问题的根源在于一个矛盾:评论家需要时序信息来应对部分可观测性,但稀疏的奖励信号不足以驱动它从高维视觉历史中提取有用的时序表征。现有方法要么回避这个矛盾——只用单帧,要么天真地拼接多帧却缺乏有效的学习驱动力。这里存在一个明确的研究空白:如何为评论家提供一个密集的、自监督的学习信号,迫使它真正理解场景的动态变化?