快速导读:提出从物理状态预测转向智能体可用的信息转换预测,构建六种功能形式、三个赋能层级的智能体中心交互式世界代理,以支持智能体的持续改进。
本文是一篇立场论文,提出将世界建模从传统的环境状态预测重新定义为面向智能体的信息转换预测。作者认为,持续改进的智能体需要低成本、可并行、可回滚的交互反馈,而直接与真实环境交互存在效率、安全与可扩展性瓶颈。
文章的核心贡献是一个概念框架:Agent-Centric World Proxy。它定义了六种代理功能形式(Dynamics、Spatial、Execution、Memory/Experience、Skill、Reward/Verification)和三个赋能层级(L1 推理时引导、L2 训练时优化、L3 智能体-代理协同进化),构成一个 Functions × Levels 的二维设计空间,系统化梳理世界代理赋能智能体的路径。
英文题目:Quo Vadis, World Modeling? Towards Interactive World Proxies for Continually Improving Agents
论文出处:arXiv 每日论文精选 · arXiv:2608.02713
原始论文:PDF / 论文页面
这篇论文解决什么问题?
当前智能体大多依赖静态监督数据进行训练,缺乏主动交互与自我改进的能力。真实环境交互虽然能提供最真实的反馈,但面临四大瓶颈:成本高、速度慢、不可回滚、难以并行化。例如,在机器人操作中,每次试错都可能损坏硬件;在 Web 导航中,错误操作可能触发不可逆的后果。
世界模型(World Model)作为中间层,可以预测环境的下一个状态,从而提供低成本的模拟反馈。经典定义来自 Ha & Schmidhuber,形式为状态转移预测。然而,这种以环境为中心的视角过于狭窄——智能体不仅需要知道“下一步会发生什么”,还需要知道“这个操作是否安全”、“历史上类似任务如何解决”、“当前计划是否合理”等多样化信息。
本文指出,现有世界模型研究主要关注物理状态预测的精度,而忽略了智能体实际决策中所需的信息类型。这导致了一个研究缺口:如何构建一个以智能体为中心、能够提供多样化可操作反馈的中间代理层?
作者将这一缺口表述为一个范式转变:从“环境状态预测”转向“智能体可用的信息转换预测”。这一转变将世界建模的适用范围从物理仿真扩展到执行模拟、记忆检索、技能引导、验证反馈等多个维度。
核心创新
- 提出从World Model到World Proxy的范式转变,将核心从物理状态转移扩展到智能体可用的信息转移。
- 定义六种功能形式的World Proxy:Dynamics、Spatial、Execution、Memory/Experience、Skill、Reward/Verification。
- 提出三个赋能层级L1-L3:推理时引导、训练时优化、智能体-代理协同进化。
- 建立Functions × Levels二维设计空间,系统化梳理世界代理赋能智能体的路径。
方法概览
提出Agent-Centric World Proxy概念,将世界建模从环境状态预测重新定义为智能体可用的信息转换预测。定义通用形式 $\hat{s}_{\ell+1} = \mathcal{WP}(s_\ell, u^\mathcal{F}_\ell)$,涵盖六种代理功能(Dynamics、Spatial、Execution、Memory/Experience、Skill、Reward/Verification)和三个赋能层级(L1 Inference-Time Guidance、L2 Training-Time Optimization、L3 Agent-Proxy Co-Evolution),构建智能体查询-代理反馈-智能体改进的闭环。
- 核心定义:World Proxy 是一个智能体可查询的中间层,形式化为 $\hat{s}_{\ell+1} = \mathcal{WP}(s_\ell, u^\mathcal{F}_\ell)$,其中 $u^\mathcal{F}_\ell$ 是智能体的查询,$\hat{s}_{\ell+1}$ 是代理返回的信息转换结果。这一形式化将物理状态转移扩展为通用的信息转移。
- 六种功能形式:Dynamics Proxy 预测未来状态与奖励;Spatial Proxy 生成新视角或位置的观测;Execution Proxy 模拟代码、命令、API 调用的执行结果;Memory/Experience Proxy 检索与当前任务相关的历史交互、失败案例或约束;Skill Proxy 检索或推荐可复用的行为知识或工具使用例程;Reward/Verification Proxy 评估智能体行为、轨迹或计划,提供奖励、批评或验证信号。
- 三个赋能层级:L1 Inference-Time Guidance 在推理时将代理输出作为丰富上下文辅助决策;L2 Training-Time Optimization 利用代理提供的奖励、批评或验证信号作为训练目标优化策略;L3 Agent-Proxy Co-Evolution 通过真实环境证据持续更新代理,同时将代理知识蒸馏回智能体策略,形成协同进化闭环。
- L1-L3 与 Chu et al. 的 L1-L3 区别:Chu et al. 从世界模型内在能力角度定义 L1 Predictor、L2 Simulator、L3 Evolver;本文从智能体赋能角度重新定义,L1 强调上下文增强,L2 强调训练信号,L3 强调协同进化。两者标签相同但内涵不同,需注意区分。
- Functions × Levels 设计空间:将六种功能形式与三个赋能层级交叉,形成 18 个单元格的二维矩阵。每个单元格代表一种代理赋能智能体的具体方式,稀疏单元格标记了尚未充分探索的方向。
- 有效 World Proxy 的标准:文章提出了保真度、效率、可扩展性、安全性和可解释性五个维度作为评估代理质量的准则。
- Agent-in-the-Loop 闭环:智能体查询代理,代理预测、模拟、检索或验证信息转换,返回反馈供智能体改进,形成持续的交互循环。
- 与相关工作的关系:文章将 Genie 归为 Dynamics Proxy 实例,将 Navigation World Models 归为 Spatial Proxy 实例,将 Web Agents with World Models 归为 Execution Proxy 实例,将 CodeIt 归为 Memory/Experience Proxy 与 L3 Co-Evolution 实例,将 SayCan 归为 Skill Proxy 实例,将 RLHF 归为 Reward/Verification Proxy 实例。
逐图理解论文
失败案例与直觉

图 4 对比了 World Model 与 World Proxy 的区别。World Model 仅预测物理状态转移,而 World Proxy 可以实例化为动态预测、空间合成、执行模拟、记忆检索、技能引导或奖励验证等多种形式。
核心区分与研究缺口

表 2 对比了环境中心预测与智能体中心交互建模的核心差异,包括预测目标、反馈类型、使用方式等维度,是理解范式转变的关键对照表。
论文贡献与解决方案

图 10 展示了六种 World Proxy 功能形式的可视化示意。每种功能形式对应一种信息转换类型,从物理仿真到语义验证,覆盖了智能体交互反馈的主要类型。
核心结论与局限

图 1 展示了本文的核心概念转变与设计空间。左侧为传统的环境中心世界模型,右侧为智能体中心的世界代理,中间展示了六种功能形式和三个赋能层级构成的二维设计空间。这张图是全文概念框架的可视化总览。
实验如何设计?
- 本文为概念性立场论文,未包含实验验证或定量结果。
- 文章通过文献调研方式,将现有工作映射到 Functions × Levels 设计空间中,以展示框架的解释力和覆盖范围。
- Table 6(第 22 页)展示了 Functions × Levels 的映射结果,其中部分单元格有代表性工作填充,部分单元格标记为稀疏或未探索。
- 文章未提出新的基准测试或评估协议,但指出了以智能体信息增益为核心的评价基准缺失问题。
- 文章未进行消融实验或对比实验,所有论断均基于概念推理和文献分析。
关键结果与论文证据
- 核心发现:世界建模的研究重心应从物理状态预测转向智能体可用的信息转换预测,这一转变能够覆盖更广泛的智能体改进需求。
- 六种功能形式覆盖了智能体交互反馈的主要类型,从物理仿真到语义验证,形成了一个相对完整的功能谱系。
- L1-L3 赋能层级为代理反馈的使用方式提供了清晰的梯度:从辅助推理到驱动训练再到协同进化,赋能深度逐步增加。
- Functions × Levels 矩阵揭示了当前研究的不均衡性:某些单元格(如 Dynamics L1、Reward L2)已有较多工作,而其他单元格(如 Spatial L3、Skill L3)仍处于未充分探索状态。
- L3 Agent-Proxy Co-Evolution 是最具雄心的层级,WebEvolver 和 CodeIt 等初步工作展示了代理与智能体协同进化的可行性,但整体仍处于早期阶段。
- 生成式代理的保真度与长期推演的误差累积是当前 World Proxy 面临的核心技术挑战,尤其是在 Dynamics 和 Execution 功能中。
- 代理作为奖励/验证器时可能引发奖励黑客问题,智能体可能学会利用代理的弱点而非真正提升能力。
- 智能体在线判断何时信任代理反馈的机制尚不成熟,缺乏可靠的置信度估计和不确定性量化方法。
阅读时需要注意
- 本文为概念性立场论文,未提供实验验证或定量结果,所有论断均基于概念推理和文献分析。
- 生成式代理的保真度与长期推演的误差累积问题未解决,这直接影响代理反馈的可靠性。
- 智能体在线判断何时信任代理反馈的机制尚不成熟,缺乏可靠的置信度估计方法。
- 代理作为奖励/验证器时可能引发奖励黑客与安全问题,智能体可能学会利用代理的弱点。
- 缺乏以智能体信息增益为核心的评价基准,现有基准多关注物理预测精度而非智能体改进效果。
- Functions × Levels 表格中稀疏单元格仅为示意,不代表已有成熟方案,部分方向可能面临根本性技术障碍。
关联工作
- Chu et al. 提出世界模型内在能力的 L1-L3 分级(Predictor, Simulator, Evolver),本文借用 L1-L3 标签但从智能体赋能角度重新定义,两者内涵不同。
- WebEvolver 展示了 L3 Agent-Proxy Co-Evolution 的实例,通过协同进化世界模型增强 Web 智能体的自我改进能力。
- Ha & Schmidhuber 的经典世界模型定义了状态转移预测,本文在此基础上扩展为信息转移预测,将适用范围从物理仿真扩展到多样化反馈。
- Genie 作为生成式交互环境,是 Dynamics Proxy 的典型实例,展示了生成式代理在物理仿真中的潜力。
- RLHF 从人类偏好学习奖励模型,是 Reward/Verification Proxy 的典型实例,展示了代理在训练时优化中的作用。