人工智能(AI)行业一直在讨论的天下模子(world model),,下一步会走向那里??
在主流范式中,,天下模子通常凭证目今状态和行动展望下一状态。。。。。从 Sora 引发“天下模拟器”讨论,,再到 Genie 3 实时天生可交互天下,,讨论的焦点仍然是怎样把未来展望得更准、更逼真。。。。。
现在,,上海 AI Lab 、浙江大学和新加坡国立大学(NUS)团队,,提出了一个「以 Agent 为中心」的天下模子新范式:天下建模的未来,,是从展望天下转向服务 Agent。。。。。
他们提出了以 Agent 为中心的交互式天下署理(World Proxy),,在 Agent 与真真相形之间提供低本钱、可控反。。。。。,支持 Agent 的妄想、学习和一连自我刷新。。。。。
论文链接:https://arxiv.org/abs/2608.02713
项目页面:https://worldbench.github.io/awesome-agentic-world-model
详细而言,,天下署理位于 Agent 与真真相形之间,,凭证 Agent 提倡的盘问、行动或干预,,返回执行效果、履历/手艺、奖励或验证信号,,并在推理、训练和配合演化三个层级支持 Agent 自我刷新。。。。。
图|以 Agent 为中心的天下署理的看法转向与设计空间。。。。。
研究团队体现,,这项事情旨在建设以 Agent 为中心的新范式,,为 Agent 更好妄想、更快学习提供蹊径图。。。。。
天下模子,,要以 Agent 为中心
一连刷新的 Agent 需要逾越静态监视,,通过动态交互获得反馈。。。。。而真真相形交互本钱高、过失操作难以回滚、反馈滞后,,也难以大规模并行化。。。。。古板天下模子通常以未来物理状态展望为焦点,,但对需要可操作反馈的 Agent 而言,,其建模规模仍然有限。。。。。
在这项事情中,,天下署理位于 Agent 与真真相形之间,,在 Agent 提交真实验动前展望、检索或验证相关反。。。。。,让 Agent 能够以更低本钱获得可用于决媾和刷新的信息。。。。。
详细而言,,一个以 Agent 为中心的天下署理,,需要知足三个要求:
1.支持 Agent 自动提倡盘问、行动或干预,,并形成闭环;;;
2.基于真真相形的数据、规则、轨迹;;蚪换ブぞ菅埃,坚持情形锚定;;;
3.以可操作的信息增益为目的,,为妄想、决议、探索和训练提供有用反。。。。。,而不但追求视觉真实感或状态展望准确率。。。。。
详细流程如下:
1.提倡交互: Agent 凭证目今目的与上下文,,自动提出盘问、行动或干预。。。。。
2.展望信息转移: 天下署理在目今信息状态与交互条件下,,展望或天生反馈。。。。。
3.返回反。。。。。 反馈作为信息增益回到 Agent ,,例如未来状态、展望视察、执行效果、检索到的指导或验证结论。。。。。
4.用于刷新: Agent 将反馈用于妄想、决议、战略学习或一连刷新。。。。。
图|从天下模子到天下署理。。。。。
单次运行时,,天下署理只返回一次展望、检索或验证反馈。。。。。在多步迭代中,,它的反馈会一连影响 Agent 后续的盘问、行动与战略更新,,并形成刷新轨迹。。。。。一个好的天下署理,,需要提供情形锚定、可控、有用、可扩展且具有前瞻性的反馈。。。。。
天下署理,,怎样刷新 Agent
天下署理对 Agent 的赋能,,可以按介入刷新流程的深度分为三个层级。。。。。它既可以在推理时增补上下文,,也可以在训练时天生优化信号,,还可以与 Agent 一起随真真相形反馈一连更新。。。。。详细机制如下:
图|用于 Agent 刷新的 L1 至 L3 天下署理。。。。。
L1 推理时指导(Inference-Time Guidance):最轻的一层介入。。。。。天下署理不改动 Agent 参数,,只在推理阶段提供影象/手艺检索、执行模拟或验证反。。。。。,并将其并入目今上下文。。。。。流程上,,Agent 提倡盘问,,天下署理返回指导效果,,Agent 再据此决议。。。。。这一层本钱低、可回滚,,但上限受限于 Agent 已有能力。。。。。它的利益是让 Agent 在目今回合内看得更多、推理更准、行动更稳。。。。。
图|L1 通过天下署理举行推理时指导。。。。。
L2 训练时优化(Training-Time Optimization):这一层中,,天下署理的作用从目今决议延伸到战略训练。。。。。它会处理 Agent 的 rollout,,如为轨迹打分、指出失败原因、天生合成轨迹;;蚱枚裕,也可以凭证失败模式天生新的训练使命。。。。。这些信号随后被用于 SFT、DPO、PPO 或 GRPO 等训练,,让 Agent 自己的交互历程成为优化战略的燃料。。。。。
图|L2 由天下署理驱动的训练时优化。。。。。
L3 Agent-署理配合演化(Agent-Proxy Co-Evolution):这是介入最深的一层。。。。。真实轨迹、失败案例和新发明会一连回流到天下署理中,,使其随情形和使命更新;;;更新后的天下署理再反过来指导、验证和训练 Agent。。。。。这样,,Agent 与天下署理在闭环中一连相互更新,,配合提升。。。。。
图|L3 Agent 与天下署理配合演化。。。。。
除了 L1-L3 的介入层级,,天下署理还可以按所建模的信息转移类型划分为六种功效形态。。。。。差别形态返回差别反。。。。。,在现实应用中也常被组合使用。。。。。
图|以 Agent 为中心的天下署理的功效形态。。。。。
动力学形态:关注行动后的情形转变,,最靠近经典天下模子。。。。。它吸收目今状态、历史视察和 Agent 行动,,展望未来状态,,须要时也可展望奖励。。。。。
空间形态:关注从另一个视角会视察到什么。。。。。Agent 盘问新的位置、相机位姿或视角,,天下署理返回响应的视察或空间表征,,让 Agent 在移动前先看一眼。。。。。
执行形态:关注数字情形会返回什么。。。。。它模拟代码、下令、网页点击、API 或工具挪用后的状态转变,,以及 stdout、stderr、过失信息、测试效果或页面转变。。。。。
影象/履历形态:关注目今决议所需的历史履历、失败案例或约束。。。。。它从过往交互、轨迹和失败中检索相关信息,,并将这些履历反馈给妄想历程。。。。。
手艺形态:关注目今使命可以使用什么手艺。。。。。它凭证目的、上下文和情形状态,,推荐可复用手艺、工具使用流程或行动先验。。。。。
奖励/验证形态:关注行为是否准确、清静、可行,,以及应当怎样刷新。。。。。它评估 Agent 的行为、轨迹、谜底或妄想,,输出奖励、品评、偏好或验证结论。。。。。
缺乏和未来偏向
不过,,只管天下署理能够降低真真相形中的交互本钱,,但现在仍保存以下缺乏:
首先,,它反馈的逼真度和恒久可靠性有限。。。。。天生效果可能看似合理,,却违反现实动力学纪律,,过失还会在长轨迹中一直累积。。。。。未来需要关注长轨迹展望、误差撒播和不确定性校准,,而不但是天生更逼真的效果。。。。。
其次,,Agent 仍难以判断何时应该信任署理,,何时需要返回真真相形验证。。。。。太过依赖天下署理,,可能导致难以实时发明的过失。。。。。未来需要增强置信度评估、风险感知和真真相形回退机制。。。。。
别的,,当天下署理被用作奖励模子或验证器时,,Agent 可能使用其判断盲点,,爆发奖励 hacking 和清静风险。。。。。后续研究需要提升天下署理的鲁棒性,,并引入反抗测试、自力验证和权限控制。。。。。
最后,,信息增益仍缺乏统一的评估标准。。。。。现有基准更多关注真实感、可控性、展望准确率某人类偏好,,却往往将天下署理与 Agent 脱离评估。。。。。未来,,仍需建设以 Agent 为中心的评测系统,,权衡天下署理反馈是否真正资助 Agent 妄想、学习和一连刷新。。。。。
作者:夏千斯
如需转载或投稿,,请直接在本文章谈论区内留言