凯时AG

泉源:姆巴佩训练赛脚后跟破门作者: 许羽花:

ICML 2026 | 多智能系一切也能搭积木??Agent Primitives让MAS走向??榛从

本文事情由伊利诺伊大学厄巴纳 - 香槟分校(UIUC)DREAM Lab 团队完成。 。。。通讯作者 Haohan Wang 教授为 UIUC 信息科学学院教授、DREAM Lab 认真人,,,, ,研究偏向包括可信人工智能、大语言模子与多智能系一切。 。。。

论文问题:Agent Primitives: Reusable Latent Building Blocks for Multi-Agent Systems论文链接:https://arxiv.org/pdf/2602.03695实验室网址:https://dream.ischool.illinois.edu/

配景与念头

多智能系一切(Multi-Agent Systems,,,, ,MAS)展示了令人印象深刻的能力:一个模子认真提出方案,,,, ,另一个模子举行品评,,,, ,尚有模子肩负投票、妄想或执行。 。。。通过角色分工和多轮协作,,,, ,系统能够解决单个模子难以稳固完成的数学推理、代码天生和知识问答使命。 。。。

一个 MAS 的例子。 。。。出自我们 team 的 TMLR survey paper:Chen, K., Wang, P., Yu, Y., Zhan, X., & Wang, H. (2025). Large language model-based data science agent: A survey. arXiv preprint arXiv:2508.02744.

但这种能力背后,,,, ,保存一个容易被忽略的工程问题:今天的大大都 MAS 都是围绕详细使命手工搭建的。 。。。面临一个新问题,,,, ,研究者往往需要重新界说 Agent 角色、重新设计提醒词、重新划定新闻的转达顺序,,,, ,并一直调试协作协议。 。。;;;;; ;灰桓鍪菁⒁桓瞿W樱,,, ,甚至一个使命表述,,,, ,原来的架构就可能需要大幅修改。 。。。

这与现代深度学习的生长路径形成了鲜明比照。 。。。构建卷积神经网络时,,,, ,我们不会为每一个视觉使命重新发明卷积;;;;; ;搭建 Transformer 时,,,, ,也不需要重新设计注重力机制。 。。。成熟的神经网络之以是能够快速演进,,,, ,部分原因正是研究社区找到了卷积、注重力、残差毗连等可复用的基础构件。 。。。

那么,,,, ,多智能系一切是否也能拥有类似的笼统形式呢??是否可以把重大的 Agent 事情流拆解成少量稳固、通用的盘算单位,,,, ,再像搭乐高一样,,,, ,将它们按需组合起来呢??

Agent Primitives 给出的谜底是:多智能系一切也可以拥有自己的「基础??椤埂 。。。

从「复用 Agent」到「复用协作模式」

Agent Primitives 的出发点,,,, ,是重新审阅 MAS 中什么才是真正应该被复用的工具。 。。。古板要领通常把一个 Agent 看成原子单位:它拥有牢靠身份、牢靠提醒词,,,, ,并在系统中肩负一个预先划定的角色。 。。。但「数学专家」、「代码审查员」或「妄想者」这些角色,,,, ,自己往往与使命高度绑定,,,, ,很难直接迁徙。 。。。

论文视察到,,,, ,只管差别 MAS 的角色名称和流程看起来五花八门,,,, ,它们内部重复执行的盘算模式却高度相似:有的系统让模子天生谜底后举行自我审查;;;;; ;有的系统并行天生多个候选 。。。,,, ,再通过较量告竣共识;;;;; ;尚有的系统先把重大目的拆成妄想,,,, ,再逐步执行。 。。。

因此,,,, ,论文不再把 Agent 看成最小构件,,,, ,而是进一步向下拆解,,,, ,把这些重复泛起的内部盘算模式笼统为 Agent Primitives,,,, ,即面向大语言模子多智能系一切的、可复用的潜在构件。 。。。

基础的 Primitives

论文实例化了三类基础 primitive。 。。。它们并非试图穷尽所有协作方式,,,, ,而是从现有 MAS 中提炼出三种高频、互补的盘算结构。 。。。

Review Primitive:

把「天生 — 品评 — 修正」酿成通用循环

Review Primitive 对应的是多智能系一切中最常见的迭代刷新模式。 。。。模子先形成一个候选解答,,,, ,随后对其中的推理误差、事实过失或实现缺陷举行审查,,,, ,再依据反馈更新谜底。 。。。这个历程可以重复举行,,,, ,直到输出趋于稳固。 。。。

它的价值不但是增添一次「请检查谜底」的提醒。 。。。通过把审查与修正封装成自力 primitive,,,, ,系统可以在数学证实、代码调试、开放域问答等使命中复用统一种盘算结构,,,, ,而无需为每个使命重新设计一套 critic 和 refiner。 。。。

Voting & Selection Primitive:

在多个候选中形成共识

当一个问题保存多条合理推理路径时,,,, ,单次天生容易受到采样波动影响。 。。。Voting & Selection Primitive 让系统并行探索多个候选 。。。,,, ,再对这些潜在体现举行较量、聚合和选择。 。。。

古板投票通常依赖最终文本谜底:先把每条推理完整解码,,,, ,再通过字符串匹配或特殊提醒举行选择。 。。。相比之下,,,, ,该 primitive 直接作用于内部潜在体现,,,, ,使系统能够保存候选方案中更富厚的语义和推理信息,,,, ,而不是只依据已经压缩成文本的效果做决议。 。。。

Planning & Execution Primitive:

将高层妄想与底层执行疏散

重大使命往往不是「想得更多」就能解决,,,, ,而是需要先确定做什么,,,, ,再决议怎样做。 。。。Planning & Execution Primitive 把高层使命剖析和低层方法执行拆开:妄想阶段建设整体蹊径,,,, ,执行阶段围绕子目的逐项完成,,,, ,并把中心状态继续转达。 。。。

这种疏散可以降低模子在长使命中同时维护全局目的与局部细节的肩负,,,, ,也让统一个妄想结构能够适配数学推导、程序编写与多阶段问答等差别问题。 。。。

绕过自然语言瓶颈

仅仅把事情流命名为 primitive,,,, ,还缺乏以解决现有 MAS 的基础局限。 。。。大大都多智能系一切通过自然语言交流信息:一个 Agent 把内部思索解码成文本,,,, ,另一个 Agent 再读取文本并重新编码。 。。。每经由一轮,,,, ,信息都要履历一次「潜在体现 — 文本 — 潜在体现」的转换。 。。。

这种方式直观、可读,,,, ,却也价钱高昂。 。。。文本解码会丧失内部体现中的细粒度信息;;;;; ;长链路交互会一直积累噪声和误差;;;;; ;重复天生与读取大宗文本,,,, ,则带来可观的 token 开销和推理延迟。 。。。系统中的 Agent 越多、协作轮数越长,,,, ,这种通讯瓶颈越显着。 。。。

Agent Primitives 让 primitive 内部直接通过 Key-Value Cache(KV Cache)举行潜在通讯。 。。。KV Cache 原本用于生涯 Transformer 已处理 token 的注重力状态,,,, ,阻止自回归天生时重复盘算。 。。。论文进一步把它作为 primitive 之间转达内部信息的载体,,,, ,使后续??槟芄恢苯蛹绦靶蚺趟阈纬傻那痹谧刺,,, ,而不必先将其完整解码为自然语言。 。。。

在毗连差别阶段的 KV Cache 时,,,, ,系统还需要处理位置编码的一致性。 。。。论文通过旋转位置编码(RoPE)的重新编码与对齐,,,, ,使来自差别盘算阶段的缓存能够被后续??樽既方有 。。。由此,,,, ,多个 primitive 不但是看法上可以组合,,,, ,在模子内部的盘算状态层面也能够真正「插接」起来。 。。。

论文用实验证实晰使用自然语言处理时,,,, ,长上下文中的使命遗忘:在长上下文的开头、中心或最后注入一条辅助指令,,,, ,较量两种通讯方式能否在完成原始使命的同时保存新增约束。 。。。效果显示,,,, ,当指令位于上下文中心时,,,, ,自然语言通讯的指令遵照率骤降至 15.6%,,,, ,而 KV Cache 通讯仍抵达 73.3%。 。。。

论文进一步考察了通讯噪声对多智能体协作的影响。 。。。详细而言,,,, ,研究者在数学推理历史中逐步插入来自其他问题的无关推理句子,,,, ,以模拟 Agent 交互历程中一直累积的噪声。 。。。实验效果显示,,,, ,当插入 3 条无关句子时,,,, ,自然语言通讯的准确率已下降至 73%;;;;; ;当噪声增添到 10 条时,,,, ,准确率进一步降至 47%。 。。。相比之下,,,, ,KV Cache 通讯在相同设置下仍能划分坚持 100% 和 93% 的准确率。 。。。

上述效果批注,,,, ,相较于自然语言通讯,,,, ,基于 KV Cache 的潜在通讯能够更完整地保存前序推理状态,,,, ,并显著降低无关信息在多阶段交互中的累积影响,,,, ,从而提升多智能系一切在噪声情形下的通讯稳固性与推理鲁棒性。 。。。

谁来决议怎样搭这些「积木」??

有了可复用构件,,,, ,下一个问题是:面临一个新盘问,,,, ,系统应该选择哪种 primitive,,,, ,又应该以什么顺序组合??若是仍然由人手工指定,,,, ,架构设计的肩负并没有真正消逝。 。。。

为此,,,, ,论文引入了一个自动化的 LLM Organizer。 。。。Organizer 首先剖析目今盘问的性子与难点,,,, ,再从 primitive 荟萃中选择合适的??椴⒆橹葱辛鞒獭 。。。例如,,,, ,需要验证和修正的使命可以挪用 Review;;;;; ;保存多种候选路径的问题可以加入 Voting & Selection;;;;; ;长程重大使命则更适合先使用 Planning & Execution,,,, ,再对局部效果举行审查。 。。。多个 primitive 也可以串联或嵌套,,,, ,形成更完整的 MAS。 。。。

Organizer 的决议由一个轻量级 Knowledge Pool 提供参考。 。。。Knowledge Pool 纪录已往使命中乐成的 primitive 设置,,,, ,让系统能够使用已有履历,,,, ,而不是针对每个新盘问从零最先搜索。 。。。随着乐成设置一直积累,,,, ,构建 MAS 逐渐从「手工设计一条牢靠事情流」,,,, ,转变为「凭证问题动态检索并组合基础构件」。 。。。

要领框图

完整框架如下图所示。 。。。Organizer 凭证用户盘问和 Knowledge Pool 中的历史履历选择并组合 primitives;;;;; ;Review、Voting and Selection、Planning and Execution 划分封装三类可复用协作模式;;;;; ;所有 primitive 的内部协调均通过 KV Cache 完成,,,, ,并对外保存与通俗 LLM Agent 一致的接口。 。。。

实验效果

论文在数学、代码和知识问答等八个基准、五种大语言模子主干上举行了系统评估。 。。。实验关注的不但是最终准确率,,,, ,也同时较量 token 使用、推理延迟、相对单智能体的特殊开销,,,, ,以及跨模子主干的稳固性。 。。。

从详细使命来看,,,, ,Primitives-based MAS 在数学推理、代码天生和知识问答上均取得了稳固提升,,,, ,并且没有泛起古板 MAS 要领在部分使命上提升、在另一些使命上显着退化的情形。 。。。更主要的是,,,, ,这种性能增益并不是依赖无限增添 Agent 数目或天生更长的交互文本获得的。 。。。综合准确率、token 消耗、推理延迟和跨模子体现,,,, ,可以将 Agent Primitives 的主要实验效果概括如下:

这些数字展现了一个主要事实:多智能体协作并不必定意味着数倍以致数十倍的推理本钱。 。。。古板 MAS 的高开销,,,, ,很大一部分来自重复文本天生和冗长通讯,,,, ,而不完全来自解决问题自己所需的有用盘算。 。。。当协作被重新组织为潜在空间中的??榛趟愫螅,,, ,系统可以在保存性能增益的同时,,,, ,把特殊本钱控制在更靠近单智能体推理的规模内。 。。。

走向可组合的智能系统

今天构建 MAS,,,, ,仍然很像早期编写神经网络:大宗能力被写死在详细架构中,,,, ,每个新使命都需要重新搭建。 。。。Agent Primitives 提出了一条差别的蹊径 —— 把角色背后的协作纪律抽离出来,,,, ,封装为潜在空间中的标准构件,,,, ,再由 Organizer 凭证使命动态组合。 。。。

若是这种思绪进一步成熟,,,, ,未来开发者面临重大使命时,,,, ,或许不必先问「我需要设计几个 Agent、划分写什么 prompt」,,,, ,而可以先问:「这个问题需要哪些基础盘算模式,,,, ,它们应该怎样毗连??」

从重复造轮子,,,, ,到复用基础??;;;;; ;从文本新闻驱动的牢靠团队,,,, ,到潜在状态毗连的动态系统,,,, ,这正是 Agent Primitives 希望推动的范式转变。 。。。

@陈逸凡:M6全站,,,, ,解放军代表诘责:日本何时致歉
@郭冠中:彩民用32元中4.2万足彩大奖
@刘雅雯:帮唱嘉宾海来阿木向张碧晨致歉

【网站地图】