这组实验和数据来自团队研究记录,任务是合成规则,不是现实业务任务的通用成绩。

我一直在想一个问题:Agent 之间交换经验和能力,到底能带来什么?如果十个 Agent 的结果比一个好,我能不能说它们“合作”了?

有一阵子,我真的差点这么说。团队实验里,参与者变多,最终成绩也一路上升,曲线很漂亮。可复核实验流程时,一个问题浮了出来:即使这些 Agent 互相一句话不说,只要让它们各做一次,再从十份答案里挑最好的一份,成绩也会提高。数量本身就给了我们更多抽奖机会。

先做一个会让自己失望的对照#

团队复核把“多个独立 Agent 各自完成、最后选最好的一份”作为零基线。这个对照不传递经验,不需要共同计划,也没有谁从谁那里学到东西。如果所谓协作成绩只比它好一点,或者根本没有超过它,我就不能把提高归因于交换。

早期单个 Agent 中转实验已经给过提醒:在一组难的合成任务上,接收者自己归纳规则的准确率约为 0.539,读到另一个 Agent 传来的规则后约为 0.523。差值为负,置信区间也覆盖零;这组任务没有支持“传一下就会变强”。接口通了,不等于有可传的能力。

这里的口径很窄:16 个随机种子、同一类私有规则任务,比较的是接收者自己归纳和读取传来规则后的准确率。它不是在测“所有 Agent 团队是否有用”。如果我把这个负结果省掉,只讲后面的高分,就会把一个仍未过关的前提藏起来:发送者首先得掌握接收者没有的东西。

真正让我改口的是后来的数量实验。早期研究把参与者增加时的上升曲线解释成“数量带来涌现”。独立复核后,发现聚合器在挑答案时还借用了正确答案作参照,相当于考试时先看答案再决定哪个学生写得最好。把这个不合理的选择条件拆掉,再用纯粹的独立抽样模型预测,原先的曲线几乎贴了上去。扣掉“多抽几次选最好”之后,剩下的增益随 Agent 数量变大反而靠近零:在几个数量点上,残差从约 +0.093 走到 −0.008。

那一刻最有用的结果,不是“协作没希望了”,而是我终于知道什么不能算协作证据。原分数上升,只能证明系统多试了几次;要说发生了交换,还得证明没有通信时做不到、通信后才做得到。

这也改变了我看实验图的顺序。以前第一眼看最高点,后来先看横轴每加一个 Agent,系统同时多拿到了什么:更多独立尝试、更多 token、更多工具调用,还是一个独特的信息片段?如果预算和选择器都跟着变,只把横轴标成“Agent 数量”,这张图其实没有回答交换的问题。反过来说,控制变量不是为了把结果做小,而是为了让结果小到仍然可信。

扣掉“多抽几次”以后,曲线还剩多少? 0 +0.093 +0.023 +0.004 −0.008 191525 Agent 数
按团队合成任务复盘中的四个数量点重绘:纵轴是观测成绩减去独立选择预测的残差,而非原始准确率。残差趋近零,不能据此声称数量本身带来了交换增益。

后来我把问题改成了“谁手里有别人没有的东西”#

为了让独立抽样不再有机会蒙对完整规则,后续实验设计了互补信息任务:每个参与者只看得到一个必要因子,单看任何一份都推不出完整答案。随后比较独立选择、多数表决、关闭通信以及真实交换后的组合结果。

可以把它想成三个人各拿到一页不完整的说明书。甲知道一项条件,乙知道另一项,丙知道第三项。让他们各自写十遍完整说明书,再挑最像的一份,仍然不等于把三页合在一起。实验故意把任务做成这种结构,就是为了让“多抽几次”不能冒充“彼此学到了东西”。这里的规则、样例和正确答案都由程序构造,方便逐项排除泄漏;代价则是它离真实项目很远。

在一轮合成实验里,几种无通信对照的准确率大致在 0.47–0.61,交换互补因子再组合达到约 0.965。对独立选优的 0.531,差约 0.434;即使对“让单个模型看全部样例”的 0.613,仍差约 0.352。关掉交换通道后,结果回到约 0.490。多加只重复同一因子的参与者,也没有同样的提升。这组证据比“人多分高”更接近我想验证的命题:有效的交换来自互补信息,不是参与者数量本身。

这轮仍是 16 个随机种子。记录里的无通信对照包含独立选优、多数表决、关闭通信,以及让单个模型看全部样例;它们回答的是不同的反驳,所以不能只挑最弱的一条来比。尤其是“关闭通信”这一项:如果关掉通道还拿到同样分数,那交换就只是装饰,整篇文章的核心解释也该撤回。

但这里仍有一条必须说清的限制:这些是合成任务,不是现实项目;组合函数是预先给定的,最后拼规则的步骤由外部程序完成,并非 Agent 自己发现了组合方法。我能说的是“交换互补信息在这类任务中带来了可测增益”,不能跳到“一个自主 Agent 社会已经出现”。

更具体地说,总线确实传递了各参与者发现的因子,但“收到三项以后怎样拼成可执行规则”仍是实验框架替它完成的。下一步若要谈团队,就得让接收方自己检查来源、判断哪个因子可信、发现冲突时能退回并重试;还要把任务从合成规则换成真实工作,看交换是否仍比一个拿到全部材料的 Agent 更省时间、更可靠。那些验证没有完成之前,“交换”仍是一个被实验支持了部分机制、尚未交付完整产品体验的想法。

这次研究改变了我思考 Agent 交换的顺序。先问每个 Agent 独自掌握什么、交换了什么、谁验证收到的东西能用,再问成绩为什么提高。以后无论写团队协作还是能力网络,我都想保留这次被漂亮曲线误导、又被对照实验纠正的过程。因为交换论若要成立,最先要过的不是命名关,而是反例关。