你的智能体不需要更好的模型
一个单独得分为 30% 的模型在 Nvidia 的代理框架内得了 100%。同一个模型,没有重新训练,70 分来自周围的脚手架。
这是一个名为 ARC-AGI-3 的基准测试。
它将 AI 放入一个不熟悉的回合制世界中,没有说明。没有规则,没有目标,没有教程。它必须通过玩游戏来弄清楚游戏是什么,就像有人让你坐在一个棋盘前,棋子你从未见过一样。
当它推出时,人类清除了 100% 的环境。世界上最好的 AI 管理了 0.37%。
两年的进展之后,Claude Opus 5 将其提高到 30.2%。ARC Prize 称这是一个真正的推理飞跃,而不是基准黑客,这不是他们经常给予的赞美。
然后在 8 月 21 日,Nvidia 发布了 100.00 的分数。所有 183 个关卡,所有 25 个环境。
运行 Claude Opus 5。
而且它不仅仅是勉强通过。评分指标奖励在不浪费移动的情况下解决关卡,根据首次人类需要的操作数量来衡量。AVO 使用了 6,624 个环境操作,而之前的领导者使用了 7,542 个,因此它以少 12% 的慌乱完成了所有内容。
1、同一个模型。完全相同的模型。
这是值得深思的部分。
Nvidia 没有训练任何东西。它没有微调、蒸馏或以任何方式改进模型。它拿取得分为 30% 的模型,将其放入一个名为 AVO 的系统中,该系统得了 100%。
七十分,来自包装。
Nvidia 自己的框架对于公司博客来说异常简单:模型很重要,但模型不是整个代理。
2、框架实际做了什么
两件事,都不需要博士学位就能理解。
它记住。 AVO 保留它已经尝试过的内容以及发生的情况的持久记录。当代理回来时,它不会重新探索已经覆盖的领域,因为记录就在那里。
它监视。 一个单独的监督层位于主代理之上,跟踪整体轨迹是否在前进,并在进展停滞时推动。
就这样。记忆和监督者。
其余的是一个循环。检查、计划、实施、评估、重复,这大致是一个称职的工程师对尚未理解的问题所做的。
3、为什么我相信这一点,因为我已经测量了差距
过去几周我一直在进行实验,正是这两个组件解决的失败,数字以令人不安的方式吻合。
关于记忆。 我让两个相同模型的副本相互下棋,唯一的区别是每个模型看到的内容。一个得到了棋盘位置。另一个得到了移动列表,必须在脑海中重建棋盘。
得到棋盘的那个模型非法移动减少了 65%。同一个模型,同样的游戏。整个区别在于状态是提供的还是记住的。
然后我运行了第三个条件,其中模型必须在移动之前自己写出棋盘。这根本没有区别。被给予状态帮助很大。生成自己的副本没有任何作用。
第三个结果强化了这一区别。 另外,我在两个模型上运行了 360 次依赖算术链试验,长达 1,280 步。零错误。一个也没有,无论长度如何。
原因是在该任务中,状态就是答案。每一步的结果都被写入输出,下一步在那里读取。没有任何内容需要重建。
将这三个结果放在一起,规则就出现了。当自生成状态与输出相同时,它有效。当它必须从其他东西派生时,它就失败。 从移动列表派生的棋盘是派生的。运行总计不是。
AVO 的持久记忆是提供的状态。这就是它有效的原因。
关于监督者。 我让三个模型设计棋盘游戏,模拟了数千次,并将每个模型自己的失败报告交给它们。
它们正确诊断了自己的损坏游戏。一个写道,贪婪的玩法已经退化为一个循环,其中第一个玩家被迫向第二个玩家提供令牌,这完全正确。另一个追溯了为什么座位一赢得每场比赛的确切算术。
然后,五次中有五次,修复失败了。 其中五次中有三次在这个过程中破坏了其他东西。
正确的诊断。错误的修复。每次都是。
监督层是一个外部观察者注意到事情已经停止取得进展。这正是那些模型自己都无法做到的。
4、他们做的不是基准测试的东西
分数下面隐藏着一个我觉得比分数更有说服力的结果。
在 ARC-AGI-3 之前,AVO 是完全为其他事情构建的:在 Nvidia 自己的硬件上优化 CUDA 内核。在一个注意力内核任务上,它连续运行了七天,探索了 500 多个方向,提交了 40 个不同的内核版本,并产生了在 DGX B200 系统上比 FlashAttention-4 快高达 10.5% 的代码。
FlashAttention 不是一个软目标。它是该领域中优化程度最高的代码之一,由以此为生的人们精心打造。
在真实工程问题上进行七天的无人监督迭代,由硬件基础测试决定每次尝试是否更好,这比排行榜更难伪造。而且它是相同的架构。Nvidia 交换了任务接口,将谜题环境作为纯文本 64x64 网格提供,完全没有图像,并让循环保持不变。
一个为调整 GPU 内核而构建的代理解决了一个它从未设计过的交互式推理基准。这种转移是实际的主张,它比 100.00 更大。
5、诚实的范围
两个注意事项,Nvidia 首先提出了这两个,这值得说明。
这只是公开集。 ARC-AGI-3 保留半私有和私有保留集,两者都没有测试。Nvidia 更新了自己的措辞以使边界更清晰,称基准已解决会夸大发生的事情。
Nvidia 警告不要将 30 与 100 的比较视为受控消融。 两次运行不是作为干净的 A/B 设置的。差距足够大,方向没有疑问,但它不是实验室结果。
还有一件事对 Nvidia 有利。他们使用的模型是 Anthropic 的,不是他们自己的,也不是合作伙伴的。如果你设计这个来奉承自己,你不会选择竞争对手的模型作为大脑。
6、如果你正在构建某些东西,这意味着什么
当代理表现不佳时,本能是伸手去拿更好的模型。这种本能现在可以衡量地错误了,至少对于长任务来说。
七十分来自记忆和监督。无论下一个模型版本给你什么,它都不可能给你七十分。
三件事随之而来。
给你的代理状态。不要让它记住。 我的国际象棋数字说这值得 65% 的错误,而要求模型自己写摘要则毫无价值。
在循环外部放一些东西来监视循环。 无法注意到自己卡住的东西就是卡住的东西。
并对整个系统进行基准测试,而不是模型。 裸模型的排行榜几乎无法告诉你一个构建良好的代理会用它们做什么。一个 30% 的模型以 100% 完成了这个。
还有第四个,这是人们跳过的一个,因为它听起来像记账。
保留已经尝试过的内容的记录。 不是摘要,是记录。AVO 的记忆存在是为了让代理停止重新探索一小时前覆盖的领域,在我的游戏设计实验中,这正是出错的地方:三个模型不断提出修复他们已经正确诊断并且已经无法解决的问题的修复方案,没有任何东西将失败向前推进。
这四个都不需要新模型。它们需要有人构建无聊的部分。
7、我不断回顾的部分
两年来,故事一直是模型变得更好,一切下游都会改善。
在这里,模型完全保持原样。有人为它构建了记忆并给了它一个监督者,它从十次中有七次失败变成了零次失败。
有趣的前沿可能根本不在模型内部。它可能是围绕它的相当不起眼的工程。
这是好消息,不仅因为无聊的部分更便宜。当实验室决定发布时,新的前沿模型就会到来,你无法让它更快发生。当你编写它们时,记忆层和监督者就会到来。
Nvidia 的措辞是模型很重要,但模型不是整个代理。根据证据,模型是它的 30%。
原文链接:Your AI Agent Does Not Need a Better Model. Nvidia Proved It
汇智网翻译整理,转载请标明出处