"批评者"回归AI
你是否想过为什么AI擅长编程或数学,却在写作方面表现糟糕?
梯形图转SCL | 博途AI辅助编程文档 | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo
一个四十年前的发现正在卷土重来来解决这个问题:可验证性问题,这是AI训练中最后几个未解决的问题之一,它可能导致AI进入一个可以改进我们想要的任何东西的未来。
提出的解决方案很多,但很少有坚持下来的。但这个可能会。
在这篇文章中,通过回顾AI前沿的最新研究,我将向你展示如何通过理解'可验证性问题'立即猜测一个AI想法或用例是否有前途,同时也揭示如何在AI世界中优化你的就业前景。
如果你想知道我给那些问我如何提高职业前景的人什么建议,请继续阅读。
1、可验证性问题
尽管围绕AI的所有所谓复杂性,理解它如何学习却出奇地简单。
然而,今天的话题相当高级,所以我们将采取循序渐进的方法,从AI的基础知识构建直觉,到我预测你会欣赏的令人惊讶的高级内容。
1.1 AI学习的是可以被衡量的东西
整个AI行业都围绕着同一个理念:我们取一个想要机器学习解决的问题,然后遵循一个简单的过程:我们让AI猜测一个解决方案,衡量它有多好,然后使用那个'错误信号'引导模型给出更好的答案。
简化地说,如果我们问AI '2+2',它回答'1',我们就发送一个信号让它猜一个更高的数字。如果它回答'6',我们就做相反的事情。经过多轮迭代,AI学会了输出'4'。训练的目标是找到在数万亿次不同"猜测"中平均损失最低的模型。
我们实际上将AI推向正确方向的方式比这复杂得多,它基本上使用导数(变化率)。
我再次大量简化,因为这不是文章的主题:AI是参数化模型;它们由参数(我们通常称它们为'权重')组成,我们可以在训练期间微调它们,我们使用它们关于损失的导数(更常被称为'梯度')将它们朝正确的方向移动。简单地说,如果梯度是正的,增加该参数将略微增加损失。因此,我们通过减少其值来更新该参数(反之亦然)。
想想DJ调音台上调节旋钮以找到正确的声音。他们听他们正在生成的声音,调节他们认为会改善声音的旋钮,然后逐步进行,直到获得很好的声音。直觉上,他们在做同样的事情:衡量错误并调整旋钮来纠正它。
例如,DJ可能会想,"低音太重了。我需要混音中更多的高音",然后他们通常会将低音/低音EQ旋钮调低一点,将高音/高音EQ旋钮也调高一点,然后再听。
原则上,他们在做与AI在学习期间做的完全相同的事情:衡量与他们想要听到的声音的损失并适应它。
自然,训练有素的DJ会做得比你好。这就是我们在训练期间所做的:找到产生最佳平均声音的旋钮组合,如果这有意义的话。
简而言之,这基本上就是试错学习。这如何扩展到我们今天拥有的模型?
AI不仅记忆输出,它们还学习技能。如果一个模型学会了持续对'2+2'输出'4',它可能间接学会了整数加法。因此,教它那个特定加法的努力也可能导致模型学会'3+7 = 10'。
大规模完成这个,这就是我们今天拥有的模型。这涵盖了所有AI训练,因为我们使用的不同训练方法(模仿学习或强化学习)本质上都是关于衡量模型预测有多好并从中学习;我们只是改变模型收到多少"帮助"。
但我离题了;深入AI训练的细节不是今天的目标。相反,我们今天的目标是理解AI的学习能力与我们衡量其进步的能力成正比。
1.2 无法验证就无法学习
想想我们之前的例子,'2+2';无论模型预测什么,我们都能立即衡量进度,因为我们能够毫无主观性地验证回答是对是错。如果答案是'4',很好。任何不是四的答案都是立即错误的。
既然模型学习的能力完全取决于拥有这个信号,我们立即意识到AI训练的局限性:
无法验证的东西就无法学习。
当你理解这一点时,你就能立即猜测AI正在或将在哪些领域取得进步,哪些领域不会,这实际上是令人愉快的。
你是否想过为什么ChatGPT或Claude能轻松解决几十年前的数学问题,但无论怎样都写不出一段不让人痛苦的段落?
好吧,现在你知道了。但为什么写作这么难学?
想想看:*什么造就了一个伟大的作家?*那充其量是主观的。有些人会为保罗·科埃略而疯狂,而另一些人在第一页就会感到无聊。
写作中的伟大取决于旁观者的眼睛。现在尝试在如此模糊的约束下训练模型。这是不可能的,因为AI并不真正知道自己是否在变得更好,因为信号是不可衡量的。
尽管如此,这种直觉对于预测就业市场非常强大。每当有人问我如何保护自己免受AI颠覆时,我唯一愿意回答的答案是***"专业化于不可验证的领域,因为AI在那些领域很难变得优秀。"***
但这个可验证性问题正是使今天的研究有趣的原因,因为它提供了一个相当直观的解决方案。它并不完美,但它会教你关于当今前沿模型如何训练的几个关键见解。
2、Dots AI,一个值得关注的中国实验室
今天的主角再次来自中国,让我告诉你,可能是时候更新你的前沿实验室名单了。
美国的开源模型努力也在蓬勃发展,来自Thinking Machine Labs或NVIDIA等公司。
再加一个到名单上
Dots Studio,RedNote(小红书)旗下的AI实验室,最近开源了dots3-note Preview,这是其dots3系列中最轻量的模型。
官方评估显示,该模型在推理、编码、代理、搜索和多模态任务中与更大的系统相比具有竞争力。

如你所见,该模型虽然相对较小(约2800亿参数,而其他模型是其两倍甚至十倍),但与前沿模型高度竞争。
这提供了不可否认的证据,证明后训练方法(如强化学习)对于帮助中国缩小差距至关重要,因为做得好的话,它们能使小模型匹配大得多的模型的性能。
但使这次发布不仅仅是又一次发布的是他们使用的一种名为TEMPO的RL方法,因为它代表了对可验证性问题的首批潜在"解决方案"之一,而且听起来确实可信。
3、追溯我们的根源
如前所述,目前大多数AI学习基于可自动验证的结果。我们现在基本上每次发布中都有三种流行的训练方法,像蛋糕一样层层叠加:
模仿学习:模型通过逐词模仿数据来学习,这些数据已经增长到数万亿个单词(以及图像、视频、音频等)。这里,信号完全没有歧义;模型预测一个词,然后将该词与它应该是的词进行比较。
强化学习(RL):在这里,模型被赋予一个要达成的硬目标,但也有一些自由来弄清楚如何到达那里。通过这样做,模型获得了如果只是模仿'黄金响应'可能永远学不到的新技能。为了引导模型给出好响应,我们给它奖励。
最简单的奖励系统是'冷热'游戏。如果玩家靠近他们必须找到的物体,你告诉他们'热';否则,你说'冷',引导用户找到物体。这听起来容易,只是因为这里的奖励系统极其简单。现实生活要混乱得多,所以教AI现实生活中的技能要困难得多。
- 在策略蒸馏:这在当今非常流行,我们巧妙地混合了上述两者。模型自由生成响应,但更大、更聪明的模型评估它。我们两全其美:我们激励AI'尝试一些东西,看看什么有效',但我们也得到'密集'反馈,因为另一个模型验证每个预测的质量。随着时间的推移,AI学习新技能,同时"倾向于"教师般的响应。可以猜测,这很昂贵。
今天的研究主角使用第二种方法。但要理解这种新方法的意义,我们需要理解RL目前面临的两个主要问题:
- 它受到'信用分配问题'的困扰。
模型可能需要数百步才能达到目标。虽然我们可能知道我们想要的结果,但模型如何到达那里同样重要,而且我们对哪些行动真正有帮助、哪些没有几乎没有任何可见性。
换句话说,它回答以下问题:在模型所做的数千个行动中,哪些值得为达到正确答案而获得信用*?*
直觉地理解这一点,想想一盘国际象棋。在赢之前,你可能已经采取了数百个行动(棋子移动)。如果我必须问你,在你所做的大约100个移动中,你会如何评价第37步的质量?
你能立即说出来吗?
有些移动完全是错误或强力移动,但许多只是游戏的一部分,然而它们仍然对胜利做出了贡献。这就是信用分配问题:仔细评分每一步并选择那些真正"推动了指针"的步骤是当今AI中最难的问题之一。
事实上,这个问题如此复杂,以至于我们干脆选择不选择,而是对运行中的每一步都平等评分。如果结果是正确的,我们就 leap of faith 并假设模型采取的每一步都是正确的。
当然,我们在欺骗自己,AI几乎肯定做了许多错误的选择,但这些选择尽管是错误的,却仍然被'强化'了。
- 序列现在太长了,无法等待答案
更糟糕的是,代理现在可以生成数千个步骤才能完成。现在看到代理处理一个问题几个小时甚至几天是很常见的。
想象一下,每次运行都要等几天,结果大多数都是糟糕的结果,因此被丢弃。
这不仅是时间的浪费,因为实验室距离他们的最佳模型被淘汰只有几周时间,而且他们在这个过程中烧掉了大量的现金。
此外,即使结果是错误的,为什么我们假设那次运行中的所有步骤都是错误的?如果模型在大部分时间都做得完美,只是在最后失败了呢?
也就是说,RL今天有一个大问题:我们采取全有或全无的方法,而实际上,模型可能在途中做出好的决策,但最后犯了错误,而在其他情况下,它可能做出糟糕的决策,但最终以正确的方式结束。前者永远不会被学习,更糟的是,后者在不应该被学习的时候被学习了。
虽然无批评者的解决方案在序列较短时可能有意义,但如果我们的代理要进行数千步,就没有办法绕过它:
AI批评者正在回归。
但什么是批评者?
4、批评者的回归
批评者是一个关键思想,来自一个被称为时间差学习(TD)的概念。这看起来可能很新,但实际上它已经有将近四十年的历史了。
Rich Sutton在1988年首次提出了TD学习。
这个方法的核心很简单:不是等待ground truth(每次尝试结束时的实际、可验证的答案),我们训练模型培养关于它们是否朝着正确方向前进的直觉。
使用我们之前的国际象棋例子,为了训练AI下棋,我们不让它玩数百局游戏,然后简单地评估"赢还是输?",因为那需要永远,而且是一个非常糟糕的信号。相反,我们迫使系统在每一步之后问自己,"我是否朝着正确的方向前进?"
这个模型就是批评者。它可以是一个单独的模型,也可以是自我判断的模型,但想法是一样的:目标是评估那些可能没有直接、可验证奖励的中间响应,并衡量行动者(生成跟踪的模型)成功的可能性。
因此,AI也可以从中间响应中学习。它可能会输掉一场游戏,但它可能发现了新的策略,因为它的一些决定实际上是好的。
在国际象棋的例子中,就像:"行动者把马移到了D5。根据我对这一步朝着获胜方向有多好的期望,我给它8分。"
如果你想知道,是的,这就是AlphaGo和其他超人棋盘游戏AI的创建方式——结合了自我博弈的概念,我今天不深入探讨。
事实上,批评者在去年年初之前仍然很受欢迎,当时DeepSeek在中国的突破(GRPO)和Allen AI研究所在美国的(RLVR)说服了世界我们可以抛弃批评者,直接在结果上训练,结果同样强大,今天又回来了。
*但为什么批评者被抛弃了?*它们似乎非常有帮助。当你考虑更细致的任务(如写作)时,复杂性立即显而易见。
假设你正在教AI写更好的文章;如果模型在写一篇10k字文章的路径上预测了第6,789个词'the',*你会如何评分那个'the'作为AI写好文章的标志?*在局部依赖(例如语法)之外,祝你好运。
如果你有一个真正好的答案,停止阅读,跳上飞机去湾区,筹集十亿美元,因为他们会给你;这就是这个问题真正有多难。
对于模棱两可的问题,批评者信号可能是有噪声的,在许多情况下,对我们的学习过程有害。原因可能是:固定计算。
这正是TEMPO修复的。
5、动态计算中间奖励
回顾一下问题,我们正朝着AI可以生成数十万字的序列、思考几个小时或几天才回答的方向发展。
这些通常被称为代理,因为它们除了"思考"很多之外还能采取行动。
这非常有价值,但需要为此训练AI。这意味着研究人员必须在令人惊讶的短时间内训练模型工作几天并获得实际结果,而不会烧掉他们所有的钱,即使每个训练信号可能需要几天并花费数千美元。
基本上,这不仅很难,而且既漫长又昂贵。
正如我所说,一个选择是让批评者回来。如果我们这样做,我们就回到了TD学习,因为我们不再仅仅判断最终响应;AI批评者也评估中间响应。这很棒,因为即使是一个超级长的运行仍然创建多个学习事件,而不仅仅是最后一个。
简而言之,如果我的代理现在将在每个答案之前生成1,000个步骤,我想知道其中哪些是好的。
但传统批评者有一个问题:它们为每个中间响应分配相同的计算(即"思考"),无论复杂性如何。
例如,假设我们正在训练AI写更好的小说。如果某个中间响应由于某种原因开始谈论之前没有介绍过的角色,而没有正确介绍他们,这是一个非常简单的迹象,批评者可以停下来并说,"等等,这些角色凭空出现,这影响了可读性",并给那个中间响应低分。
但更难的情况需要更多的思考。想象一下行动者突然专注于一个看似无关紧要的细节,比如一个角色总是在进房间前摘下手表。一个固定计算的批评者只看中间响应,可能会认为这是分散注意力的。但这个细节可能是刻意的伏笔,后来使结局奏效。
换句话说,这第二个例子需要更仔细的思考。
这正是Dots的新技术TEMPO旨在解决的问题。想法是使用另一个LLM作为批评者,但这个批评者不是简单地在一次尝试中输出分数,而是被允许推理响应的质量。
这类似于标准的批评者方法,但计算密集得多,因为这个批评者正在主动推理它所看到的内容;查看行动者的输出,调用一些工具(如搜索API)来验证某些事实的正确性,并且总而言之,在生成好分数方面投入更多的"努力"。

这就像一个匆匆批改学生作业的老师和一个停下来考虑每一个可能的错误并试图理解学生意图的老师之间的区别。
当然,对每个中间响应都这样做将极其昂贵,所以如上图所示,这是在一定数量的步骤上完成的。
总而言之,它试图是一种"两全其美"的方法:
- 一方面,我们让批评者回归,这对于以可持续的方式对长运行进行评分至关重要(否则代理需要永远学习,并且花费大量资金),
- 另一方面,我们给批评者动态计算权限,以便它可以决定,对于需要它的响应,"思考更长时间"。我们减少了批评者的参与次数,但确保批评者有可用的计算。
而且……它工作得非常好,创建了一个尽管"小"但远超其重量级的模型。
重要的是,它提供了如何解决不可验证性问题的最清晰示例之一。
6、TEMPO能解决不可验证性吗?
虽然我们不能以客观的确定性保证分数的质量,但投入大量精力来弄清楚它是否有潜力肯定有帮助。有时,这就是你所需要的。
也许最清晰的例子是一个简单的骑士放置游戏,行动者必须放置六个额外的棋子(白色),再加上两个预设的棋子(黑色)。当没有一对棋子可以通过"骑士的移动"(国际象棋中骑士的相同移动)相互攻击时,就成功了。

有趣的是,令研究团队惊讶的是,在某一时刻,尽管两个不同的运行达到了收到完全相同自动奖励的棋盘状态(奖励系统认为它们一样好),批评者不同意。
而且它是对的。
在一个棋盘上,一个骑士被放置在错误的位置,使其最终获胜的可能性降低;在另一个棋盘上,骑士被正确放置。
尽管可验证的证据表明两种状态质量相同,批评者发现了一个关键但微妙的区别。
因此,它给更强的棋盘分配了更高的价值,表明它已经学会判断的不仅仅是迄今获得的奖励,而是当前状态对于最终获胜的前景如何。

这是批评者可以提供有效的、细致的不可验证奖励的有力证据,这是我个人一生中只见过几次的事情。
但惊喜并没有就此停止。
此外,他们还提供了相当有力的证据,表明你可以使用行动者作为批评者,这意味着生成响应的同一个AI也可以判断它们。
在验证与生成一样难的假设下,这不应该有效,但这正是他们所展示的:验证一个响应是否好比生成候选响应更简单。因此,你可以使用同一个模型。
这可能不太直观,所以这样想:找到一个有效的数独解是困难的;检查一个已完成的数独是否有效是容易的。所以如果一个人可以生成数独解,那个人绝对可以验证它的正确性。
这至关重要,因为这意味着你不需要一个超强大(因此昂贵)的批评者来判断较弱模型的响应,这将注定你总是必须训练超级聪明和昂贵的模型,只是为了将它们用作较差模型的验证者。
那么收获是什么?
7、我们留下了太多
如果从这个模型发布中有什么要记住的,那不仅仅是中国有一种经过验证的竞争方式(这在一段时间前已经基本得到确认),而是更简单:
那些认为"AI已经解决了"的人是错的,该行业继续发表新颖的研究来改进我们所拥有的。
我们在数学和编码等前沿模型领域取得的结果使人倾向于假设我们已经做到了。但真正的进步不是通过对已知事物的增量改进取得的,这是当今该行业的大部分内容;它是通过对未知事物的进步取得的。
也就是说,不仅要提高你的模型解决复杂数学问题的能力,还要展示有朝一日使其成为优秀作家的潜在方式。
我很难相信我们会有超人类的AI作家、诗人或律师,但有一件事是肯定的:如果我们到了那里,那不会是因为让AI更擅长数学。
然而,看起来我们不会很快得到那个模型。*"告诉我激励措施,我就会告诉你结果,"*正如Charlie Munger所说。事实是,没有多少强有力的激励来研究这些问题,因为像编码这样更容易变现的领域。
是的,像TEMPO这样的解决方案表明,付出足够的努力,可以在这些领域取得进步。
但市场想要那样吗?
因此,也许对即将选择职业道路的人最好的建议是与我们被告知的所有事情相反:
停止追逐流行的东西,选择一个你擅长的、无聊的、不性感的、不可验证的领域。
这很讽刺,但可能结果是你将在很长很长一段时间内被"AI颠覆"所忽视。
原文链接:The 'Critic' Returns to AI
汇智网翻译整理,请转载文章时标明出处