AI威力的秘密:验证的不对称性

AI 擅长某些事情却奇怪地不擅长其他事情,背后隐藏着一个原因

AI威力的秘密:验证的不对称性
梯形图转SCL | 需求文本转SCL | 梯形图在线查看 | 博途编程文档MCP | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace

我是一名大四学生。当我卡在某些 LeetCode 问题上或者我的逻辑出错时,我会使用 AI。在那些时候,我会上传带有错误和 bug 的代码,让 AI 重写和调试它。这让我的工作更简单,更省时。然而,使用 AI 编程也有缺点。有时,当我上传一个困难的问题描述时,AI 会给出最优化的解决方案,而对于新开发者来说,理解代码变得更加困难。

1、锯齿状谜题

研究人员也面临着一个谜题。在总结 Andrej Karpathy 在 Sequoia 的 AI Ascent 2026 上的演讲时,同一个前沿模型能够重构一个包含约 10 万行代码的代码库,但仍然建议你去 50 米外的洗车店,即使你去那里是为了洗车。Karpathy 将这些系统称为"锯齿状实体"。

他的理由是,AI 在结果可以被验证的情况下自动化得最快,因为实验室使用强化学习环境来训练模型,这些环境奖励准确和可验证的输出。由于代码和数学很容易检查,它们得到了广泛的训练。相反,许多普通任务无法被验证,所以它们没有被训练。

2、这个想法从何而来

Jason Wei 将这种现象称为验证的不对称性。某些任务比解决它们更容易验证;例如,解决数独需要努力,但检查它只需要几秒钟,而整个网站需要工程师多年构建,而普通公众可以很容易地判断它是否有效。

与训练的联系是直接的:因为验证解决方案的能力与创建强化学习环境的能力相同,所以任务越容易检查,就越容易在它上面训练 AI。

反之亦然。事实核查一篇文章比写它需要更长的时间,而虽然一个新的饮食建议很容易,但测试它可能需要数年时间。由于这些任务需要很长时间来验证,它们也需要很长时间来训练。

3、机制:程序计算的奖励

这种方法被称为具有可验证奖励的强化学习(RLVR),这个名称来自 AI2 的 Tülu 3 论文;DeepSeek-R1 直接使用基于规则的奖励,省略了神经奖励模型,因为它可能容易受到奖励黑客攻击。奖励来自一个程序,该程序通过将数学答案与正确答案进行比较以及通过在一组测试用例上运行代码来验证正确性。

这是检查有多小:

def code_reward(candidate_src, tests):
    scope = {}
    try:
        exec(candidate_src, scope)
        solve = scope["solve"]
        passed = all(solve(*args) == expected for args, expected in tests)
        return 1.0 if passed else 0.0
    except Exception:
        return 0.0

def math_reward(model_answer, truth):
    return 1.0 if model_answer.strip() == str(truth) else 0.0

对三个候选解决方案(一个正确,一个逻辑错误,一个语法错误)运行,它打印:

code rewards: [1.0, 0.0, 0.0]

这个分数便宜、快速,且无法争议。(警告:运行模型编写的程序并使用 exec 是不安全的。实际上,真实管道使用沙箱。)

现在尝试编写一个函数来回答"这封邮件有说服力吗?"这个问题。你将无法做到,因为没有测试套件来测试品味。这就是问题的全部所在。

4、这预示着什么

  • 代码几乎是理想的,因为命令行代理接收退出代码和测试结果作为内置反馈,使它们能够读取错误,进行必要的更正,然后重试,而无需涉及人类。
  • 多步骤界面流程更困难。 正如 Firecrawl 分析所指出的,它们更难以正确验证,这与浏览器代理仍然不太可靠的情况一致。这是他们的解释,所以将其视为论点而不是测量。
  • 数据的缺失会破坏循环。 其中一项分析指出,翻译成前 50 种语言满足所有要求,而 Tlingit 因缺乏数据而不满足条件,这个单一的故障环节会破坏验证循环。

5、这个想法在哪里变得不可靠

一篇观点文章应该包含反驳论点:

  • 验证器可以被操纵。 建议定期对输出进行审计,以便模型不会利用奖励函数中的任何漏洞。
  • 直觉可能有点太简单。 评论 Wei 文章的人声称,最坏情况复杂性可能导致对 AI 的错误直觉,而且任务是否可以形式化可能比不对称性本身更重要。
  • 目前还不确定这种训练能提供什么样的优势。 研究人员尚未确定 RL 是否实际上使模型能够以超出基础模型能力的方式进行推理。

可验证性并非一成不变;Wei 指出,通过在任务开始时进行研究可以改善不对称性。

6、我会怎么做

  1. 在给 AI 任务之前,考虑你将如何验证结果。
  2. 首先编写检查——无论是基于测试还是预期输出——然后让 AI 进行迭代。
  3. 将没有验证手段的判断留给人类:基于品味、说服力和长期预测的决定。
AI 变得擅长编写代码的原因不是因为编程困难,而是因为代码可以被检查。

原文链接:AI isn't coming for the hard jobs first. It's coming for the checkable ones

汇智网翻译整理,转载请标明出处