为什么AI实验室没有护城河

OpenAI和Anthropic是这一切的核心,还是它们只是谜题中另一个没有差异化和商品化的部分,很快就会过时?

为什么AI实验室没有护城河
AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo
Post cover image

两大顶级AI模型制造商Anthropic和OpenAI在私募市场上拥有大约一万亿美元的估值,比大多数国家的经济规模还要大,人们假设训练和向客户提供AI模型的能力就是该行业的护城河。即竞争优势。

但随着时间的推移,越来越清楚的是,大多数人需要重新思考他们对"价值可能在哪里积累"的直觉。

而最大的威胁可能不是中国——这是大多数人所假设的——而是工具链,这个经常被忽视的组件现在已经将我们的顶级AI从个位数分数提升到了世界上最难基准测试的近100%

OpenAI和Anthropic是这一切的核心,还是它们只是谜题中另一个没有差异化和商品化的部分,很快就会过时?

1、为什么我们大多以错误的方式评估AI

要理解工具链的作用以及它们为何对当今AI的进步如此关键——可能甚至比AI本身更重要——我们需要回到使某物"智能"的根源。

自古希腊时代以来,智力与知识有着非常强的相关性。被认为拥有大量知识是"智能"人的关键组成部分。

*但知识是智力的证明吗?*它是必需的,但本身并不能证明。而且重要的是,这是一个评估AI的糟糕心智模型。

让我解释一下。

2、为什么大多数基准测试是有缺陷的

对我来说,智力关乎结果之前的过程,因为结果可能被作弊。

正如让·皮亚杰曾经说过的:"智力是当你不知道该做什么时所使用的东西。"换句话说,它不是关于知道某事;它是关于当你不知道答案时弄清楚该做什么。这是直觉地选择导致正确结果的好计划和想法的过程。

然而,大多数人类智力基准,如大学考试,很少做出这种区分。相反,我们主要通过结果来衡量

你解决的任务越难,我就假设你拥有的"智力"越多。这可能有道理,但允许作弊。

如果我给一个博士生和一个记住了答案的青少年一个困难的数学问题,仅从结果来看,两者似乎同样聪明,尽管实际上只有一个人推理出了回答。

然而,今天的大多数考试不仅严格通过结果来评估,而且可以通过记住响应或过程来作弊;它们主要是关于解决你在学习期间见过的类似问题,而不是对你来说全新的东西。

它们很少测试真正的独创性。

虽然这对人类来说可能仍然有意义,因为人类拥有有损记忆和明确不完美的回忆,因此至少需要一定程度的推理能力才能参加考试,但这是评估AI的一种糟糕方式

因为与人类不同,AI确实拥有近乎完美的回忆能力,可以直接呕吐出响应。即使是AI可能不"在脑海中"的事实和知识,也可以通过一些提示来检索。

更糟糕的是,AI实验室滥用'pass@k'指标,给AI多次解决任务的机会,确保如果AI能回忆起答案,那么在它"涌现"之前只是重复的问题

不出所料,这类基准测试成为常态会激励实验室做两件事:

  1. 忽视真正的推理,而是优化记忆
  2. "把所有东西都放入分布中。" 为确保AI模型在某个时刻见过该响应,我们向它们输入有史以来全部的书面历史,并投资数十亿美元创建新的数据来摄取。如果有人写过它,AI可能就见过它。

尽管现代AI确实具有真正的独创性(例如,几小时前,一位Anthropic员工展示了Fable如何在三维空间中提出了雅可比猜想的明确反例),但让模型记住一切的诱惑是模型变得越来越大的核心原因之一:允许它们存储更多信息而不损坏它们已经知道的内容

这就是为什么ARC-AGI——我今天提到的基准测试——是世界上最难的AI基准测试,这使得今天的主角[schema]令人印象深刻。

3、抗记忆基准测试

ARC-AGI是一种以非传统方式测试模型的基准测试,因此是最具挑战性的之一,即使不是最难的。

作为参考,最高前沿分数是GPT-5.6 Sol,得分7%,基准测试成本为21,000美元。不仅模型在这些任务上运行成本高昂,而且分数也很糟糕。

而现在,一家公司声称已经将同样的模型GPT-5.6和Fable分别推到了95%和99%的分数,没有进行任何微调,只是将它们运行在改进的工具链上。

换句话说,仅仅将模型放入这个工具链的行为就将其从个位数提升到了基准饱和。

但这个'工具链'是如何让模型变得更好的呢?工具链到底是什么?

大多数人不知道的是,你最近使用的AI产品不仅仅是一个AI;它们是以AI模型为核心但周围有各种额外组件的系统,这些组件正如我在通讯中解释的那样,不仅增强了AI的性能(主要是通过改进它们获得的上下文),还允许它们执行操作。

简而言之,工具链控制AI接收的上下文、它记住的内容、它如何回答以及它如何行动。

最强大的组件之一是编写和运行代码的能力,这使AI能够执行操作、确定性地执行数学运算等。例如,AI可以调用软件计算器来完成它自己可能无法完成的计算。

但这个名为*[schema]*的解决方案的特别之处在于,它使用代码来维护状态

但这到底是什么意思?

所有三个ARC-AGI基准测试都共享一个设计原则:它们旨在测试模型在无法事先记忆的情况下的表现

测试AI是否真正推理其响应,而不是从内存中检索它们。

因此,ARC-AGI问题被设计为对AI来说是独特的。这并没有阻止AI击败ARC-AGI基准测试一和二,但第三层增加了额外的复杂性:它缺乏明确的指令或目标。

正如网站上解释的:

"ARC-AGI-3是一个交互式推理基准测试,挑战AI代理探索新颖环境、即时获取目标、构建可适应的世界模型并持续学习。100%的分数意味着AI代理可以像人类一样高效地击败每个游戏。代理必须在每个环境中从经验中学习——感知重要内容、选择操作并适应其策略,而不依赖自然语言指令。"

测试看起来像下面这样,你也可以玩,像一个游戏,但没有明确的指令或目标

因此,AI必须测试环境,即时熟悉它,并通过首先弄清楚问题和约束是什么来解决未说明的问题。

对于在明确指令和目标上训练的模型来说,这很可能非常类似于地狱,不出所料,这对它们来说就是地狱。

因此,*[schema]*是如何将一个在这些问题上挣扎的模型变成一个能够解决它们的模型,而实际上并不改变模型的?

讽刺的是,使用了我们多年来用于代理的相同模式ReAct,但有所改变。

4、ReAct模式

ReAct模式是AI通过推理、行动、观察和重复来解决问题的模式。

AI推理它认为应该做什么,基于此采取行动,观察结果,然后重复,使用反馈来改进其推理行动链。然而,这并不新鲜(实际上已经好几年了),那么这次发生了什么变化?

关键区别在于,通常的方法是在上下文中记住所有内容,而这个解决方案建议维护一个清晰的发生模型。

标准的ReAct代理(标准模型在这些基准测试上的运行方式)将其理解存储在对话历史中。它的"信念"分散在许多观察、操作和推理片段中。每次它需要行动时,它都必须有效地重新阅读该历史并重建它当前的信念。

而[schema]代理则将这种分散的理解转化为一个单一的、明确的对象:一段描述它认为正在发生什么的代码。当新证据到来时,它更新代码。然后它可以运行该代码来预测接下来会发生什么。

优势类似于保留企业的每一张收据与维护最新账目之间的区别。收据包含所有信息,但账目将这些信息转化为企业可用的状态。是的,整个发票和收据历史本质上隐藏了你的业务状态,但实际使用会计来物质化该状态的行为揭示了更清晰的画面。

需要明确的是,这不仅仅是使模型的想法更清晰;它主要是强迫它解释"正在发生什么"和"我看到了什么"为有形的东西。这本身就提高了性能。

这就像你以为你理解了某件事,但一旦你把它说出来,就意识到你并没有真正理解;强迫自己描述某事的行为提高了对该事物的理解

而关键——我需要你从中得出的要点——是使这种行为成为可能的元素不是AI,而是工具链。正是这个谜题部分将AI的思维过程引导到能够解决它本来无法解决的问题的模式中。

为什么这如此重要? 嗯,因为它解释了我对顶级AI实验室估值的看空态度。

5、如果……AI模型不是护城河呢?

主要观点是,我们即将看到两家公司进行有史以来最大的首次公开募股,这两家公司亏损巨大,现在对其业务构成了非常可信的威胁。

工具链最终成为决定性性能因素的事实,并不是这些公司需要看到人们谈论的,因为工具链在很大程度上不受他们的控制。

原因是任何人都可以在AI之上构建工具链。更糟糕的是,讽刺的是,这些实验室提供的官方工具链通常被第三方工具链打败

有趣的是,AI实验室无法在自己的游戏中击败他人。

有多个例子,但Databricks最近的代理分析是一个突出的例子。

如下图所示,工具链的选择(例如Anthropic的Claude Code、名为Pi的第三方选项和OpenAI的Codex)不仅显著影响相同底层模型上的性能,而且可以显著提升较弱模型的性能。

最好的例子是GLM-5.2使用Pi工具链,击败了使用Anthropic自己的Claude Code的Opus 4.8。在这个基准测试中,使用GLM-5.2(中国模型)比使用Anthropic自己的产品更好。更糟糕的是,Anthropic的模型在第三方工具链上获得更好的分数。

前沿实验室工具链效率低下在下面的图表中更加明显,其中运行OpenAI和Anthropic模型的第三方工具链比在"官方"工具链中运行的相同模型少需要2到4倍的令牌。

这个结果可能令人惊讶,但这实际上是完全合理的;第三方工具链击败了模型实验室的工具链,因为后一组有着不一致的激励。

是的,他们想构建好的工具链,但他们也想尽可能多地从你身上赚钱。也就是说,他们希望他们的工具链推动模型消耗尽可能多的令牌,所以如果你在由创建模型的同一实验室构建的工具链上运行你的AI,你要支付更多费用,这是完全正常的。

这很讽刺,但前沿实验室受到激励向你提供次优的工具链产品。

这些不一致的激励(AI模型通过令牌赚钱;最好的工具链是以最低成本实现结果的工具链)让我非常清楚,工具链层不会由模型实验室拥有。

一个显著的例子是模型集成:在给定任务上运行多个模型,以便在需要时最小化使用更强(因此更贵)的模型,尽管这是一种经过验证的方法,但很少由实验室提供,OpenRouter的Fusion API就是例子。

为什么?因为它以明显更低的成本让你到达终点。如果没有,Cursor将SQLite从头开始重写的成本从Fable的20,000美元完全降低到了Opus 4.8和Composer组合的1,300美元。

人们必须意识到,实验室的命运完全取决于他们为你生成多少令牌以及这些令牌的价格。要收回每千兆瓦数据中心500亿美元的成本,令牌价格的每一次下降都是棺材上的一根额外钉子。

也许更令人担忧的是,我们似乎构建了某种东西(AI),而我们还不知道如何从中挤压性能,因为即使是"创造者"也被由一群斯坦福辍学者组成的第三方超越了。

这是一个有趣的发现,对他们来说也非常危险,因为他们可能很快发现自己在卖'扳手',而他们上游的初创公司在卖实际的水管工

卖扳手仍然可以赚钱,但大部分价值、大部分支付的钱都流向了水管工,水管工可能是真正的万亿美元产品。

我坚持认为,这对实验室在某种程度上设法灌输的当前主流叙事来说是极其危险的;尽管存在大量亏损,他们已经能够建立一种叙事,使他们在二级私募市场上达到万亿美元的估值,足以使他们跻身最有价值的15家公司之列,尽管不仅收入比其他公司少,而且严重亏损

当真相浮出水面——他们并不控制构建护城河的组件时,这些私募估值能在公开市场上维持吗?

先例并不特别令人充满希望。SpaceXAI曾经是一家将东西推入太空的公司,但现在也明确是一家AI公司(不仅仅是在名称上;其未来大部分收入与AI相关,而不是太空火箭)一个月前上市,尽管最初的高点使其成为最有价值的五大公司之一,但现在交易价格比发行价低11%,比历史最高点低46.6%

而且这是一家拥有非常有利可图且不断增长的非AI业务部门Starlink的公司,而OpenAI和Anthropic都没有。不过,它们目前确实有更高的预期收入。

但它们最大的担忧不应该是市场波动;而是人们可以合理怀疑经济价值将在哪里积累;流向模型实验室,还是流向它们上游或下游的公司?

这些实验室迫切需要公开市场流动性,但市场会愿意提供吗?

更糟糕的是,工具链的发现增加了其业务威胁的长长清单,即销售AI模型:

  1. 企业正在告别"令牌最大化",这种在一段时间内占主导地位的极其愚蠢的想法,认为生产力与令牌使用量成正比,现在已经长期被鄙视。
  2. 中国模型,已经完全商品化了非前沿市场,随着最新的模型Kimi K3和Qwen 3.8,直接挑战美国模型的最前沿。它们以更低的成本提供相似的性能(虽然不像某些人认为的那样明显低),对于不需要最佳可用模型的任务来说很难击败。他们不仅失去了对"产品"的控制,甚至他们销售的东西——模型——也在承受下行压力
  3. 企业微调,由Thinking Machines等实验室领导,他们认为企业AI的未来不是通用的、高价的模型,而是公司在其专有数据上训练开放模型。越来越多的证据日复一日地堆积,证实这很可能是一个非常可能的结果。更糟糕的是,前沿AI实验室的融资者(如微软)和客户(Palantir)都非常明确地表示这也是未来。我直说吧;没有人真的喜欢与封闭的AI实验室合作;他们只是暂时容忍它们。
  4. 客户成熟度。我深信OpenAI和Anthropic的大部分收入与"前沿默认"深度相关;选择前沿选项"仅仅因为",仅仅基于模糊和不成熟。客户越控制AI工程,他们就越不热衷于"最大化智能",而是最大化每成本的性能。

而目前可能最大的威胁是:Meta和SpaceXAI推动的下一场价格战,它们已经将价格相对于OpenAI和Anthropic的收费大幅降低。

为什么? 因为他们可以。Meta的AI业务可以比OpenAI更长时间保持资不抵债,Anthropic可以为其亏损提供资金。

SpaceXAI更依赖融资,但他们刚刚筹集了800亿美元,而且有埃隆·马斯克掌舵,对这个人来说,筹集现金永远不会是问题。

我们再次确认了AI中最大的问题之一:我们唯一确定的是我们确实不知道真正的钱会在哪里赚到。

在两家万亿美元IPO之前存在这些疑虑——这两家公司与我在100米短跑世界纪录上拥有的利润相同——基本上完全依赖于投资者不会开始产生这些疑虑的希望——我可以从我与机构投资者的个人讨论中告诉他们确实有这些疑虑——这,嗯,有点令人担忧。


原文链接: Here's Why AI Labs Have No Moat

汇智网翻译整理,转载请标明出处