上下文层:智能体AI仍不足之处

Box的Aaron Levie用稍微更实际的术语重复着同样的观点:AI没问题,但AI不了解你的公司,这就是每个部署在长期运行时崩溃的地方。

上下文层:智能体AI仍不足之处
AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo

在过去的十二个月里,我从一个异常直接的视角观察代理式AI的讨论。我在Fuel Ventures投资组合中看到近两百家公司的运作——其中许多正在构建、部署并试图在真实企业内实现代理的运营化。我参加投资会议,创始人在那里推介下一个自主工作流程。我阅读上市软件公司的财报电话会议,试图阐述他们的AI战略。我在自己的公司运行一个AI技术栈。从那个视角来看,一个模式现在已经不可否认。

在演示中看起来非凡的代理,一旦被指向真实公司内的真实工作,就会崩溃。这种差距——代理在受控环境中所做的与它们在运营企业内所做的之间的差距——是当前AI领域最重要的故事。不是因为技术不真实。它确实真实。而是因为我们不断遇到的限制不再是模型的限制。而是上下文的限制。

Tom Blomfield(Monzo联合创始人)最近很好地捕捉到了这一点。他描述部署代理的经验就像"用一群完全不了解你公司如何运作的天才取代90%的员工。完全混乱。什么都行不通"。这个形象很生动,但更有趣的是业内其他人的快速认同。

Y Combinator总裁Garry Tan回应称这是"真正的瓶颈"——用他的话说,模型已经足够聪明;缺失的是锁定在高级人员头脑中的公司特定上下文,而突破口在于谁能在公司层面破解知识提取。Marc Andreessen在过去大半年里一直在提出结构上类似的论点——企业AI的限制不再是模型能力,而是让能力在真实企业内真正发挥作用的集成、数据和上下文脚手架的缺失。Box的Aaron Levie用稍微更实际的术语重复着同样的观点:AI没问题,但AI不了解你的公司,这就是每个部署在长期运行时崩溃的地方。

当来自AI生态系统非常不同部分的四个独立声音在几周内汇聚到同一个诊断时,这通常是值得遵循的信号。问题不是智能。问题是上下文——而我们集体在解决它方面投入不足。

这篇文章试图阐明代理式AI今天真正不足之处、为什么不足,以及这告诉我们这个周期中下一层价值创造是什么。有趣的故事不是代理不起作用。而是它们尚未在生产中、以标题所暗示的规模发挥作用。原因是结构性的。解决它的公司将成为这个十年中最重要的公司之一。

1、演示到生产的差距

代理式AI类别,取决于你如何定义它,在两到四年之间。在此期间,它的公众形象几乎完全由演示定义。一个模型编写整个应用程序。一个AI代理预订旅行。一群代理运行一个虚假的营销部门。这些工件令人印象深刻,它们塑造了从投资者到运营者再到企业买家的期望。

但有一个重要的不对称性经常被忽视。演示旨在压缩复杂性。生产环境旨在暴露它。演示运行一次,在预定义的路径上,使用干净的输入和精选的工具集。生产系统运行数百万次,使用混乱的输入,有边缘情况、冲突的策略、部分数据和静默状态。演示销售梦想。生产必须交付它。

这不是新模式。每个主要技术周期都遵循大致相同的弧线:以壮观演示为特征的早期阶段,随后是更长、不那么光鲜的运营化征程。云花了近十年时间从"我们可以按需租用服务器"演变为运行现代经济的集成基础设施支柱。SaaS从部门工具发展到关键任务记录系统,经历了类似的梯度。移动设备也做了同样的事情。模式是一致的:能力得到展示,期望得以设定,实质性工作发生在长尾中——除了生活在其中的运营者,对其他人不可见。

代理式AI的不同之处在于差距的规模。能力上限比任何先前周期都高——这些系统能够推理、规划,并以前所未有的方式跨多步骤问题采取行动——但运营下限也相应降低,因为代理是有状态的、概率性的,并且在设计上是非确定性的。SaaS产品要么工作,要么不工作;其故障模式是二元的且可见的。代理可以工作,部分工作,或者产生自信、格式正确但实质上错误的输出——发现哪种情况发生的唯一可靠方法是在实时流程中部署它并观察。

结果是市场充斥着成功运行试点的组织,但只有少数将代理部署到类似实质性运营规模的程度。真正扩展的代理往往具有相似的特征:范围狭窄、低风险输出、易于理解的故障模式。一级支持查询。外发邮件起草。通话摘要。这仍然有用,但不是最终状态。共同点是任务表面小、工具集有限、错误答案的成本可恢复。这不是批评——这是对运营前沿当前所在位置的描述。代理在流程中上下文要求浅、可用工具明确定义、错误后果有限的区域可靠运行。移动任何这些变量——加深上下文、扩大工具集、提高风险——系统就开始退化。

有趣的问题不是这是否会改变。它会改变。有趣的问题是什么必须改变才能让它改变。

2、缺失的上下文层

如果你与任何真正在企业内部署代理的人交谈,你最终会听到同样的抱怨。模型没问题。工具没问题。基础设施没问题。缺失的是上下文。

这就是Blomfield、Tan、Levie和Andreessen各自指向的问题。想象雇佣一群优秀的毕业生,把他们投入你的公司,没有入职培训、没有文档、没有经理、没有Slack历史、不了解任何事情实际如何运作。他们会很渴望。他们也会有能力。他们也会在非常特定的方式上无用——他们会自信地做错误的事情,因为他们不知道正确的事情是什么。

这就是今天在大多数公司内部署现成代理的体验。代理可以阅读。代理可以行动。代理可以推理。但它没有感知到塑造决策实际如何制定的隐性知识——未写下的政策、历史背景、这个团队处理这类边缘情况的特定方式、由于没人费心记录而受到不同对待的客户细分。

企业逐渐意识到的是,模型是通才智能,而公司是专业环境。模型了解世界的很多方面。它对你的业务几乎一无所知——不是因为它训练不佳,而是因为它需要的信息从未被写在任何它能阅读的地方。微调,这个明显的技术反对意见,只能带你走一部分路。它可以教会模型业务的语言、格式和语气模式,但它无法让模型实时访问公司的运营状态——更深层次的问题是,大部分必要信息根本从未被写下来,这在微调、RAG或任何假设数据已经存在的其他技术上游。你无法在尚不存在的事物上训练模型。

这就是AI技术栈中缺失的层。基础模型提供原始能力。编排层管理流程和协调。应用程序打包工作流程。它们都没有解决上下文问题。它们都没有将组织混乱、分散、大部分是隐性的知识转化为模型可以消费的东西。

你可以在早期企业代理的故障模式中清楚地看到这种差距。代理检索错误的文档,因为它不知道策略的哪个版本是权威的。它升级低价值问题,因为它不知道这个特定客户属于特殊层级。它起草违反内部标准的合同条款,而该标准仅存在于一位高级合伙人的头脑中。这些都不是智能失败。它们是上下文失败。

值得注意的是,这不是模型问题。更好的模型本身无法解决它。一个更强大的代理被放置在上下文贫乏的环境中,如果有的话,是一个更差的代理——它更果断地基于错误信息行动。限制不是大脑。限制是大脑运行的世界。早期构建这一层的公司拥有持久的护城河。一旦组织拥有了其运营知识的结构化、机器可读表示——其策略、工作流程、边缘情况、决策权、历史先例——这种表示就变得差异化。模型是可交换的组件。上下文基底才是复合增长的地方。这是数据飞轮开始真正转动的地方。每个通过上下文基底运行的交互都会产生新的信号——修正的输出、捕获的边缘情况、揭示未写规则的覆盖。每一个都反馈到上下文层,锐化下一个决策并将更多工作流程拉入系统。模型层本身无法产生这个循环。基底可以,这就是护城河。

当你分解"上下文"在运营术语中实际意味着什么时,范围变得显而易见。它包括公司每个内部策略的权威版本。每个客户关系的历史。哪些决策需要哪些审批的层次结构。谁拥有什么以及谁被允许做什么的映射。边缘情况及其历史处理方式的目录。只有在这个特定业务中才有意义的概念之间的语义关系。这些都不是异国情调的信息。所有这些都是必要的。几乎没有在任何模型可以阅读的地方被捕获。

3、隐性知识问题

上下文层如此难以构建的原因是,公司的大部分知识在任何有意义的意义上都没有被写下来。这是管理文献中几十年来一直在强调的观点——Michael Polanyi称之为隐性知识,我们知道但无法完全表达的那种——但在代理时代有了新的力量。

企业的教科书观点是运营依靠记录的过程、捕获的策略、结构化的数据和标准化的剧本运行。现实是它们依靠启发式方法、走廊对话、积累的判断以及恰好在那里工作了很长时间的人做出的决定运行。任何曾经在大公司和小公司工作过的人都知道这一点。大部分机构智能存在于头脑中,而不是系统中。

这是一个问题,因为模型无法读取思想。它们可以阅读文档、记录、日志和模式,但它们无法推断经验丰富的操作者简单知道的事情。特定客户即将流失的直觉。超过一定规模的合同总是由法律审查的不成文规则,即使政策说否则。特定供应商的发票不可靠需要再次查看的理解。这些都不在模型可以找到的任何地方。

开始在代理方面取得真正进展的公司正在对此做特定的事情。他们将知识提取视为一阶工程学科——而不是文档练习。他们系统地采访操作者。他们从通话记录、支持工单和Slack频道中挖掘模式。他们将隐性转化为显性,然后将显性转化为足够结构化以至于模型可以对其采取行动的东西。

这比听起来更难。困难不在于写下来的行为——而在于知道你不知道什么。大多数组织不清楚哪些决策受正式政策管理,哪些受隐性判断管理,因为做出隐性决策的人通常没有意识到他们正在这样做。他们已经将启发式方法内化得如此之深,以至于他们不再将其视为选择。这在实践中意味着,构建可用的上下文层部分是组织内省的行为。你必须询问工作实际如何发生,而不是组织结构图说它如何发生。你必须在能够结构化部落知识之前将其呈现出来。你必须愿意发现官方流程和实际流程存在分歧——有时差异很大。

在过去的几年里,我在个人规模上尝试了这个版本——在Obsidian中构建我认为是结构化的第二大脑,捕捉我如何思考交易、我依赖的框架、我读过的书、我在投资组合中看到的模式、我在承保时使用的启发式方法。这个练习确实困难,不是因为工具困难。它困难是因为我实际上关于风险投资、AI或我工作的任何其他领域的大部分知识都存在于我的头脑中,作为直觉而不是明确的原则。提取它需要一种不自然产生的纪律——质疑我自己的决策,命名我没有意识到自己在使用的启发式方法,写下我本来只是会做的事情。如果这个练习在一个人的规模上如此困难,那么组织的规模就难一个数量级,财富500强的规模就更难了。

这是AI赋能中不光彩的部分。它不会产生干净的演示,也不会在第一季度产生可衡量的生产力提升。但它是其他一切的前提条件。将知识提取视为一阶工程学科的公司正在构建决定其代理是否最终能够长期自主执行真实工作的资产。

4、记忆、状态和连续性

代理式AI不断遇到的第二个结构性差距是记忆、状态和连续性。今天的代理大多是无状态的。它们启动。它们运行。它们完成。它们忘记。这是简化,但不多。典型的代理有一个上下文窗口、一个会话内存,也许还有一个小的最近交互持久存储。它在任何健壮意义上都没有的,是连续性。它不记得上周。它不知道昨天尝试了什么。它没有跨任务持续的身份感。每次交互都从接近零开始。

这对于我们目前部署的代理类型来说是可以的——狭窄的、短命的、单一用途的。对于我们不断被告知即将到来的代理类型来说就不行了:长时间运行的、多步骤的、嵌入实际运营的。这些代理需要记忆,而当前技术栈不原生支持,人们用来伪造它的变通方法开始吱嘎作响。

你可以在长时间运行的代理任务分解的方式中看到这一点。代理启动一个多日工作流程——研究市场、构建可交付成果、跨系统协调——在中间某个地方,状态丢失了。重试发生。交接失败。一个新会话以不完整的历史记录生成。代理最终做了重复工作,或者跳过关键步骤,或者产生不一致的输出,因为它无法记住它已经得出的结论。

这个问题部分是技术性的,部分是概念性的。技术上,我们还没有很好的原语用于持久、可查询的代理记忆。人们正在构建的基础设施——向量存储、图数据库、情景记忆系统——是真实有用的,但也处于早期且分散。概念上,我们还没有真正就代理记忆应该是什么样子达成一致。它是日志吗?图?摘要?学习到的表示?每个人仍在实验中。

记忆是一半问题。状态是另一半。即使代理能记住它曾经做过的所有事情,真实的业务流程也很少是单一动作——它们是多步骤序列,会暂停、分支、等待批准、中途失败并需要恢复。一张发票被生成,放在队列中,被拒绝,被修改,被重新批准,被记账。销售流程跨电子邮件、CRM、合同工具和计费系统运行,每一步都有交接和依赖。今天的代理不原生处理这种中等流程复杂性。编排层开始吸收其中一些,但底层原语——持久检查点、失败后干净恢复、保证同一步骤不会运行两次——仍在摸索中。

这是Andrej Karpathy在过去一年中反复强调的一点:代理尚未按炒作所暗示的方式工作的原因不是模型太弱——而是我们还没有弄清楚如何给它们持久的记忆、工作状态以及对上次所做事情的连贯感知。他将AI的下一阶段定义为根本性的系统问题,而不是模型问题。这正是正确的框架,它同样适用于代理前沿和堆栈中的任何其他内容。更大的图景是,业务不是靠任务运行的。它们依靠跨时间延伸的流程运行。

这个软件级别的记忆问题有一个硬件镜像。我今年早些时候在Coatue市场报告的分析中写道,内存复合体——美光、SK海力士、三星——在代理轮动中的份额比共识短缺叙事所认可的更多,因为代理上下文窗口和持久内存是RAM和HBM密集型的。随着软件栈开始大规模需求持久、可查询的代理记忆,底层硬件基底必须扩展以支持它。两个层跟踪相同的底层转换。代理需要记忆——而在硅片级别和系统级别大规模记忆是昂贵的。

5、可靠性和信任税

即使你解决了上下文和记忆,还有第三个结构性问题在另一边等着你。根据我的经验,这是将试点部署代理的公司与生产中部署代理的公司区分开来的问题。它是信任问题,与营销信任或公关无关——它与运营信任有关,这种信任决定了企业是否愿意让代理代其采取重要行动。

诚实的现实是,没有一家重要规模的企业会将其关键工作流程交给一个它不深入了解且无法深度控制的系统。这不是想象力的失败。这是严肃企业运作方式的基本特征。他们有审计员。他们有监管机构。他们有会起诉他们的客户。他们有董事会。在错误的工作流程中做错事情的成本通常是灾难性的,任何数量的模型改进本身都无法改变这种计算。

这就是为什么当代理式AI讨论离开演示阶段进入企业时,最终都会围绕评估、可观察性、治理、回退和人在回路中设计展开。这些话题很枯燥。它们也是系统是否部署与不部署之间的区别。大多数当前代理在这里没有连贯的答案。它们被评估时(如果被评估的话),使用与真实世界表现的混乱几乎无关的窄基准。它们在没有健壮的监控漂移方式的情况下部署。它们通过重新训练或重新提示来纠正,而不是通过结构化的反馈循环。

Air Canada提供了一个真实的案例研究,说明当这种基础设施缺失时会发生什么。客户询问航空公司的丧亲费用;聊天机器人编造了一个实际不存在的政策。当客户后来试图索赔时,Air Canada拒绝了,辩称聊天机器人实际上是一个独立的法律实体。小额索赔仲裁庭不同意,裁定公司对其AI所说的一切负责。判决在经济上很小——几百美元。但影响不小。观察此案的每个企业CIO都理解,这是他们的总法律顾问开始对管道中的每个AI部署提出不同问题的时刻。

在AI实验室内部,Air Canada暴露的差距越来越多地被直接点名。Dario Amodei对此最为坦率。他认为,能够执行任务的模型与企业实际信任其无人监督执行任务的模型之间的距离,在结构上比行业承认的要宽得多——缩小这不是预训练问题。它需要在可解释性、评估和围绕模型的操作工具方面进行深思熟虑的投资。

目前的运营假设是,几乎每个代理的正确部署姿态是协作的——而不是完全自主的——而达到自主是积累信任的函数,而不是原始能力的函数。正确表述其经济学的方式是作为可靠性税。今天,这种税是巨大的:要在真实企业内部署有意义的代理,你必须在验证表面上投入与代理本身一样多的资源。这个比例会随时间压缩——我之前写过的编排层吸收了一些成本——但它不会消失。信任不是你发布的功能。它是你构建的系统。

6、历史告诉我们前进的方向

每个先前的技术周期都经历了相同的模式。新的能力到来,抓住想象力,推动戏剧性基础设施建设的阶段,然后商品化。一旦能力商品化,价值就向上迁移——迁移到组织它、打包它并将其嵌入实际运营系统的层。捕获第一阶段的公司很少捕获第二阶段。捕获第二阶段的公司成为该周期的决定性企业。

这不是新观点。正如我之前所涵盖的,Carlota Perez几十年来一直在工业周期中提出类似的观点——她关于技术革命的著作精确地描述了这种价值迁移,一旦新能力商品化,从交付它的层迁移到组织它的层。AI周期的不寻常之处在于其展开的速度,以及价值正在迁入的特定层。

云的第一波浪潮是关于原始计算。在AWS推出后的大约十年里,问题是企业是否信任别人的服务器(云与本地)。一旦他们信任了,IaaS层就迅速商品化——Azure和GCP缩小了差距,价格下降,差异化向上移动。在云周期后半段复合价值的公司是那些在商品化计算之上构建的公司:Snowflake、Databricks、Datadog、MongoDB、Stripe。重要的不再是服务器。而是将商品化计算转化为运营现实的托管服务、数据基础设施和运营工具层。

SaaS遵循了相同的轨迹。第一波是关于用浏览器交付的替代品取代本地软件。到2010年代初,这个主张不再新颖——每个类别都有SaaS竞争者,横向应用程序变得越来越商品化。从2010年代中期开始突破的公司是垂直的:生命科学领域的Veeva、建筑领域的Procore、餐饮领域的Toast、贸易领域的ServiceTitan。它们通过深入细分、拥有领域上下文并嵌入横向SaaS永远无法完全触及的工作流程来捕获价值。垂直领域知识层变得比其上的SaaS层更有价值。

移动设备也类似地发展。第一波是关于操作系统——iOS与Android,谁将赢得平台。到2010年代初,平台已经确定,操作系统本身已成为商品化基础设施。捕获移动设备第二个十年价值的不是操作系统构建者;而是那些拥有操作系统给予他们访问权的层的公司:身份(Auth0、Okta)、位置(Mapbox,Uber底层的映射层)、支付(Stripe、Adyen)。平台变得更便宜、更统一。其上的层变得更有价值。

AI现在正在运行相同的弧线,而且速度要快得多。能力——大型语言模型——在大约三十个月内从研究奇观发展为企业必需品。前沿实验室正在进行一场越来越像2010年云厂商战争的比赛:少数资金雄厚的参与者,技术差异化缩小,结构性价格压缩在望。模型能力将继续复合,但其作为业务优势的差异化已经在侵蚀。位于其上的东西——上下文、记忆、编排和信任——是每个先前周期的层叠逻辑所说的下一个十年价值积累的地方。这就是本文其余部分一直在描述的上下文层。

这次有一个重要的细微差别。在先前的周期中,商品化层和其上的层大致垂直堆叠。在AI中,两个层同时向相反方向移动。模型层正在整合——朝着三到五个将捕获大多数基础模型经济学的前沿实验室。上下文层则向相反方向碎片化,跨越数千个垂直上下文基底,每个基底都有自己的运营现实结构化表示。模型和公司实际上正在脱钩。模型成为共享基础设施。上下文层成为区分一个业务与另一个业务的堆栈部分。我认为下一个十年最有趣的机会将位于这两个层之间的接缝处——足够接近模型以受益于其复合能力,又足够远离它以拥有将能力转化为竞争优势的上下文层。

你已经可以看到可见的候选者在这次脱钩的两侧定位。在横向方面,Databricks和Snowflake正在竞相拥有每个企业代理底层的数据层——Databricks通过Mosaic AI和Unity Catalog,Snowflake通过Cortex。Glean已经构建了碎片化SaaS工具与试图从中读取的代理之间的连接组织,将企业搜索转变为权限感知的知识图谱,成为每个内部代理运作的基础。在纵向方面,Sierra正在构建品牌特定、策略感知的客户体验层,让代理在其自身的运营现实中代表企业。Abridge在临床文档领域做同样的事情,Harvey在法律领域,Cresta在联络中心领域。这些都不是模型公司。它们都是上下文层公司——实时构建AI经济底层的层。


原文链接: The Context Layer: Where Agentic AI Still Falls Short

汇智网翻译整理,转载请标明出处。