基础模型的崛起

过去几篇文章中,我一直对大型语言模型大加批评。一些读者将此视为对LLM的宣战……但并非如此。

基础模型的崛起
AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo

在过去几篇文章中,我一直对大型语言模型大加批评。一些读者将此视为对LLM的宣战,但并非如此。实际上这是一种善意的提醒。我对这个东西的喜爱远超于此。最简单的原因在于,在GPT-3.5之前,我总是不得不向高管们解释什么是机器学习,他们除了"哦,哇,它能预测未来"之外,无法复述我说的任何内容,而在参与项目时,我们总是从举办灵感研讨会开始。

但现在我遇到了相反的问题。

我举办的是"去激励"研讨会。

在ChatGPT撰写我们的邮件和生成令人惊讶地可靠的代码之间,半数企业界得出结论:人工智能终于成为了哈利波特的魔杖。你所要做的就是在业务流程上挥舞它,用拉丁语咕哝一些类似"agenticus autonomicus resultans non-hallucinatus"的话,加入一些检索增强的任何东西,然后看着几十年的组织功能障碍在概率性烟雾的一声中消失。我的邓宁-克鲁格朋友们特别容易受到这种状况的影响。他们培养了一种非凡的能力:看到一个LLM,就能立即想象出一个有胆量在长周末内现代化SAP的有感知的数字员工。

但是现实,像它固执地倾向于做的那样,总是拒绝合作。

我们开始要求语言模型变成物理引擎或过程模拟器、合规官员,以及在一个特别乐观的周二,变成整个企业操作系统。

伙计,这就像你雇莎士比亚为你设计喷气发动机。他肯定会写出有史以来最美丽的维护手册,但我仍然不会登上那架飞机。

LLM是我职业生涯中这个行业产生的最非凡的工程成就之一,但我不确定它是推动了人类进步,还是仅仅给每个营销部门递上了一把火焰喷射器。但没有人会严肃地否认它改变了计算的轨迹。我认为历史会将ChatGPT的出现与网络的出现相提并论。

在它之前有一个世界,现在有一个不同的世界。

但有一个问题。我们开始滥用语言作为与现实的通用接口。

这个行业在语言上构建了第一个成功的主要神经网络,然后说服自己它已经构建了人工智能的最终形式。但它并没有,这种困惑正变得越来越昂贵。

前沿语言模型需要处理海量的文本。除了少数几个训练这些模型的实验室之外,没有人公布确切的数字,但如今规模最大的模型所依赖的清理语料库,在分词之前就已经达到了数十TB。这相当于人类痴迷于书写的所有学科中,数千万本书籍的总和。

当机器吞噬了如此庞大的文本量后,它会发生一些变化。

模型会构建一个它如何看待世界的内部图像,在模型的“脑海”中,一切都由语言构成。物理学、化学是语言,经济学、战争、爱情、悲伤,所有的一切,都是语言。甚至一个咖啡杯最终也会变成语言,被描述得细致入微,包括宽度、直径、曲率、把手形状和颜色,以至于其他人能够非常精确地想象出它的样子。

尽管我们创造了丰富的词汇,语言仍然无法代表现实。

拿起那个咖啡杯,慢慢地在手中转动它。现在,观察把手如何消失在陶瓷后面,以不同的角度重新出现,随着视角的变化而扭曲,每时每刻都在以不同的方式捕捉光线,在你转动它时,投射出的阴影也在表面上移动。

你觉得难以想象这一切吗?

那是因为这一切都不在语言的范畴之内。语言指向体验,但它永远无法成为体验本身,无论你用多少形容词来描述它。

大型语言模型,从某种意义上说,是柏拉图式的。柏拉图用一整篇关于洞穴的故事来讲述,在我们肮脏的物质世界背后,存在着一个完美理念的领域,他称之为“理念”(Eidos),在那里,每个物体的真实且永恒不变的版本都存在,不受任何污秽或腐朽的影响。他说,你坐过的每一把椅子都是完美椅子(Chair,首字母大写)的瑕疵复制品,你画过的每一个圆都是完美圆(Circle)的歪斜模仿。我们的世界喧嚣而肮脏,并且不断地分崩离析。

但形式的世界是纯净而永恒的。

这段描述你现在应该很熟悉了……

语言模型的内部世界完全由符号之间的统计关系构建而成,这些关系经过数百万个示例的平均值计算,直到每个概念都几乎连贯一致。我们所体验到的结果之所以令人信服,是因为它反映了人们最常说的话,并且趋向于大多数人已经认同的观点,而这种趋同感给人以安全感。

近乎完美,这是设计使然。

但并非现实,这是构建使然。

这个模型从未感受过重力将任何东西拉向地面,也从未亲眼目睹过陶瓷杯加速坠向水泥地,或者感受过瓷器在破碎前几毫秒内振动的传递。但它可以完美地描述所有这些事件,因为数百万人类早已先行描述了它们。

描述某事发生的原因和理解它发生的原因并非同一回事,而语言模型只执行前者。

这就是区别。

扔掉杯子。模型告诉你它可能会断裂,因为“drop”和“mug”、“fall”、“floor”、“break”和“shards”这些词在它的训练数据中频繁同时出现。这种关联近乎完美。然而,其背后的因果机制却完全超出了模型的认知范围。模型中没有任何内容能够模拟力矢量、应力传播或断裂力学的运作方式。它仅仅预测下一个符号,而且预测得非常准确(误差在几个百分点之内)。

扩散模型——我用来为这个博客创作漫画的模型——也无法解决这些问题。它已经大规模地记忆了视觉规律,并学习到“mug”这个词几乎可以在无限的光照和拍摄角度范围内出现,然后又学习到旋转如何改变图像的外观,因为它已经观察过数十亿个特定旋转的例子。当你要求它提供另一张图片时,它会立即满足你的要求。但如果你想模拟这个杯子在不同的引力常数下撞击地面时的结构变化,那么它看起来就和我们喝了两杯苦艾酒,又接受了一次量子计算机工作原理的突击测验后的样子非常相似了。

再说一遍,这一切都无可厚非。

这完全是领域特定性的问题,简单明了。语言模型之所以擅长模拟语言,是因为它只做过这件事,而人类恰好将海量的知识积累都融入了语言之中。这正是该模型看起来近乎全知全能的原因。

嗯,几乎如此。

当问题依赖于语言仅仅描述而非其真实本质的事物时,漏洞就出现了。当你要求它预测杯子在12牛顿、45度角的力作用下会发生什么时,语言模型就会失效。直接撞到天花板。在这种情况下,你需要的是一个基于物理本身训练的模型,而不是由目睹物理现象的人撰写的物理描述。正是这细微的差别,改变了后续的一切。

在人工智能领域,并没有规定训练数据必须是文字。你可以用天气系统、蛋白质序列、生产运营的遥测数据,甚至是企业自身的运营脉搏来训练模型。唯一真正的要求是,你拥有一个足够大的领域,并且其中包含重复出现的模式,以便模型能够从中提取有意义的信息。

Transformer 模型虽然名声在外,但它只是众多从数据中提取结构的方法之一。自注意力机制会将序列中的每个词元与其他所有词元进行比较,通过这种方式,它逐步学习哪些关系是重要的,然后将这些发现逐层堆叠成越来越抽象的表示。现在,当你把词元替换成其他东西,或者把Transformer本身替换成更适合图、状态空间或其他架构的东西时,你会发现其基本思想依然完好无损。语言会消失,整个Transformer也可能消失,但基础模型不会。

没错,剥离Transformer、注意力头、分词器、词嵌入、价值数十亿美元的GPU集群以及炫目的演示……剩下的,除了Anthropologie和OpenAI之外的其他机构,几十年来一直在构建的东西,其实是基础神经网络。

没错,一个基础神经网络。

我们已经非常擅长发明越来越复杂的方式来表达这一点。

而这才是问题的关键。我怀疑我们正接近这样一个临界点:语言不再是优势,反而成了瓶颈。而生物学早在企业人工智能之前就达到了这个阶段。

与一个经久不衰的误解相反,谷歌DeepMind的AlphaFold并非从失败的语言模型残骸中爬出来。蛋白质就像句子一样,是由氨基酸组成的长链。这意味着他们实际上可以借鉴语言模型的思路来学习蛋白质序列中的有用模式。

然而,他们遇到了瓶颈。

生物学远不止是一系列单词。

他们面临的问题是预测这条长链如何扭曲、弯曲,最终形成稳定的三维形状。这种形状决定了蛋白质是否具有功能。

因此,他们专门开发了AlphaFold 2来解决这个问题。

给定这条完整的蛋白质链,自然界最有可能产生什么样的三维形状?

为了回答这个问题,AlphaFold 2结合了三种方法。它将蛋白质与进化过程中发现的数百万种类似蛋白质进行比较。它还学习了蛋白质链的哪些部分在三维空间中保持在一起。然后它会不断调整预测结果,直到找到物理上最稳定的形状——能量最低的形状。

我想说的是,AlphaFold并没有把蛋白质当作语言来对待,而是把它们当作遵循化学和物理定律的物体来对待。这一成果让德米斯·哈萨比斯和约翰·詹珀获得了2024年诺贝尔化学奖的一半,而大卫·贝克则凭借设计出前所未有的蛋白质这一互补技巧获得了另一半。顺便一提,人工智能并没有因此获得任何认可。

简而言之,语言在这里并没有失效,而是生物学需要更丰富的表征方式,而语言本身无法胜任。现在,谷歌似乎已经吸取了这一教训,并将其转化为一个基础模型工厂。他们同时在六个互不相关的领域推出基础模型,用于时间序列预测(TimeFM)、可穿戴传感器数据(SensorFM)、表格企业数据(TabFM)、天气预报(WeatherNext)以及其他一些领域。更酷的是,每个模型都使用完全不同的“母语”,而这些“母语”都不是语言。

企业运营也不例外,因为在ERP系统、事件日志、工作流图以及满载治理规则的文档中,还隐藏着另一个领域,它拥有自身的语法和重复结构,甚至可能还有自己的基础模型等待构建。

这个模型目前还不存在。

但我还是决定构建一个,稍后再详细讨论。

1、智能取决于你喂给它什么

人工智能革命所做的最奇怪的事情之一是让聪明人相信智能以某种方式存在于模型本身之中。在ChatGPT撰写我们的邮件、解释量子力学和幻觉整个报告(嗨,PWC!)之间,我们都忘记了问所有问题中最明显的一个。

我们到底喂给了这个该死的东西什么?

这个问题比你意识到的要重要得多,因为智能不是在连接足够多的英伟达GPU之后从模型中渗出的某种神奇药水。神经网络,无论多么复杂,开始时不过是一堆昂贵的随机数字,当你把它放在那里时,它大概和我的洗碗机拥有相同数量的智能。

模型最终变成的一切,都取决于你让它接触的世界。

想象一下,你在有史以来最不道德的实验中抚养一个男孩。我们把这个可怜的家伙一出生就锁在一个巨大的图书馆里。里面有数百万本书,就像有史以来写过的每一本书,哦,还有整个互联网的内容,包括Reddit上那些莫名其妙地将自信误认为证据的人之间的讨论,以及唐纳德·特朗普的所有推文。好吧,那个男孩会花二十年不间断地阅读,因为他没有更好的事情可做。当你二十年后终于打开门时,那个男孩可能比你当地的物理学家更了解热力学,比本科生更了解分子生物学,他可能能解释为什么瓷器在压力下会破裂,或者咖啡豆是如何烘焙的,以及为什么重力会导致物体向地球加速。

但然后你递给他一个咖啡杯。

不是杯子的书,而是真实的一个。

让他闭上眼睛,在手指间旋转它,告诉你当把手慢慢消失在杯子后面时是什么感觉。问他如果用勺子敲击陶瓷会发出怎样的共鸣,或者当外面形成冷凝水后它变得多么滑,或者当他不小心让它从手中滑落时会怎样。

那一刻,所有这些书都毫无意义,因为描述不是体验。

语言指向现实,但它永远不会变成现实。

这个观察实际上比乍看之下要深刻得多,因为大型语言模型也存在同样的局限性。它吸收了难以想象的海量人类文字,几乎涵盖了人类曾经认为值得记录的所有其他主题,并从这惊人的文本量中构建了一个极其丰富的内部表征,来描述我们的书面世界。

请注意最后三个字。

我们的书面世界。而非物理世界。这种区别或许显得有些吹毛求疵,但我认为这是我们可以就人工智能提出的最重要的问题之一。如果一个模型所经历的一切都由人类书写的描述构成,那么它究竟是学习了世界本身,还是仅仅学习了我们对世界的集体描述?

这显然不是一回事。

事实上,认知科学几十年来一直在努力解答这个问题。具身认知理论认为,智能并非仅仅是对抽象符号的操纵,而是源于与物理世界的持续互动。

我们学习是因为我们行动、触摸、嗅闻、操作物体,并体验自身行为的后果。我们的概念根植于感知和行动,而不仅仅是语言。

而语言模型,无论多么庞大,都从未做过这些事。

它从未触摸过咖啡杯,也从未感受过杯柄在指间旋转时重量的变化。语言模型只知道数百万人类描述过这些事件。这就引出了一个问题:我们是否真的认为这就是智能?能够用符号捕捉事件,然后以统计的方式回忆它们?

或者,智能其实略有不同?

我认为,我们从语言模型中观察到的是,它拥有模拟人类语言统计结构的非凡能力,但它对现实本身却一无所知。然而,大型科技公司却将语言能力包装成智能的通用指标。

尽管萨姆·奥特曼(Sam Altman)的言论仿佛我们已经进入了“奇点”(法语发音,不知道为什么,试试就知道了),仿佛我们已经迈向了通用人工智能的阶段,但科学界对此远没有他们那么笃定。研究人员仍在争论智能是否能够纯粹从符号表征中涌现,还是需要具身认知,以及因果关系是否必须通过互动来学习。目前还没有共识。但值得注意的是,一些人工智能领域最具影响力的研究人员,包括杨乐存(Yann LeCun)、李飞飞(Fei-Fei Li),以及在某种程度上更为细致的德米斯·哈萨比斯(Demis Hassabis),都曾多次表示,单靠语言不太可能让我们最终达到目标,进一步扩展规模是一条死路。

就我个人而言,我认为我们无意中触及了一个比“GPT有多智能?”更为宏大的问题。

我认为真正的问题是:

一个只学习过一种现实表征的系统,能否发展出通用智能?或者我们只是打造了世界上最强大的语言专家?

因为如果答案是后者,那么语言从来都不是最终目的,它只是第一个包含足够数据以产生另一个基础模型的领域。

2、基础模型的意外发现

亚历山大·弗莱明在去度假前没有清洗实验室的培养皿时,并不是试图革新医学。他忘记打扫,然后某种霉菌的孢子从一扇打开的窗户飘了进来。长话短说,这就是我们最终得到青霉素的方式,它诞生于糟糕的家务管理,而不是什么宏大的假设。

微波炉的存在是因为一位工程师站在一台正在运行的雷达旁边太近,口袋里的巧克力棒融化了,他有常识去问为什么会发生这种情况。而互联网是为了帮助60年代的计算机网络在核战争中幸存而建造的,现在主要在争论哪种巧克力棒融化最快。GPS是为了引导导弹命中目标而建造的,而不是为了给UPS司机重新规划路线避开交通堵塞。 Viagra最初是一种心脏病药物,显然产生了一种副作用,直到试验志愿者自己报告之前,没有人知道。

是的,我们人类有一种奇怪的一致天赋:在完全寻找其他东西的时候发现革命性的东西。人工智能现在也加入了这一传统,正式地,没有太多仪式。

当你在2018年左右走进OpenAI,问一个研究人员他们在构建什么时,他们中没有人会说他们即将发现学习任意领域表示的通用配方。这些人着手构建一个更好的语言模型。

他们实际发现的,或多或少是偶然的,是当你让一个足够大的神经网络接触到一个领域足够多的例子,并强迫它不断预测缺失的部分,而不是每次都给它一个手工标注的答案时,一些奇怪的事情开始在它内部发生。起初,网络记住了无数的例子,就像我当学生时在考试前一晚死记硬背事实。但最终,这个策略对我停止了作用,因为有太多密集的东西需要记住。

我记得在中学时 exactly 达到了那个点。记住无尽的事实列表令人筋疲力尽,坦率地说,是一个糟糕的长期策略。所以我转向了物理和化学。第一年它们更难,因为我实际上必须理解发生了什么,但一旦那些基本原理到位,其他一切都变得更容易了。每个新概念都可以建立在旧概念之上,而不是作为又一个孤立的事实存储。

这与模型内部发生的事情非常相似。网络逐渐学习了首先生成这些示例的底层模式,而不是试图记住数百万个单独的示例。它停止记忆,转向学习它们背后的规则。换句话说,它将整个领域的结构压缩到数学中。

这个区别值得停留片刻,因为我认为它是整个领域中最被误解的概念之一。

基础模型之所以有趣,不是因为它存储了大量的信息。你知道,NAS可以做到这一点,维基百科也可以,搜索引擎也可以。这些东西都不理解它们所持有的一个词。但模型发现了首先生成数据的隐藏结构。语言承载着语法和层次结构,有节奏和语境,层层叠加在规则、这些规则的例外情况以及例外情况的例外之上,老实说,荷兰语特别承载着一种几乎是意识形态的承诺,让任何不是以它为母语的人的生活变得困难。

模型通过猜测接下来会发生什么来揭示这个结构,并且每次猜错时都会被推回正轨。从中,结构完全自行浮现,因为底层数据已经包含了该结构,而模型每次发现更多结构时都会获得奖励。

顺便说一句,这些观察与语言本身关系不大,无论营销暗示什么。语言恰好是我们这个物种已经积累了足够多的原始例子来大规模运行这个技巧的第一个领域。

这个配方中没有任何东西实际上需要文字。

对于语言,是的,它需要。

但将文字换成氨基酸,同样的技巧可以预测蛋白质如何折叠成其最低能量形状。将语言本身换成几乎任何具有足够丰富结构以包含值得学习的重复模式的领域,这个配方的工作效果和以前一样好,只有领域改变了,但数学始终停留在原来的位置。

这比任何单一聊天机器人的发布都更重要,是真正值得命名的发明。

不是语言模型。

而是它之下的基础模型——语言作为第一个测试用例,而不是大家误以为的天花板。

3、企业只是另一个领域

企业软件一直让我感到有趣的一件事是,我们坚持将公司视为以某种方式在自然法则之外运作。我们欣然接受我们的星球遵守重力,或者河流在数千年中在景观中雕刻出非常可预测的路径,但当有人说组织也表现出重复模式和隐藏结构时,原本明智的人突然变得非常哲学化。

"不,"他们坚持说,通常站在一张包含足够多彩色字体来吓到LGBT游行的PowerPoint幻灯片前。

"企业是不同的。涉及人员。"

是的,对,就好像化学每次采购部的卡伦加入指导委员会时就会休假一样。

当然涉及人员。然而,这些都没有仅仅因为人类参与其中就变得无法分析。恰恰相反。怪异的人类行为创造了更丰富的结构,因为人们有一种惊人的重复倾向。我们发明具有重复审批链和治理结构的组织仪式,然后花几十年假装每一个都是企业创造力的独特杰作。

当我们描述企业时,我们通常谈论人员和部门,以及应用程序和策略,然后是业务流程。这个描述在技术上是正确的。是的,就像将人类描述为"大约百分之七十是水"在技术上是正确的。它没错,但只是没有解释任何特别有趣的事情。

现在,从机器的角度来看,企业看起来不像组织架构图或PowerPoint幻灯片的集合。对机器来说,它是一个巨大的动态系统,处于持续运动中。每一张被传递的发票都是一个事件,审批不过是状态转换(状态:发票未支付 → 状态:发票已支付)。然后,采购订单是轨迹上的点,每个员工交互在巨大图中形成另一个连接,还有策略试图弯曲这些轨迹而没有人反对(那么多)。

企业通过数百万个微小的状态变化持续演变,这些变化共同定义了组织的实际行为方式。

大多数组织从未这样体验过自己,因为我们人类不会将公司感知为状态转换的流。我们体验的是冗长的会议、可怕的截止日期,以及更多来自卡伦的邮件,询问我们今年第四次是否完成了强制性的出口合规意识培训。

但企业体验的是完全不同的东西。...它体验的是流动

每次客户下订单时,库存就会改变,然后计划员做出反应,制造调整其时间表,财务更新预测,财务部重新分配现金,税务部门又收到一个头痛,而某处线上的某个人批准了他们可能不应该批准的东西,因为当时是周五下午五点,所有相关者只想回家。

我已经完全忘记了我试图表达的观点,但你知道我的意思,那种流动

当你近距离观看时,这些事件感觉混乱且几乎随机,但当你退后足够远时,一些相当显著的东西开始浮现。你注意到某些审批几乎总是先于特定的延迟出现,某些组织结构持续产生瓶颈,特定类型的策略变更会在数十个看似不相关的业务流程中产生涟漪,一些管理者是不可见的枢纽,通过它们流动着荒谬比例的重要决策。你可以随便称之为官僚主义。但数学对 corporate 术语完全无动于衷。它只注意到相同的结构不断重新出现。

这正是流程挖掘十多年来一直在展示的。这是一项真正强大的技术,当你向算法输入足够的事件日志时,咨询公司在BPR项目期间展示的优雅流程图突然变异成看起来很像威尔·史密斯在2022年2月吃一盘意大利面的东西。

然而,有趣的不是意大利面本身,而是这个意大利面是可重现的。

因为当你下个月运行完全相同的分析时,你会看到相同的循环出现,瓶颈回归。相同的绕道蜿蜒穿过组织,就好像它们已经成为公司DNA的一部分。仅这一观察就告诉我一个组织具有结构。隐藏的结构,毫无疑问。但仍然是结构。

每当存在结构化的活动流时,就有东西可以学习。

4、协调可以被学习吗?

在过去的八个月中,在盯着比我愿意承认的更多的流程挖掘图表之后,花了大量不健康的时间思考为什么企业AI从未完全兑现其承诺,我问了自己一个困难的问题。

协调本身可以被学习吗?

乍一看,这听起来像是那些模糊的研究问题之一,学术界发明它们是为了让我们花三年时间喝咖啡讨论它,而从未就定义达成一致(比如AGI)。但当我越多地观察企业数据,我就越确信这个问题不是哲学性的,而是具有深刻的实践性质。

想想一个大型组织内部实际发生了什么。

采购订单是一个人与另一个人协调。审批是关于谁可以下一步行动的决定。发票经过数十个系统和部门,最终消失在某人的季度报告中。策略试图影响未来行为,通过保持数千个独立决策大致指向同一方向。而沿着这条思路,每次升级都只是协调在第一次失败后的恢复。

现在,当你剥去SAP屏幕、组织架构图和关于事情应该如何运作的无尽PowerPoint幻灯片集合时,你会开始注意到企业是一台协调机器。

不多也不少。

这个观察完全改变了我看待企业AI的方式。

多年来,我们将企业主要视为文档集合。我们索引策略、检索程序、搜索知识库、向量化手册,并构建越来越复杂的检索增强生成系统,这些系统擅长告诉我们组织曾经决定的内容。这些系统确实有用,但它们从根本上是在描述企业,而不是建模其行为。

这是因为行为完全存在于其他地方。

它存在于执行中。

每天有数百万个决策在组织中产生涟漪。工作从一个部门传递到另一个部门,然后出现异常,资源变得不可用,优先级发生变化,新的法规试图在数百个互连流程中改变行为,而没有人完全理解下游后果。

从近处看,所有这些都是混乱的,但当你退后时,模式开始出现,而这些模式的存在都不是因为有人设计了它们,它们只是出现了。

这现在应该听起来很熟悉了。

语言包含重复的结构,蛋白质包含重复的结构,等等。整个科学学科的存在是因为现实以数学可以捕捉的方式不断重复自己。为什么企业会有所不同?

我认为不是。

我们所谓的"企业复杂性"只是我们从未试图直接学习的底层协调语法的可见表达。

我知道这种语法存在。对我来说,流程挖掘图表不再只是可视化,事件日志不只是运营废弃物,ERP交易只是会计记录。事实上,它们是对底层动态系统的观察,我们只部分理解其规则。

当我开始通过这个镜头看待企业数据时,另一个问题立即呈现出来。

如果语言包含足够的统计规律性来证明基础模型的合理性……那么为什么企业协调不应该?如果协调拥有自己的统计规律性、自己的潜在表示和自己的隐藏几何结构,那么我们一直以来都在问错误的问题。

我认为大科技公司试图做的事情——膨胀模型使其更聪明,并在语言模型上附加越来越复杂的组件来修复其固有缺陷,因为我们试图让它做一些从未打算做的事情——只是错误的方向。目标从来不是构建一个碰巧在企业内部工作的更好的聊天机器人。真正的目标是我们需要构建一个学习企业本身的模型,不是通过其语言——文档——而是通过其自身的行为:协调。

当协调被证明有语法时,它就可以被学习,然后它值得拥有自己的基础模型。这种可能性在过去一年半里占据了我不健康的大量业余时间。

它甚至有了一个名字。

协调基础模型。

5、协调基础模型

我亲爱的朋友。因为你读到了这里,你是真正想了解事物发展方向的百分之一中的百分之一,现在你可能已经猜到这篇博客一直指向哪里了。

误解协调基础模型最简单的方式是将其视为另一个企业聊天机器人,附加了RAG和一些四处嗡嗡作响的代理。它也不是另一个在侧面附加了LLM的工作流引擎,也不是另一个在帮助你犯明天的错误之前检索昨天策略的LLM-Wiki系统。这些技术都有其位置,它们解决了真正有用的问题,但它们都始于理解企业从理解其文档开始的假设。

协调基础模型始于行为。

这个模型学习控制工作如何实际流经组织的隐藏结构。今天大多数企业软件推理组织声称他们做什么。协调基础模型学习组织实际做什么。这两者很少相同。

每天,你的公司都在没有注意到的情况下产生惊人的行为证据,成千上万的人不断相互协调,从未想过自己是一个巨大动态系统的参与者。

然而,这恰恰就是他们。

当你单独考虑这些事件时,它们看起来几乎毫无意义,但它们一起揭示了企业的行为指纹。

也许一个类比可以使这更容易可视化。


原文链接: The rise of the foundation model

汇智网翻译整理,转载请标明出处