LLM 实时数据层
几年前,ChatGPT 闯入我们的生活,将 LLM 带给了全球数百万用户。从那时起,AI 进步的故事主要围绕着参数数量不断增长的更先进模型。实际上,所有 LLM 都有相同的局限性:它们是预训练模型,但从它们发布到世界的那一刻起,它们运作的现实就在不断变化。
1、冻结快照问题
我们可以使用图表来查看模型的知识如何演变。它简单地讲述了这个故事:知识在训练期间增长,然后,一旦模型发布,它就趋于平稳并保持不变。这意味着预训练模型是一个快照。训练数据在训练的最后一天冻结到权重中。
但是,当然,世界不会在模型发布时停止。新产品进入市场。这些产品改变价格。新法律通过。新闻事件每天都在发生。LLM 根本不知道这些,这导致了各种问题。
2、当人类在回路中时
这是当一个人在提问时的样子。Steve 想向 LLM 询问最新的可用手机。现在,我们都知道其中一些新手机还没有上市。但在某些情况下,LLM 可能仍然会编造一个听起来非常令人信服的答案。也许是这样的:"这款手机是手机市场的巨大进步。它是第一款可折叠手机,电池续航 10 天,没有连接器——通过 Wi-Fi 充电。"
大多数用户会明白这不是真的,模型正在产生幻觉。事实上,几乎每个使用过聊天机器人的人都熟悉这些自信但错误的答案。
3、为什么模型编造了它
那么,为什么 LLM 会产生幻觉?嗯,例如,作为训练的一部分,模型可能阅读了一些想象未来手机可能是什么样子的博客文章,并用它们来创建了这个答案。仔细想想,这并不是与模型智能相关的真正错误。这是知识缺失的结果。LLM 被问及一个新的、动态的世界,但它不知道,并试图根据其训练的历史数据来回答。
好消息是,人类通常会意识到错误并忽略它。没有造成伤害。
4、当回路中没有人类时
对于像 Steve 这样的人类,错误就到此为止。但 AI 智能体,那就是另一个故事了。因为与 Steve 不同,AI 智能体没有人类在每个答案被采取行动之前阅读它。
所以,让我们想象一个 AI 智能体和一个 LLM。例如,这可能是一个为电子公司建议采购决策的 AI 智能体。假设由于某种原因,AI 智能体向 LLM 提出了同样的问题并得到了同样的答案。现在会发生什么?
AI 智能体的反应方式与人类不同。人类有羞耻感等情感,他们不想让人失望。他们有直觉——当事情看起来奇怪时,他们会放慢速度或停止。但 AI 智能体不是人类。AI 智能体可以自信地失败,大规模地,非常快。例如,这个 AI 智能体可能认为答案完全有效,并建议开始购买组件。在许多情况下,这可能是一个非常昂贵的错误。
5、当智能体与其他智能体对话时
一个糟糕的决定很少被遏制。当多个智能体一起工作时,情况会变得更糟。假设这是 AI 智能体二号和 AI 智能体三号。例如,这可能是一个营销智能体,这可能是一个财务智能体。第一个智能体可能推理不正确,正如我们所看到的,并将其决策传递给其他智能体。他们反过来会犯自己的错误。这一切发生得非常快,而且通常不容易找到根本原因。
6、真正的瓶颈不是智能
我们在生产 AI 系统中看到的最大失败不是关于智能。它们是关于糟糕的数据,以及基于错误、过时或完全是编造的信息行事的系统。我们称之为垃圾进、垃圾出,简称 GIGO。
我相信,对于真实用户来说,功能上最有影响力的下一步飞跃不是使用参数最多的最新 AI 大脑。而是通过让 AI 访问来自网络的实时上下文层——一个强大的知识层——将模型连接到现实世界。这最大化了用户实际获得有效、有用响应的机会。
7、LLM 如何使用知识层
让我们谈谈 LLM 如何使用知识层。知识层必须向 LLM 提供网络数据——即来自互联网的数据。并且这些数据需要是新鲜的、可靠的和详细的。这提供了模型在其训练数据之上使用的数据,这是一个重要的实时上下文增强。然后,在推理时,这被用来为用户生成答案。
从技术上讲,知识层可以访问互联网以尝试抓取数据。但这通常不可靠。网站可能显示验证码或完全阻止访问。这是一个大失败。这是因为许多网站使用反机器人技术,通常会阻止 AI 智能体访问。即使网站确实允许访问,互联网实际上也是为人类构建和设计的——使用鼠标和眼睛来查看创意页面设计。所以它本质上是混乱的。网站不一致。更糟糕的是,网络使用 HTML,它既繁重又复杂。这使得 LLM 很难理解。
8、进入网络数据基础设施层
为了获得对公共网络数据的可靠、不间断访问,知识层需要从专业工具获取信息。这就是网络数据基础设施层发挥作用的地方。网络数据基础设施层向知识层提供大量新鲜可靠的数据,这些数据是从网络实时抓取的,然后为 LLM 最优地结构化。
知识层中的数据通常不会存储很长时间。对于许多问题,AI 向网络基础设施层请求来自互联网的新鲜上下文切片。网络数据基础设施层必须非常快地抓取、处理并将数据传递给知识层,以便在推理时使用。保持知识层最新对 LLM 对当前事件(如价格、产品以及模型发布后发生的所有变化)的问题的回答质量有巨大影响。
9、可信网络数据的五个要素
信任不是免费的。正如我们所看到的,网络数据基础设施层在确保 LLM 有新鲜信息可用方面起着关键作用。重要的是,提供给知识层的数据是可信的。那么,维护高水平的可靠性和信任网络数据需要什么?有五个要素:
- 有根据。 它需要有根据。每个主张或数据点都必须有一个引用,一种在需要时 AI 可以读取的来源,以及用户以后如果想深入了解可以点击的方式。想想维基百科。人们信任它的原因,即使任何人都可以编辑它,是因为每个主张都有一个你可以点击的引用。没有它,那就只是某人的意见。同样,如果没有引用,用户将很难信任 AI 答案。谁知道呢?也许是 LLM 编造的,就像我们的手机例子一样。
- 深入。 然后,数据需要深入——也就是说,足以减少产生幻觉的概率。我们想给 LLM 足够的上下文来理解信息并生成正确的答案。这意味着简单的单段摘录是不够的。想象一下,要求某人审查合同,但只向他们展示摘要页。他们可能得到大致的想法,或者可能错过一些非常重要的条款。这就是当我们向 LLM 提供摘录而不是完整上下文时发生的情况。理想情况下,我们希望提供完整的网页、完整的文档、完整的数据集,以及描述信息本身的一些元数据——例如,使用的字段名称和格式。我们需要给 LLM 事实和结构,而不仅仅是一堆文本。
- 新鲜。 此外,数据需要是新鲜的。提供真正最新的实时数据很重要——与用户在基础设施层抓取页面时刷新浏览器所看到的相同。过时的数据会使 LLM 自信地错误。这不仅仅是理论上的。这周我在访问一个新城市,我向我的 AI 智能体询问博物馆推荐。我得到了一个自信的答案,去某个博物馆,然后当我在 Google 地图上查找方向时,它说"永久关闭"。我谷歌了一下,发现它实际上在 3 个月前就关闭了。幸好我没有开车去。新鲜数据对不同事物有不同的分辨率——例如,价格是分钟级的,新闻是小时级的,法律等事物是天级的。
- 格式正确。 数据还需要格式正确。这是因为抓取网页会产生原始 HTML,这不是 AI 智能体摄取的合适格式。它可能有几兆字节,所以在令牌方面非常昂贵,并且包含可能使 AI 困惑的不相关信息——如 CSS 和 JavaScript。事实上,向 AI 智能体提供原始 HTML 有点像在宜家买床但找不到盒子里的说明书。你只得到一堆木制零件和一些螺栓。LLM 需要弄清楚什么放在哪里,然后才能做任何有用的事情。这需要时间和令牌,并引入错误。因此,网络基础设施层需要将数据格式化为易于 LLM 理解和消化。但它也需要数据紧凑以节省令牌。网络基础设施层将原始 HTML 转换为令牌高效的格式,如 Markdown,使用项目符号列表,或转换为仅包含相关数据的结构化 JSON 文件。
- 及时。 最后,数据必须是及时的。网络数据必须快速传递给知识层,因为如果在 LLM 已经提供答案之后上下文才到达,那就太晚了。想象一下,如果 NBA 体育评论员描述比赛中的每一个动作,但音频延迟了 20 秒。从技术上讲,它是准确的,但对于观看直播比赛的人来说完全没用。根据不同的需求,所需的延迟可能是几秒钟,但有时甚至是几毫秒。这意味着延迟是网络基础设施的一个关键特性,而不仅仅是一个脚注。
如果您错过了这五个要素中的任何一个,信任就会崩溃,您就回到了垃圾进、垃圾出。但如果您击中了所有五个,您就有一个可信的网络数据层来喂养您的 AI 工具。
10、当网络反击时
然而,即使有了正确的基础设施,网络本身有时也会与您作对。让我们看看 LLM 和智能体在使用公共网络数据时可能遇到的一些常见问题。
正如所述,AI 智能体必须使用新鲜数据才能获得用户的信任。假设我们想构建一个购物 AI 智能体。它的功能之一是进行价格比较——检查多个零售商网站的产品价格。在这个例子中,我们只使用一个。此时,假设我们有一个产品,产品 X。在零售商网站上,该产品有货,价格为 50 美元。现在,假设智能体每天抓取网站并找到产品 X。然后它收集价格和库存可用性,并将它们发送到我们之前谈到的知识层。
但零售商的价格和库存可用性每天都在变化,有时每小时都在变化。对于需求量大的热门产品尤其如此。这些正是用户实际可能询问的产品。
11、为什么新鲜度会衰减
并非所有内容都以相同的速度老化。事实上,存储的电子商务数据的新鲜度以非常高的速度衰减。如您在此图上所见,Y 轴是新鲜度——高是新鲜,低是过时。X 轴是时间。您可以看到,例如,博客文章衰减得相当慢,但电子商务数据衰减得更快。
所以,让我们假设 X 是一个热门产品,并且不再可用——它在零售商网站上缺货。让我们假设我们有一个新用户。我们叫他 Mark。Mark 想使用价格比较智能体来查看产品是否准备好购买。他可以查询 AI 智能体,可能看到产品仍然有货。但与此同时,正如我们所看到的,零售商已经售罄,不再有产品 X 库存。然后,当 Mark 去零售商网站完成购买时,他会沮丧地发现产品实际上不可用,并且他会失去对价格比较智能体的信任。
在电子商务方面,产品数据的不同部分在变化速度方面并不相同。产品规格和描述本质上相当静态,可以由知识层缓存更长时间。但价格和库存可用性变化非常频繁。因此,最佳实践是在推理时刷新它们。
12、将所有内容整合在一起
让我们把这一切整合在一起。这里我们有一个 LLM 和一个知识层,试图直接访问网络。有时它有效,但正如我们所看到的,有时网站会阻止或显示验证码,甚至提供错误信息。即使数据流动,网站提供的原始 HTML 格式也很难让 LLM 使用。数据不可靠,对 LLM 的信任可能受到损害。这可能导致不满意的用户或错误——有时是昂贵的错误。知识层仅与其接收的输入一样好,直接网络访问是不够的。这通常导致 GIGO——垃圾进、垃圾出。
相同的 LLM 和相同的知识层,但现在添加了可靠的网络数据基础设施层。网络数据基础设施层处理机器人检测,避免错误信息,并为您的 LLM 提供格式正确的可信网络数据。现在,到达知识层的网络数据是有根据的、深入的、新鲜的、格式正确的和及时的。有了可信的网络数据,LLM 或 AI 智能体可以提供真实反映现实世界实时发生情况的答案。所有这一切都在没有猜测的情况下发生,不会让 Mark 对一个缺货的产品感到兴奋,也不会向 Lisa 显示错误的酒店价格。
13、结束语
总结一下,当今构建可靠 AI 系统最难的部分不是 AI 模型本身。而是构建其下实际在大规模、实时运行的数据层,对抗为人类构建且经常抵制被机器读取的网络。网络基础设施层确保在涉及网络数据时消除垃圾进、垃圾出。如果您正确处理了这一层,您的 AI 智能体将变得非常有用——您拥有一个可以被世界上苛刻用户使用的可信系统。
原文链接: LLMs Don't Know What Happened Today. Here's the Data Layer That Fixes That.
汇智网翻译整理,转载请标明出处