1-bit AI 意义重大

小而智能,还很快

1-bit AI 意义重大
AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo

大型语言模型(LLM)有一个大麻烦:它们通常过于庞大,在大多数情况下,它们是依赖昂贵硬件的软件,超出我们大多数人的能力范围,无法随心所欲地运行,也无法保护自己的隐私。

相反,我们只能被迫信任那些拥有一切动机去窃取我们数据的公司(好像它们还没有窃取过一样)。

*但事情必须如此吗?*让其中一些公司失望的是,答案看起来越来越像是"不"

原因如下。

1、手机里的 2024 年 SOTA 模型

DeepGrove 团队——一家我直到现在才听说的新创公司——发布了一个新模型,名叫 Maple,它非常独特:

它可以在 Mac Mini 上以每秒 200+ 词的速度运行,在 iPhone 或同等智能手机上以每秒 100+ 词的速度运行。

它不仅仅速度快、能在你买得起的硬件上运行;它在其体积下还极其"聪明",击败了不到两年前的 AI 最先进水平,比如 OpenAI 的 o1(2024 年 9 月全球最好的模型)。2024 级别的"智能",塞进你的硬件里,还跑得飞快

但这怎么可能?

简短的答案是:它是一个三值模型(ternary model),每个参数只有 1.58 比特。让我解释一下。

2、AI 由"神经元"组成。但神经元是什么?

模型不过是一堆数字,代表一种我们称之为神经网络的"图",其中"神经元"是节点,节点之间是边。

None

简单来说,神经元只是模型内部传递信息的一种方式,但魔法发生在边上,也就是连接不同神经元的那些线。

我们把这些连接称为"神经元",是因为它们受到大脑神经元的启发——大脑神经元会不断建立新连接或摧毁旧连接(而且这样叫听起来更酷)。这些人工神经元也会像人类神经元那样被激活或"放电",以回应它们学到的模式。

这些边是"可训练的",也就是说,通过让模型接触数十亿甚至数万亿的数据点,它们学会如何最佳地连接不同的神经元;两个神经元之间的某些边会变得超级强,让这两个神经元"形影不离";另一些则虚弱到那两个神经元根本不会交流。

简而言之,神经元代表模型知道的概念,边定义了这些神经元如何连接起来,以构建越来越复杂的概念。

这听起来相当玄奥,但可以简化理解。

例如,一个神经元可以专门负责判断图像中是否有动物。另一个神经元可能识别它是否有羽毛。还有一个识别是否有翅膀。而所有这些最终都会连接到一个识别鸟类的神经元。

这就形成了"神经元回路",学会识别它们在训练期间见过的数据中的模式

例如,模型可能会发展出一个回路,通过让大量与德克萨斯州及德州相关概念有关的神经元激活,来指示"德克萨斯州首府"这个问题的答案应该是什么。

None

但归根结底,这一切都只是一堆数字。当一个输入进来时(比如一把钥匙的图像),它被送入这些神经元,从而被"转换"。神经元处理输入并"建议"输出应该是什么:"这是一把钥匙的图像",就像前面的例子一样。

因此,要提高模型捕捉数据模式的能力,你有两个选择:

  1. 让模型更大,拥有更多神经元,这样模型就能捕捉更多概念,
  2. 或者让模型更精细,让每个神经元更"有表现力"。

第二点正是"精度"这个概念切入的地方。

3、精度是关键

简单来说,精度就是我们允许模型内部每个数值拥有的精细程度(例如,'0.345' 比 '0.3' 更精细)。但我们今天讨论的这个模型有趣之处在于,它是一个三值模型:一个大多数数字要么是 '1'、'0' 或 '-1' 的模型。

那为什么这很重要?

如上所述,模型由神经元组成,神经元捕捉它们在训练中学到的概念。因此,为了举例,我们假设有一个模型,其中有一个神经元,每当图像中出现狗时就激活。

正如下面的图片所示,狗神经元接收来自前面神经元的输入。但由于所有数字都是 '1' 或 '-1',这些基本上就是是/否问题:

  • 它有毛吗?
  • 它有尾巴吗?
  • 它有翅膀吗?
None

现在,让我问你:你认为这个神经元拥有所有信息,能在任何时候无误地识别狗吗?

你会放心做决定,还是想知道更多?

那可能是只狗,但也可能是只猫,因为两者都符合这些标准。公平地说,其中一些线索相当有说服力。例如,如果神经元收到动物有翅膀的信号,它会学会大幅降低它"看到"狗的信心。其他线索,比如有毛,就不那么有力,因为许多狗长的是毛发而不是毛皮。

也就是说,仅凭这些证据,我们缺乏足够的细微差别来让自己更加确信。由于这些值只能是"是"或"否"(在数字上表示为 '1' 或 '-1');如果动物有尾巴,这个神经元就会非常倾向于说"它是狗",因为它会收到一个强烈的 '+1' 信号。

然而,*有尾巴就一定是狗吗?*不。尾巴也并不是很特异的特征,因为很多动物都有尾巴。与此同时,翅膀是非常有力的"这不是狗"的证据,所以我们可以接受那个信号是 '-1'。

*但如果这些线索变得更具有信息量呢?*例如,这些线索可能采用这样的数值:毛 +0.2,尾巴 +0.3,翅膀 -1。

换句话说,为"毛"激活的神经元,虽然连接着我们的"狗神经元",但会给出一个积极信号,不过不会太强,因为也可能不是狗。尾巴也是如此。

综合起来,这给了模型更细微的视角,它现在会说:"是的,这只动物有毛,这可能以一定的信心表明它是狗;它有尾巴,这也是个好迹象。它也没有翅膀,这也是一个强信号,但我还没有完全被说服。"

看到发生了什么了吗,对吧? 模型已经对这个问题发展出了细微差别。它不像之前那样自信了,这是件好事。

None
简而言之,让模型的每个数值获得更精确的值,会提高模型对其预测进行更细致判断的能力。

你可能会问,为什么我们不干脆让权重取无限多个值呢?

除了神经元并不总能干净利落地划分状态这个事实(我们今天不深入讨论这个),还有一个更明显的问题:模型的物理大小。那额外的精度不是免费的。

例如,假设我们希望其中一个数字是 0.29345,一个非常"精确"的数。我需要多少比特来存放这个值?

每个比特呈现两种状态:1 或 0。因此,用一个比特,我只能表达数字 '1' 和 '0'。用两个比特,我们现在可以表示四种状态:

  • 00,即 0
  • 01,即 1
  • 10,即 2
  • 以及 11,即 3

所以比特与状态之间的关系是 2^b = N,其中 'b' 是比特数,'N' 是你想要表示的状态数。

'0.29345' 可以表示为 29,345 × 10^-5,所以我们需要表示数字 29,345(也称为尾数或有效数字)和数字 '-5'。

用我们的公式,得到 2^b=29345,结果是 14.84,向上取整到 15 比特,再加上表示 '-5' 所需的 4 比特(因为表示 5 需要三个比特(二进制中 '5' 是 '101'),再加一个符号位),总共 19 比特。

这有什么问题? 一个数字原本只占内存中的一个比特,现在却占 19 个比特,超过两个字节(每个字节有 8 个比特)。

在实践中,你不会用 19 比特来存储一个数字,而是使用以字节为单位的 8 的倍数。因此,这个数字很可能被向上取整为 2 字节(16 比特)。

考虑到 LLM 规模巨大,这些变化会极大地改变局面。

拿一个有 200 亿个数字(通常称为"参数")的模型来说。如果它是一个 1 比特模型,你需要 200 亿个比特,即 25 亿字节(2.5 GB)。但如果你每个数字需要 16 比特,也就是 2 字节,那么这个模型现在需要 40 GB

就这样,一个原本可以在你的 iPhone 上运行的模型(iPhone 大约有 6–12 GB 内存),现在需要的不仅仅是一台普通笔记本电脑,而是一台"强悍"的、要花你几千美元的本子,尤其是在内存成为全球最抢手商品的时代(我说的"抢手"是指贵得离谱)。

我从没想过有一天我会写出这些话,但"大小很重要"。不过这一次,大小伤害的是性能。你懂我的意思。

所有这一切都说明,为了可负担性,我们必须把精度降到极致。换句话说,我们现在明白了降低精度的后果,但如果我们能构建出在低精度下依然工作良好的模型,我们就能大幅提升性能。

而这正是 DeepGrove 这样的公司在做的事情,也是他们出色的成果指向一个更可负担的 AI 未来的原因。

4、DeepGrove 带我们进入节奏

如前所述,DeepGrove 刚刚发布了 Maple,一个具有三值权重的模型(因此每个数字只是 1、-1 或 0,即每个数字 1.58 比特),大幅降低了运行 AI 模型的"成本",以至于它们可以在你的 iPhone 上以极高的速度运行。

有趣的是,即使对于非常长的序列——那些需要更多内存来处理缓存(缓存可能比模型本身大得多)的序列——与其他参数规模和性能相近的模型相比,这个模型的存储和运行成本仍然相当低廉。

例如,Qwen3 30B-A3B(一个非常流行的小模型)处理长度为 131,000 个 token(约 100,000 个词)的序列需要 31 GB,这意味着你需要一台"强悍"的笔记本电脑来处理那个模型和序列,而这个模型只需约 7 GB 就能完成同样的工作,仍然在标准笔记本电脑的舒适区间内,甚至适用于"强悍"的智能手机。

None

总而言之,尽管它体积真的很小,这个模型却以小博大,取得了与有效规模大 8–20 倍的当前模型相近的成绩。

None

但当你把这些分数与过去那些在当时被视为顶尖之选的模型相比时,就尤其令人印象深刻。

在多项基准测试中,这个模型击败了 OpenAI 的 o1 模型——史上第一个推理模型,发布时绝对是最先进的。

而且那并不是十年前的事;这个模型发布于 2024 年 9 月,不到两年之前,现在它却被一个你能揣在口袋里的模型击败了。

这引出了这个模型最令人印象深刻的一点:速度这家初创公司声称在 Mac mini 上达到每秒 200+ token,所以我不得不在我的 M3 Max MacBook 上测试一下。

结果呢?

正如你希望能在下面看到的(恐怕视频质量不太好),这个模型在我的电脑上本地运行,响应速度达到每秒 234 token,大约每秒 175 个词。

作为参考,这比你在 ChatGPT 或 Claude 上获得的平均响应快得多,后者通常在每秒约 50 token 左右。
None

但为什么这么快?

第一个显而易见的解释是我整篇文章一直在唠叨的:如果移动的数据更少,一切都会更快

这对于推理尤其重要,我们知道推理是"内存受限"的,意思是决定吞吐量(token/秒)的不是你的处理器有多强大,而是内存能否足够快地供应数据。由于三值模型小得多,我们减少了必须在内存中进出的数据量,从而释放出令人难以置信的性能。

另一个重要的加速因素是:如果一切都变成 1、0 或 -1,那么矩阵乘法——AI 模型内部发生的最典型数学运算——本质上就变成了一堆加法,因为乘法要么把值坍缩为 0,要么只是改变另一个数的符号。这大大提高了运算速度。

*"一切都变成加法"*的直觉可以在下图看出,它来自 微软两年多前提出的 第一个原始三值权重模型:

None

虽然我不需要说服你这种新乘法在我们脑子里执行起来快得多,但我认为有必要解释一下,为什么机器也能以这种方式更快地处理计算。

5、更少的电路,更快的输出

最简短的解释是:切换一个数字的符号(乘以 '1' 或 '-1' 基本上就是符号是否改变的问题)所需的电路,比相乘两个数字要少。

由于所需电路更少,需要切换的晶体管更少,从而减少了计算所需的时间。

此外,平均导线长度也短得多,所以我们大幅降低了导线电容,从而减少了给晶体管及连接它们的导线充电所需的功(以及相应的时间)。

不过你仍然需要"加法器"电路来执行加法,所以这里的节省主要在于内存中进出数据的减少,而非更小的电路。

但这次发布最酷的地方在于,他们相信*"设备端自适应"(on-device adaptation)*。

6、做梦,但这次是真的

我多次谈过(最近一次是在这里)"做梦"(dreaming)技术,即 AI 公司让模型回顾当天的输出,找出值得记住的有趣片段。

例如,你可能提到过你最喜欢的犬种是马尔蒂普犬。做梦系统应该会审查你的对话,把它标记为一条值得记住的"记忆"。当它这样做时,它会把这些"记忆"添加到模型的提示词中,这样第二天模型就会"记得"你喜欢马尔蒂普犬。

这种方法的问题立竿见影:模型根本没有记住任何东西;它只是在提示词里多了一句关于你的相关信息。

它给人的感觉像是模型在记忆,但它实际上并没有真正了解你,因为一旦那句话不再出现在提示词中,模型就不再"记得"你爱马尔蒂普犬了

相反,DeepGrove 提出设备端自适应,基本上就是在你未登录的状态下,用你的回复来训练模型

因为模型在你自己的电脑上本地运行,并且可以完全针对你进行定制,它会识别出值得记住的片段,构建一个合成数据集,并用这些数据训练模型。

现在,模型真的记住了。真的更了解你了。

7、为什么设备端是未来

如果这还不能让你感受到 AI 的未来,那说明我没能正确传达这一切的重要性。

如果你是我的常读读者,你知道我坚信未来绝大多数的 token 将来自边缘模型——那些在我们笔记本电脑和智能手机上本地运行的模型。

这不仅仅是因为我们的数据中心算力远远不够所有人用(尽管社会只有极小一部分人重度使用 AI,数据中心产能已经吃紧),还因为小模型很快就会在大多数任务上绰绰有余,而且基本免费(当然,除了给硬件充电的成本,以及 AI 对硬件的损耗,尤其是对 NAND 存储的磨损,但我们今天不讨论这个)。

想想真是不可思议:这个模型所承载的"智能",水平堪比不到两年前还需要巨型集群才能规模化服务的模型。

而现在,那种水平的智能可以被装进你揣在口袋里的硬件中。

现在想象一年后的未来,你在本地运行 Mythos 级别的模型。那些入侵其他公司、解决 Erdȍs 问题的同类模型,在你的 iPhone 上就能使用。

如果那样的话,当你已经付费购买的设备里就有足够的算力时,为什么还要和数百万人争抢算力呢?

这对苹果和其他消费硬件公司来说是极大的利好(难怪 OpenAI 想挤进这个领域),对 Anthropic 这样的公司则是灾难。

要说明的是,我不是这些公司的直接股东。

超大规模云厂商会过得很好,仅仅因为数据中心算力反正也会被使用;只是我们未来要求 AI 做的很多工作,将不再需要运行在数据中心里的巨大模型。

自然,这对我们所有消费者都是好事,但可能会大幅削减预期收入,尤其是在急需收入的时候,而且我不确定有多少过度曝险的投资者做好了面对这个讨论的准备。


原文链接: Why 1-bit AIs Are a Big Deal. And They Are Here.

汇智网翻译整理,转载请标明出处