AI 行,但经济帐算不过来

AI 有许多优点,但赚钱不在其中。这并不是因为它在设计上就不赚钱(它并非如此)。

问题出在你采取的方式上。

AI 法律初创公司 Harvey 就是以惨痛的方式学到这一课的:从财务状况尚可,突然变成巨额亏损——我称之为"HARVEY 经历",我相信这将会变得非常普遍。

经常有人问我,如何避免 AI 带来的糟糕惊吓。我的回答总是类似你现在读到的内容。

1、天哪,Harvey,这可真够吓人的!

据彭博社报道,知名 AI 初创公司 Harvey(完全以 AI 驱动的法律助手为业务)经历了一次不小的惊吓。

随着客户越来越多地使用其 AI 代理,Harvey 的毛利率从 2026 年初的约 50% 跌到了 6 月的负 50%。

用大白话来说,这意味着公司从每收 1 美元还能毛赚约 0.50 美元,变成还没扣掉工资、股权激励、营销等运营成本就已经亏损。

据彭博社报道,恶化始于 3 月那次更新之后——客户对 Harvey 代理的使用量开始上升。换句话说,产品使用量的突然增长反而让它变得"不那么赚钱"了,打破了软件业的黄金法则之一:规模经济——用户越多,理应越赚钱。

这简直就是死于成功,在软件行业闻所未闻。

这家法律 AI 公司的联合创始人 Gabe Pereyra 随后承认了负毛利,但表示 Harvey 在一个季度内就把它拉回了零以上——即便使用量环比翻了一番。我们稍后会看到他们是怎么做到的。

需要澄清的是,Harvey 在这次反转之前并不是盈利的;它并没有盈利。真正令人惊讶的是:

一家软件公司的财务状况,怎么会如此剧烈、如此突然地反转?

而答案正是我想说的:AI 的默认定价模式——订阅制——坏掉了。

2、订阅制已经行不通了

第一个问题是固定定价。Harvey 按用户收取协商好的订阅费。

在这种定价模式下,客户按"照付不误"的原则被收取固定价格;即使不用产品也要付费。

反过来,你保证不会再产生额外费用,哪怕用户把产品用得很多。

订阅制在软件产品中极其流行,因为转化率更好;客户更愿意付费,因为可以预知成本。

另一种选择是按用量计费(consumption-based),或按使用付费(pay-as-you-go)的模式,对客户来说要难接受得多,因为他们害怕突然收到一张没有预期到的大额账单。

但除了销售转化之外,订阅制对软件公司历来都很有利,因为服务每个新用户的成本通常很低,而且在整个客户池中用户成本是可预测的。简言之,订阅制毛利高,客户群扩大时毛利会改善,而且销售成本(服务产品的成本)是可预测的。

你可能注意到我在这里用了过去时。但为什么呢? 嗯,因为有了 AI,这不再成立了。

AI 打破了软件定价模式,大多数 AI 驱动的软件最终都会变成按用量计费的产品,或按使用付费。

原因在于边际成本。让我解释一下。

3、重度用户能把你搞破产

在传统的非 AI 软件中,用户执行的大多数操作在基础设施层面都很便宜。定位相关记录、检查权限、应用业务规则、更新几条数据。

没什么花哨的。

这些都是边界清晰、计算范围很窄的过程。因此,服务普通用户不仅便宜,而且可以有信心地预测新用户也会很便宜。

是的,在传统软件中,用户可以发起更耗资源的流程,比如一份昂贵而庞大的报表、一个优化任务,或是一条写得很糟糕、相当吃力的查询,但这些是边缘情况,而不是常态。

实践中,这意味着在对基础设施进行初期重投资之后,这套基础设施可以轻松容纳新用户。当然它需要扩展,但单位成本是递减的。

也就是说,增加新用户只会带来计算资源的缓慢增长。于是,每单位算力被更多用户共享,每个用户(边际)成本极低。

换句话说,如果我们把所需算力定义为 'F + cN';固定成本 'F' 加上边际的、每用户成本 'c' 乘以用户数 N。因为 'c' 极小,你的算力需求主要由固定成本驱动。

随着固定成本被所有用户摊薄,每个新用户会进一步降低人均 'F',这意味着你的毛利会随客户池扩展而增长。

很完美。

问题在于,这对 AI 工作负载不成立。AI 是两头不讨好,因为:

  • 平均工作负载本身就已经非常吃算力
  • 过于积极的用户可以花到失去理智,意味着边际成本几乎不可忽略

换句话说,毛利不再必然随客户池增长。我们逐点来看。

4、AI 工作负载不是开玩笑

AI 工作负载非常吃资源,原因有三:

  1. 芯片密度通常高得多
  2. 这些芯片碰巧也贵得多
  3. 单个用户可以产生异常多的请求,且时长可以任意长

芯片密度指的是 AI 推理需要 "每个用户大量 GPU(如果是智能体则还包括 CPU)" 这一事实。罪魁祸首是推理需要大量内存。

这足以单独写一篇文章,但关键是每块芯片的平均内存容量远小于平均工作负载所需。这意味着每个用户可能需要几十块 GPU,在某些极端情况下甚至独占全部。

历史上,计算工作负载大多受算力限制,意思是 "我需要多少芯片" 主要由 CPU 算力决定,在标准情况下很少有用户需要超过一块 CPU 芯片。

这种以算力为中心的范式塑造了数十年的硬件设计,更多资金被投入到提升芯片算力而非内存能力。换句话说,进步是由对更多算力的迫切需求定义的,而不是更多内存。

然后 AI 出现了,并且要求相反的东西。

对更多"以内存为中心"设计的需求早于 AI,但 AI 让它们变得不可或缺。

今天我无法展开细节,但 AI 本质上是一个受内存限制的范式(或者按我喜欢的说法,以内存为中心)。

如果你真想理解原因,我推荐你读一读我前段时间在通讯里写的这篇文章。

当你把这一点与一个显然没有为内存需求突然增长做好准备的硬件供应环境结合起来,我们不仅会看到内存成为地球上最昂贵的商品,还会看到硬件处于这样一种状态:"我已经拿出最好的了"——而它远远不能满足 AI 的真实需求。

为了稍微不那么难看一点,用户可以被合并到同一块 GPU 资源上(称为"批处理"),但这会对性能造成巨大负担。用大白话来说,你可以并行服务很多客户,但每往批里多加一个客户,都会影响批内其他客户获得响应的平均速度。

批处理用户(从而更高效地利用芯片)与用户速度(后者称为交互性)之间的这种权衡,可以在下面这张 DeepSeek v4 Pro 在 NVIDIA Rubin 服务器上的吞吐量 vs 交互性示例曲线中观察到。

为了提高每个用户的响应速度,你必须减小批大小。这会显著改善用户体验,但同样会降低每块芯片的吞吐量。

用普通话说,通过改善个体体验,服务商每块芯片赚到的钱反而变少了,因为在 AI 工作负载中,收入与工作负载规模成正比。

通常我们尽量保持在每用户 100 tokens/秒以上;否则,用户体验会变得非常糟糕。

在某些情况下,你可以提供"高端服务",让用户获得极快的响应,但这会迅速降低你的并发服务能力,除非你对那个"快速模式"收取高得多的费用,否则会对毛利造成巨大影响——顺便一提,服务商正是这么做的。

换句话说,AI 基础设施服务商面临一个二分法。与非 AI 软件不同——在非 AI 软件中,部署"每用户更多 CPU"并不自动意味着更好的用户体验或更高的直接收入(例如,把查询响应时间缩短 10 毫秒不会让你的客户突然愿意支付双倍订阅费)——这对 AI 工作负载来说非常成立,而每用户较低的芯片密度通常意味着更差的体验,从而导致客户流失。

此外,你需要 "每用户更多芯片" 这一事实,还因为这些芯片——著名的 GPU 和其他加速器——也极其昂贵而雪上加霜。

这意味着服务商不仅必须把运行这些芯片的投资和运营成本分摊到尽可能多的用户身上,而且这些成本,尤其是前者,本身也是巨大的。

如下图所示,对于一个 1 GW 的数据中心,此前需要 500 亿美元投资,而较新的估计认为这一数字在未来一年左右会增长到 1000 亿美元/GW,这些数据中心每年的资本成本约为 80 亿美元,"只有" 9 亿美元的运行成本。

不用说,资本成本构成了数据中心成本的大部分,接近 90%,而且随着 NVIDIA Rubin GPU 等即将推出的平台(价格是 Blackwell 的两倍),这一比例可能更高。

因此,当你要回收在服务 AI 产品的数据中心上的投资时,最初的账单就已经比传统数据中心高得多。

注意,资本成本翻倍并不意味着毛利更差。 Rubin GPU 带来的性能提升远超 2 倍,所以人均成本实际上可能下降。这个话题改天再说。

综合来看,你需要每用户更多芯片,而每块芯片又贵得多。

真是绝佳组合!

第三个也是最后一个问题:虽然在非 AI 软件中"巨型请求"很少见,但在 AI 中非常普遍。事实上,只要有足够的野心,单个用户就能"劫持"你整台价值数百万美元的服务器。

5、重度用户是强大的敌人

为了展示单个用户能产生多大影响,让我快速做个粗略的数学推算。

考虑一个看起来无害的请求:用户与 Qwen 3.8 2.4T(一个流行的中国大语言模型)对话,要求它处理约 1,000,000 个 token 的序列,大约相当于 75 万字。例如,用户可能想讨论《哈利·波特》系列小说的细节,篇幅大致就是这个量级。

即使在业务清淡的一天,如果这是你唯一的用户,你仍然需要整个模型准备就绪在服务器上。该模型有 2.4 万亿参数,有效体积约为 5 TB,即 5 万亿字节。

一块 NVIDIA B300 GPU 有 288 GB HBM 内存,因此你至少需要 18 块加速器才能为推理部署该模型。再算上示例序列,该序列的工作内存大小(也称为 'KV Cache')还需要额外 94 GB,幸运的是仍能放进这 18 块 GPU 中。

需要将近二十块紧密连接的 GPU,迫使你使用 NVIDIA 提供的最大服务器**:GB300 NVL72,72 块 GPU 约 400 万美元,约合每块 GPU 约 6 万美元**。

这意味着服务该用户所需的硬件价值一百万美元(尽管实际上你被迫支付整台服务器的费用)。

尽管只是单个用户,工作负载却巨大无比。现在把几个这样积极的用户组合起来,你的硬件需求会飙升。而且非常快。

尽管如此,OpenAI 为自家员工公布的成本分布足以吓死人:研究人员的中位数员工每天花费 650 美元(即至少 50% 的研究人员员工每天花费 650 美元或更多),而前 10% 每天至少花费 7000 美元(按 API 价格计算)。

特别能说明问题的是 OpenAI 员工 Peter Steinberger,他声称自己每月可以在 AI 上花费高达 130 万美元。

这意味着单位成本不会随规模改善。远非如此。更多用户并不意味着更好的规模经济,算力随用户同步增长,所以任何毛利改善都仅来自固定成本的摊薄。

对服务商来说,无法知道新用户是低用量用户,还是会花费超过之前 1000 个用户。这种不可预测性使 Harvey 无法预测,随着更好的模型驱动更高的使用量,他们的毛利率会崩溃,因为他们向每个客户收取的费用是固定的,因此不会随使用量的突然增长而增长。

当毛利率会毫无预兆地变成负数时,你怎么经营订阅制业务?你会投资这样的公司吗?

简言之,这意味着算力需求随用户增长而上升,而且你的起点也更高(AI 芯片更贵)。

另一个让情况更糟的因素是时间。在传统工作负载中,强大的 CPU 处理请求,并随着请求到来和离开不断加载和卸载新请求,因为工作负载不算特别吃资源,而且 CPU 就是为单请求极快速度而设计的。

但在 AI 中,请求可能需要几秒钟,有时整整几分钟或几小时,甚至一整天(参见 OpenAI 对 Navier-Stokes 的"解决方案"),因此用户不仅可以为自己劫持大量资源,而且能以令人煎熬的长时间这样做。

简而言之,服务 AI 是一团糟。所以,下次你疑惑 AI 为什么这么贵时,不妨再读一遍这篇文章。

综合来看,试图以固定价格服务 AI 产品,就像开一家每人固定 20 美元的自助餐厅,却只接受橄榄球运动员,而且只接受他们训练完之后。

除非你设一个上限(这意味着它不再是"自助"餐厅),否则你就是在自寻死路。

服务商确实会设置"速率限制",意味着订阅有固定大小的资源分配。但这会导致非常糟糕的客户体验和不信任,比一开始就直接采用按用量计费还要糟。

没有办法回避。AI 定价模式的未来是按用量计费。

与此同时,有很多事情可以做来改善数字,但事实是这个行业仍然深度"不严肃";一个由私人资本补贴、拒绝进化到建立某种可持续事物的行业。

让我解释一下。

6、总有一天,我们得赚钱

据 Harvey 总裁 Pereyra 称,他们通过模型路由、协调智能体的软件变更以及后训练的组合改善了毛利。

让我翻译一下 AI 企业黑话**:他们通过在保持收费不变的同时降低服务成本来改善毛利**。要是高管们能有一次说得直白点就好了,但我扯远了。

他们通过将请求路由到更便宜的模型来做到这一点,但也采取了我认为是构建持久 AI 业务唯一正确的方式:训练自己的模型。

Harvey 的8 月研究更新给出了一个例子:Tenet,通过进一步训练月之暗面(Moonshot AI)的开放权重 Kimi K3 构建,在许多关键任务上与前沿模型相比得分很高。

这是 AI 中古老的故事;不管前沿实验室的评论家们多么努力地试图说服你相反的观点,深度胜过广度,因此针对手头任务训练一个有能力的模型,会胜过没有在你的数据上训练过的通用模型。

问题在于,这并没有解决更大的问题:经济学仍然坏掉了。可能比以前好一些,但原则上仍然坏掉了。

有趣的是,Harvey 的销售成本之所以飙升,是因为他们以按用量计费的模式运行 OpenAI/Anthropic 的模型;你越用他们的模型,实验室就收你越多钱——这正是 AI 本应有的计费方式。

在按用量计费的服务成本上经营订阅制业务,正如 Harvey 和大多数其他应用层初创公司坚持要做的那样,如果你只关心成交和提高顶线(收入),而完全不尊重底线(利润),那确实行得通。

这不是成熟生态系统的标志。

许多 AI 初创公司生活在仙境里;他们实际上并没有在构建可持续的业务,而是在构建一个在向风投做 pitch 时看起来足够好的业务,希望有朝一日能仅凭增长变得可持续。

当爸爸妈妈替你买单,你又不必担心构建可持续业务时,你可以假装是成功企业家,但这并不意味着你是,因为你的公司仍在亏损。

但我的吐槽到此为止;我知道这是"硅谷方式":快速增长,利润以后再说。

然而,如果客户增长没有足够改善毛利,这个策略就行不通;规模不是解药。1 万个用户和 100 个用户一样不赚钱,只是账单更大而已。

固定成本摊薄确实能带来一些毛利改善,但边际成本才是真正的问题。

最令人担忧的是,行业正在接近一个流动性悬崖:风投资金不再够用,于是债务登上舞台。当债务投资者进场时,与主要关心收入增长的风险投资人不同,债务投资者关心利润和现金流,因为他们要靠这些收回本金。

因此,很快利润将成为唯一重要的事情,我非常担心大多数 AI 初创公司不仅不敢把客户迁移到按用量计费的模式,而且害怕这样做,因为他们知道自己没有足够深的护城河来推动按使用付费的定价(这很容易让客户的成本翻两番)。

你是在把客户从低价、可预测的环境推向更高价格、下月账单更不确定的环境。我也会害怕。

所以我相信今天许多 AI 初创公司,甚至十亿美元级别的公司,都处于一种"有趣"的境地:

他们需要迁移到按用量计费才能赚钱,但这样做之后,他们的业务对客户可能不再有吸引力。
亲爱的读者,这算好生意吗?

我坚持认为:像 Harvey 那样把更多产品路由到内部模型,只能解决一半问题;你的 AI,无论多么本地化,仍然遭受我上面讨论的同样病症。

7、我懂订阅制的诱惑,但它不可行

听着,我懂。我理解作为企业家,想构建让客户容易签约的定价模式的冲动。订阅制让交易更容易谈成。

但订阅制的关键卖点之一是,作为限制你每用户收入的交换,它们通常受益于巨大的规模经济,这就是为什么软件风投无论何时都痴迷于增长。

"规模经济"的意义在于固定成本被更大规模的客户池摊薄,从而推高毛利。

但如果任何个人都能花费相当于其他数千人的钱,这个方案就无法可预测地扩展,并导致 Harvey 经历的那种突然、巨大的毛利率摆动。

订阅制对创始人还有另一个很大的吸引力:投资人。它们为你和你的投资人提供强劲的经常性收入指引,这对有一天想上市或进行下一轮私募融资的大型初创公司很重要,因为经常性收入让投资人可以把现金流折现到很远的未来,并放心地对你的估值应用很高的倍数。

我再强调一次:我懂。

但只要订阅制仍是常态,低毛利和随使用量增长而出现的惊人成本飙升就会成为常态。不可预测性也会成为常态。

你可能猜到了,我出了名地怀疑且好奇:当 Anthropic 和 OpenAI 上市后,它们将如何处理这个非常现实的问题,尤其是后者,其订阅制客户占比大得多。

到目前为止,它们一直在放纵一种只能被描述为离谱的订阅补贴的行为,同时激进地将更大的客户迁移到按用量计费的模式。

据 SemiAnalysis 测量,对每月 200 美元的 ChatGPT 订阅来说,按用量计费的等价用量花费可达 14,000 美元。

Anthropic 已经将订阅限制在 150 个许可;超过这个数量,你就进入了纯按用量计费的模式。

幸运的是,它们在按用量计费(API)产品上享有高毛利,这在一定程度上补贴了订阅制模式。

但它们仍然在大把烧钱,证明规模并不能解决问题。

8、模型坏掉了。请修复。

由于 AI 行业在很大程度上仍然是私人事业,而公开市场方面是地球上最富有的五家公司花光自己的钱以及别人的(通过债务)钱,来掩盖整体不盈利的事实,这个领域得以一直把全部精力和兴趣都放在展示强劲的收入增长上。

存在盈利的可能性,而且确实有一些公司是盈利的。例如,对于主要聚焦推理的公司,如 Neoclouds,AI 可以是非常赚钱的事业(例如 SpaceX 与 Anthropic 的交易),并能产生正现金流**;在 CoreWeave 或 Nebius 这样的案例中,它们拥有正的经营现金流。**

它们在严格意义上仍不"盈利",因为它们花费超过自己产生的现金流来扩大算力版图。

但残酷的现实是,这些公司避开了训练、数据生成和研究等巨额成本,这意味着整体的"AI 生意"仍然像没有明天一样在亏钱。

问题在于,这个行业以远低于成本的价格在售卖自己,这要归功于订阅补贴。

没有补贴,客户可能不愿意支付超过 AI 真实成本的费用,尽管我很看重 AI 产品(并且为此付费),我还是要这么说。

但我仍然不相信我不是少数派,而这个少数派承担着为这一切买单的巨大任务。因为所有这些原因,我对我见到的每一位客户高管都说:请为完全的按用量计费模式做规划,因为那正是你最终会走到的地方。

这不是一时兴起。这不是威胁。当你看看这项技术底层如何运作时,这再明显不过了。

为此做好准备,或者准备好沉浸在你自己版本的"HARVEY 经历"里。

你被警告过了。


原文链接: AI Works. The Economics Do Not.

汇智网翻译整理,转载请标明出处