为什么AI图像生成器无法跳过等待

在任何图像生成器中输入提示,你都会等待。五秒、十秒、有时三十秒。你看着混乱的静电雾慢慢变成一张脸、一个风景、一个标志。

多年来,这个行业一直在追求圣杯:单步生成。一次神经网络传递,零等待。蒸馏技巧、一致性模型、更快的求解器——每年都有人声称他们几乎消除了延迟。

但德克萨斯大学奥斯汀分校的Zhiyang Xun和Eric Price最近在ICLR 2026深度生成模型研讨会上发表的一篇论文发出了一个令人清醒的现实检验。你感受到的等待不是工程缺陷。这是一个数学 mandate,再多的GPU资金也无法将其立法消除

要理解为什么,你需要六个想法。我保证它们都不需要数学学位。

1、扩散模型如何"思考"的60秒速成课

扩散模型通过从纯随机噪声——数字静电开始,然后以小步骤走向真实图像来生成图像。在每一步,它都会向学习的神经网络提出一个问题:

"鉴于现在噪声有多大,哪个方向会让它看起来更像真实图像?"

这个问题被称为分数查询。答案("分数")是一个从噪声指向数据的指南针指针。每次查询都是神经网络的一次评估,每次查询都是你等待时间的一个片段。

以下是用伪代码表示的整个过程:

image = sample_pure_noise()                    # 从静电开始

for noise_level in noise_schedule:             # "调谐器",高 → 低
    direction = score_model(image, noise_level)  # 询问指南针(1次查询)
    image = take_a_small_step(image, direction)

show(image)                                    # 瞧

这个循环就是延迟。所以自然的问题是:我们能将循环缩小到一次迭代吗?

这就是Xun和Price划清界限的地方。他们证明,对于具有d维的分布(想象:d = 描述图像所需的数字数量),任何算法都需要至少大约√d次分数查询才能产生有意义的样本——写作Ω̃(√d)。

下限不是关于当今计算机的陈述。它是关于道路本身的陈述。30英里/小时的速度限制不在乎你开的是法拉利还是租车。同样,这个界限即使在无限计算下也成立。而一张512×512彩色图像有786,432维,所以√d ≈ 887。

(诚实的警告:这是最坏情况的下限。真实图像具有可利用的结构,这就是为什么你的采样器可以只用20-50步。该定理表明,最难的分布永远不能在少于约√d次检查内完成——随着模型追求更丰富、更高分辨率的输出,这个下限会上升。)

2、收音机调谐器:为什么AI被迫扫描

为什么一两次聪明的查询不能完成工作?这就是论文的核心反派:噪声级别扫描瓶颈

还记得上面循环中的noise_level吗?指南针只在噪声级别的微观窗口内有用。研究人员使用Tweedie公式证明了这一点,该公式将分数与模型对给定噪声图像的原始图像的"最佳猜测"联系起来。

  • 噪声太多:数十亿候选图像看起来同样可能。信号"冲刷"成论文所说的空分数——一个指向无处的指南针。
  • 噪声太少:区域太稀疏,根本没有东西可找。

想象在一个跨越数英里的调谐器上寻找一个广播电台,其中99.9%的调谐器是静电或静音。在错误噪声级别上的查询几乎什么也教不会采样器——除了"错误的调谐器位置"。

因此它必须逐级扫描调谐器。证明表明,任何采样器都必须搜索大约√d个不同的噪声级别才能找到音乐所在的位置。

那个扫描就是你的进度条。

3、薄壳:运行此代码,打破你的直觉

窗口如此狭窄有一个更深层的原因,这是高维数学中最违反直觉的事实。自己试试这个:

import numpy as np

for d in [2, 100, 10000]:
    pts  = np.random.randn(20_000, d)          # 随机"噪声"点
    r    = np.linalg.norm(pts, axis=1)         # 距离中心的距离
    print(f"d={d:6d}  radius ≈ {r.mean():7.1f} (√d = {np.sqrt(d):7.1f})  spread ≈ {r.std():.2f}")

输出:

看看最后一列。在10,000维中,每个点都落在距离中心约100个单位处,相差约0.7。"云"根本不是云——它是一层薄如剃刀的皮肤。一个高维橙子几乎完全是皮

这就是薄壳集中,这就是为什么信息窗口如此残酷:在那个壳上,概率权重在微小距离上呈指数级摆动。信号是真实的,但它超敏感——只能通过钥匙孔看到。

而最关键的是:即使你给采样器一个近乎完美的指南针(论文所说的亚指数误差尾,几乎在所有地方都准确,而不仅仅是平均值),**Ω(d^(1/4))**次查询的墙仍然存在。完美并不能解锁门。

4、没有采样器能免疫

你可能会想:好吧,但我最喜欢的求解器不是DDPM,我肯定能逃脱吧?

不能。这篇论文与架构无关。它表明去噪器、噪声预测器和分数网络都是信息等效的,每次评估都算作一次神谕查询。因此这个界限约束了整个动物园:

  • SDE采样器:DDPM、预测-校正器
  • ODE求解器:DDIM、DPM-Solver、PNDM、DEIS、UniPC、EDM
  • 流方法:校正流和流匹配(在标准高斯插值下)

这就像证明速度限制同样适用于轿车、SUV和摩托车。如果你的方法通过询问分数指南针"哪个方向更干净?"来导航,你就在这条路上。

5、情节转折:数学证明了工程师的正确性

多年来,从业者一直使用多尺度噪声调度——上面循环中从高到低的渐进噪声斜坡,因为,嗯,它就是有效。这是工程传说。

Xun和Price将传说变成了定理:他们的证明表明任何采样器必须搜索许多不同的噪声级别,为为什么这些调度是必要的提供了第一个正式解释。现代生成式AI的迭代设计不是黑客行为。这是隐藏的数学家,猜对了。

6、下限、上限和前沿

在这篇论文之前,理论只有一个上限:Benton等人表明~Õ(d)次查询足够。现在我们有了~Ω̃(√d)的下限。研究人员第一次可以看到房间的两端。

在√d和d之间,真正的最优效率在哪里?缩小这个差距现在是生成模型理论中的决定性开放问题。

7、这对你意味着什么?

  • 不要等待硬件来解决等待问题。更快的芯片缩短每次查询的时间;它们无法减少查询数量。这是信息论,不是硅。
  • 对"单步"炒作持怀疑态度。这个界限锁死了分数查询走廊中的每一扇门。如果即时生成真的到来,它必须来自根本不同的架构——而这篇论文准确地告诉我们哪些范式是死胡同。
  • 尊重循环。你看到的每一次迭代细化都是模型在扫描调谐器,寻找隐藏在薄壳上的信号。

8、等待就是数学

我们喜欢将AI延迟想象成暂时的不便——我们将用更好的芯片和更聪明的代码来偿还的债务。Xun和Price已经表明,对于整个扩散模型家族,这笔债务已经写入了信息本身的定律。

下次你的图像生成器让你等待十秒钟时,不要诅咒软件。你正在看着一台机器遵守数学速度限制,在一个比理性更薄的壳上扫描数英里长的调谐器,寻找一丝信号。

有些等待不是低效。它们是数学检查其工作的声音。


原文链接: The Mathematical Speed Limit: Why Your AI Image Generator Can’t Skip the Wait

汇智网翻译整理,转载需注明出处。