递归自我改进 (RSI) 解决了吗?

在现代 AI 时代,递归自我改进有两条研究路线:弱 RSI 与强 RSI。

递归自我改进 (RSI) 解决了吗?
博途PLC工程智能体 | AI智能体博途网关 | 博途PLC程序知识图谱 | 梯形图转SCL | 自然语言生成梯形图 | 自然语言生成SCL | 逆向生成程序块文档 | 梯形图在线查看 | 博途编程文档MCP | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI

谷歌 DeepMind 实现 RSI 了吗?昨晚有位订阅者向我提出了这个问题,于是我顺藤摸瓜查了一圈。我此前没意识到,除了缩写本身的表层定义之外,关于 RSI 的公开资料少得可怜——所以我写这篇入门,往深处讲,但不会用术语和复杂度把你淹没。

一切始于 1965 年 Irving John Good 的文章《关于第一台超级智能机器的推测》(Speculations Concerning the First Ultraintelligent Machine)。AI、AGI、ASI、奇点以及 RSI 这一概念,全都源自他对机器智能可能形态的遐想。1993 年,Vernor Vinge 在一次 NASA 研讨会上预言奇点、超级智能或 RSI 将在 2005 到 2030 年之间发生。无论术语还是猜想,都不是新鲜事。

David Chalmers 在 2010 年写下了 RSI 的核心论证:"智能的提升……总会带来设计智能系统之能力的相称提升。"这就是核心论点。随着模型能力增强,我们也会看到一种自我改进的涌现能力随之生长。它起初由人类引导,然后从那里向前推进。

Nick Bostrom 在《超级智能:路径、危险与策略》中更进一步,假定自我改进的速率会落入三类之一。他创造了今天研究者们常挂在嘴边的"快速起飞"(fast takeoff)一词。快速起飞依赖于 AI 的架构很少给自我优化设置障碍。关键的分野正是从这里开始显现。

如果 RSI 是弱的,改进会很慢,需要数十年甚至更久。如果 RSI 是强的,改进可能发生在几天、几小时甚至几分钟内。这些标签和定义并无强共识,所以我会通过选定自己使用的术语来简化这场争论。我从 2012 年起就在这个领域,并参与定义了应用机器学习,所以在这里略作僭越。

在现代 AI 时代,递归自我改进有两条研究路线:弱 RSI 与强 RSI。

1、弱 RSI

弱 RSI 的多种方法我们已有十多年了。弱 RSI 高度依赖人来驱动改进循环,由其他模型加速和放大进展。然而,它仍然依赖人类教师。这种自我改进无法泛化到我们所教授的狭窄领域之外,所以进展缓慢,并且会触顶。

我目前正在写的以工作流为中心的知识图谱系列,就是一个从弱 RSI 出发、朝着把弱 RSI 自动化为非常有限的强 RSI 演进的方法示例。它之所以"有限",是因为学习受限于实验,因此不会满足强 RSI 或快速起飞的全部标准。它落在 Bostrom 的"温和"类别里。

其灵感来自 Gödel 机——它"一旦找到重写有用的证明,就重写自身代码的任何部分"——以及衍生工作《A Family of Gödel Machine Implementations》提出的基于经验的 Gödel 机。如果你一直在追我关于 agentic 架构和信息模型的系列,你会看到我应用 Pearl 的因果性工作与实验循环之间的平行关系。Pearl 的工作提供证明,实验则创造决定重写的经验。

我也把两个过程学到的东西放进信息模型,但大多数 RSI 研究聚焦于把学习训练进 AI 模型内部。我则用一套完全不同的东西,绕开当前 AI 架构的优化速度限制。这算作弊,但在应用 AI 领域我们可以这么干。

我们有很多扩展弱 RSI、使其更强大的方法,但它们都不满足强 RSI 的全部标准。Darwin Gödel 机在今年早些时候被提出。它们用达尔文式的经验选择替代可证明的效用。它以可靠性为代价加速学习(它学到的是对的东西吗?)。

AlphaEvolve 是 GDM 的另一个、更强的 RSI 方法,它"找到了一个用 48 次标量乘法计算 4×4 复矩阵乘法的算法,改进了此前在该场景下已知最优的 Strassen 1969 算法"。它打开了数学难题求解的进展,但同样,可靠性与解的一致性问题依然存在。

即便是更强的 RSI 方法,也会撞上非常"人类"的挑战。新研究看起来很有希望,却常常被证明是错的。对 AI 如此,对我们自身的自我改进亦然。

2、强 RSI

强 RSI 是指:一个教师模型(通常是多个模型)训练出一个新模型,其能力超过所有教师能力之和。这在今天是一种独特的人类能力,而 AI 实验室正试图复制它。最好的老师加上最聪明的学生,可以教出超越自己的学生。这是 AGI(通用人工智能)中那个"G"的一部分。

强 RSI 使 AI 能够指数级地泛化(超出教师的领域)并避免触顶,唯一的限制因素是算力。这是 ASI(人工超级智能)中的那个"S",也是可能让 AI 的学习超越人类知识边界的东西。这是每家主要 AI 实验室都在追求的目标,也是 GDM 据称已用其当前 Gemini 4 训练运行解决了的目标。

这里的问题相当严重。首先,从来没有一次令人信服的强 RSI 演示。它在理论上是可能的(这一点已有充分研究和支持),而且迄今为止我们也没有任何证据支持"强 RSI 不可能"这一反事实。但是我们发现的每一种架构,都对自我改进的速率施加了限制。

每家实验室都会很快抛出自己拥有的"scaling 轴"数量——这是个花哨的说法,意思是有多少种有前景的方法被发现能提升模型能力。每条轴都被画在一条指数曲线上,预测它将带来的能力收益。这些曲线都在最初几个改进循环中成立,然后触顶。

我自己在物理、自然语言、供应链优化、定价和客户行为模型上都亲身经历过。每一次,早期的加速都很快让位于平台期。尽管如此,每一次我都怀有同样的亢奋和虚假希望。模型在你图表的指数曲线上继续爬升,却不交付真实世界的能力收益。

你很快会意识到,你的图表和真正重要的那张图表之间存在断层:真实世界的性能与结果。现实常常令人失望。我不是说强 RSI 不会被解决。我是说,强 RSI 唯一的检验标准是真实世界的性能。

到目前为止,我们在强自我改进前沿看到的一切:要么在一段起初很有希望的阶段之后触顶,要么是更多算力而非学习优化的结果,要么来自更好的数据/更完整的信息。

3、谷歌 DeepMind 到底突破了什么?

这个故事的源头是 X 上的一个账号。据我所能查到的,它不隶属于任何创始人、研究者、甚至任何实验室。那条帖子只是在给 GDM 的贺信里把三个字母(RSI)大写了而已。这足以驱动数百篇文章和数千条社交媒体帖子,猜测某家实验室是否已攻克强 RSI。

我们正在见证一种古老的指数扩展定律:炒作(Hype)。如果这个传闻有几分真实,它建立在这篇论文之上:《Procedural Graphs: Self-Evolving Execution Structures for LLM Agents》。其第一作者是 GCP AI 的一位应用研究者,他确实抓住了一些东西。

Sergey Brin 回归谷歌及其对 GDM 研究方向的影响,让强 RSI 重新成为重心。多位内部人士报告称,GDM 已把大量资源转向强 RSI 研究。也许他们发现了什么,也许只是增加了大量算力带来了显著进展。

猜测很多,证据为零。即便强 RSI 的主张真的出现,也要过上一段时间才能在真实世界环境中——而不是精心设计的基准——得到确认。OpenAI 最近在 Navier-Stokes 上的进展未能毫发无损地通过真实世界的审视。连作者自己都把 AI 的证明称作"AI 垃圾"(AI slop),并花了数月把它改造成数学家能读、能评估的东西。大多数评估者说它令人印象深刻,但不完整。

真实世界就是这么运转的。进步是渐进的,直到某一天它不再是。我们可能离那一天很近了,但 X 上的一条帖子不足以说服我,也不该足以激起这个量级的反响。我看到炒作在指数级扩张,但强 RSI 仍未解决。


原文链接:What Is Recursive Self-Improvement & Has It Been Solved?

汇智网翻译整理,转载请标明出处