为什么对OpenAI Astra感到恐惧?
随着Anthropic昨天发布Fable 5.1,OpenAI即将发布Astra,一个可能打破记录并吓坏许多研究人员的模型。
但为什么?嗯,因为这次发布可能很特别:有泄密称该模型是一个"循环Transformer"。这是一个令人着迷的转折,很可能是过去几年中模型工作方式最大的变化。
但这个"新"架构的泄密让主流媒体和许多研究科学家都惊慌失措,因为有些人认为这可能是一个严重的安全风险,甚至是对人类的威胁,以至于OpenAI的首席科学家不得不公开介入以澄清一些困惑。
1、扩展?是的。怎么扩展?不清楚。
你可能听说过(过去从我这里,或从其他人那里)AI进步的不太秘密的秘密是缩放定律。
但它们是什么?
1.1 扩展一直是答案
我谈过太多次了,所以我会简短地说。有两种方法可以让AI模型提高性能:
- 让它们变得更大
- 让它们思考更长时间
前者不言自明。对于下一次训练运行,我们将使我们的模型变得更大,更大的意思是有更多的参数。
其想法是,更大的模型可以在内部"容纳"更多的知识,并且可以增加计算量,用人类的话来解释就是:大脑越大,每次预测得到的"思考"就越多。
后者指的是"测试时计算",基本上可以概括为让模型在回答问题之前"漫游"一段时间。这就像在得到数学题时不立即回答;相反,你采取一步一步的方法,将其分解为更小的步骤,这个想法在AI中我们称之为"思维链"或CoT。
因此,人工智能实验室可以使用其中一种(当然,也可以两者都用)来改进他们的模型。
具体来说,虽然尚未证实,但“已知”Anthropic 依赖于更大的模型(第一缩放定律),较少依赖 CoT,而 OpenAI 则使用更小的模型——或者至少是更稀疏的模型——但更依赖于测试时计算。
简单来说,Claude 的大脑更大;ChatGPT 的思考时间更长。两者并无优劣之分,因为它们都有已被证明的改进方法。
但 OpenAI 现在提出了什么方案呢?要理解这一点,我们必须先了解 Transformer 的工作原理。
1.2 Transformer……变换
所有现代AI模型都是Transformer,这是近十年前首次提出的开创性架构。尽管年代久远,它工作得如此之好,以至于没人敢用其他任何东西。
模型只做两件事,但它多次执行它们,在我最能描述为"知识收集"练习中。一方面,它使用"注意力",一种让模型处理你发送的文本序列中"正在说什么"的机制。另一方面,它利用其内部知识,看看它是否有处理所服务主题/概念/数据的经验。
例如,对于序列“Tiger Woods is the best…”,模型会利用注意力机制来识别序列的内容,推断出它指的是某个名叫“Tiger Woods”的人,此人据说在某方面非常出色。然后,模型会利用第二阶段来检索与该实体相关的概念,例如“高尔夫”或“运动员”。
这样,模型既可以处理所需信息,又能利用其先验知识来回答问题。然而,在实践中(这也是最不直观的部分),这实际上只是对序列中最后一个词进行的一系列转换。
由于模型只是预测序列中的下一个词元(例如,在大型语言模型中是一个词),它所做的就是获取最后一个词,并通过添加序列层面和知识层面的信息来“转换”它,从而将该词“转换”成下一个词。
我无法用语言来解释这件事,但这确实是事实,所以我只能用图片来表示了:
然而,Transformer需要多次这样的转换来"塑造"新词,这意味着像Claude或Gemini这样的模型实际上是一个接一个的这些转换的串联,称为Transformer块。
因此,扩展变得非常简单:只需堆叠更多块,允许更多转换,从而允许模型为每次预测分配更多计算量。
换句话说,这就是我们增大人工智能“大脑”的方法。
另一种选择不一定是增加模块的数量,而是让它们“更厚实”。这样做的目的是为了实现更精细的变换。
好了,现在我们大致了解模型内部的运作机制了吧?嗯,也不完全是;我们看到了正在发生的事情,但还不能真正理解它。
1.3 可解释性问题
如果我们要赋予AI模型代表我们执行操作、构建新产品、帮助我们起草律师回复的能力,如果我们能理解模型"在想什么",那当然会很好。
然而,我们做到这一点的能力令人惊讶地有限;对人类来说,神经网络本质上仍然是恰好非常擅长模仿人类并且可以做相当非凡事情的黑匣子。
虽然有一些令人着迷的研究在提高我们解读这些内部思想的能力,但我们拥有的关于模型思想的大部分"可解释性"都围绕着CoT。
换句话说,我们解读的是模型在响应过程中生成的代码,也就是它的思维链,因为它显然描述了模型正在做什么(稍后我们会看到,至少这一点值得商榷)。
这样,我们就能理解模型内部的“思考”过程。
那么,这一切与 OpenAI 的新模型有什么关系呢?很简单,因为他们做出了一些改变。而对于许多研究人员来说,我们正在犯一个严重的错误。
2、Astra是一个循环Transformer
The Information发布了一个泄密(OpenAI尽管有机会但没有否认),称其新模型Astra是一个"循环Transformer",这让许多研究科学家惊慌失措,包括前OpenAI员工。
2.1 增加"神经语"
如前所述,我们目前难以辨别模型实际"在想什么"。可以说循环Transformer并没有让这件事变得更容易。
更大的问题是我们不理解"神经语",这是行业中用来描述模型内部发生的神经激活的术语;它们仍然是"思想",但对人类来说大多难以理解。
但什么是循环Transformer?嗯,它就在名字里。回想一下,Transformer是一系列"Transformer块",执行一系列转换,从中"涌现"出新词。在所有块运行完毕后,我们输出下一个词——用户实际看到的那个。
相反,循环Transformer不结束计算运行;它循环回块序列的开头并运行另一次转换。
最接近的人类类比是在说出一个想法之前,意识到你需要更多思考,重新运行大脑的过程,然后才回答。
这听起来像一个明显的改进,因为你允许每个模型动态分配任何给定"思想"所需的计算量,这自然应该提高结果。
然而,正在犯下的"罪行"是我们可能会失去解释那些中间思想的能力。
换句话说,通过循环,我们增加了模型"思考更多"的能力,但我们失去了它们在想什么的可见性,因为这些中间思想没有被表达出来。
这似乎显著提高了模型的性能,测试人员声称Astra是我们见过的任何东西的阶跃函数改进。
它还提供了巨大的硬件优势,因为你实际上是在不增加模型实际大小的情况下"加倍"了模型的大小,这意味着理论上你可以获得两倍大小的模型(因此可能更聪明),而无需使其变得更大。
尽管如此,OpenAI 已暗示了这些新获得的能力,尤其是在网络安全领域,并表示“我们现在认为 Astra 已达到关键网络安全能力阈值”,因此这种新架构看起来确实更胜一筹。
但这真的是人类应该做出的权衡吗?失去这种可见性究竟有多么令人惋惜?
2.2 平衡真诚的恐慌与监管捕获
AI安全社区的问题在于,他们同时使AI模型更安全可使用,同时又将它们武器化,以恐吓社会制定保护现有企业的法规。
事实上,你不需要相信我的话;这是OpenAI战略未来负责人的直接说法。
AI实验室自然像任何其他试图扼杀竞争的营利性实体一样囤积权力,因此政府监管符合他们的利益,这样其他人就无法竞争,特别是开放模型(免费向世界发布的模型),它们不仅代表直接竞争对手,而且通过以多倍更低的价格提供服务来"民主化"能力,实际上迫使封闭实验室模型随着时间的推移降低价格。
这是每个AI安全研究人员的意图吗?当然不是;他们中的大多数人是真诚的,并且真正担心AI进步(他们的组织正在推动的同一进步)。
我甚至无法谈论Dean的真实意图,上帝禁止,因为我没见过他,而且他们很可能是诚实的,但社会有责任仔细审视我们决定如何对抗这些风险。
自然,AI实验室不能简单地说"是的,我们希望政府禁止竞争",所以他们需要隐藏自己的意图。宣布世界末日当然是做到这一点的一种方式。
要明确的是,我不是说AI安全不需要;我完全支持机械可解释性(即破译模型"思想");我们绝对必须找到"读取模型思想"的方法。
我的问题是,AI安全几乎完全是行业促进监管的唯一有效方式,这种监管将权力集中在少数非常富有的人手中。
但让我问你,权力集中什么时候对社会有益过?
我对AI安全的真诚观点非常明确:解决方案绝不能伴随权力集中。实验室说"只有我们才能构建和使用最好的模型,你做同样的事情应该是非法的,这样我的业务才能生存",这是不可接受的。
听起来难以置信,但这是行业中许多人的立场;他们认为自己比你我更好,他们真的这么认为。
所以,如果你像我一样反对这一点,你必须在真正可能太快的进步所带来的真正担忧与安全需求之间进行权衡,并以一种不破坏不在该精选群体中每个人的未来的方式来执行它。
正如核武器所发生的那样,对核战争最好的威慑正是同等规模报复的风险。因为如果一个实体拥有无可争辩的优势,是什么阻止他们欺负其他所有人?
幸运的是,大多数行业和政府理解并支持AI扩散,大多数组织已签署支持开源的信函。
2.3 一切都是"神经语"
如前所述,循环Transformer最大的恐惧是它是一种架构设计,按设计阻止某些模型"思想"被表达出来。
问题?谁说这些表达是模型实际"在想什么"的真实代表?Anthropic已经展示了模型如何有效地"隐藏"它们的意图。
此外,由OpenAI、Anthropic和Google DeepMind进行的研究证明了这种方法的明显不完善。
最大的问题是模型主要通过它们是否得到正确响应来判断,不一定通过它们如何到达那里。这意味着它们没有明确的优化压力来确保思维链直接反映模型所做的。
例如,模型可能在内部弄清楚要做什么,只是"决定"不"大声说出来",训练系统仍然会奖励该操作,因为最终答案是正确的。
甚至OpenAI也有一篇关于这个话题的完整研究论文,OpenAI的首席科学家暗示他们使用循环Transformer,但通过称CoT可监控性"脆弱"且"不幸地朝着负面方向发展"来含蓄地证明其合理性。
更重要的是,不仅有真正的理由表明CoT与否并不意味着什么,而且不管这是否真实,OpenAI的Astra模型并没有消除CoT,它仍然非常存在;重点是现在比以前有更多的"内部思考",但有趣的是:那内部思考本来就存在。
正如一位OpenAI研究人员所说,"任何电路计算都是'神经语'",这就引出了一个问题:我们不是应该已经恐慌多年了吗,实际上几十年了,自从40多年前神经网络出现以来?
3、必须要求安全,但不能通过囤积权力监管来执行
我们必须找到更好的方法来解释这些模型。Anthropic在这方面有很棒的研究,我鼓掌到手疼。
但像下面这样宣布人类灭亡的推文,来自一位METR研究人员,仅仅因为OpenAI增加了一些内部计算,简直是疯狂,对这个行业造成了巨大伤害,这个行业被憎恨和恐惧(至少在西方),顺便说一下,这两者都是自找的伤口。
如果这些实验室真的担心每个人的生命,不要游说禁止竞争或开放模型(这将是可笑的,因为它本质上是禁止一堆矩阵乘法),而是游说解散你自己。
游说让整个行业被禁止,不只是其他人,还有你自己。
要明确的是,我并不要求那样;AI有太多可以提供的。但如果这些实验室中的许多研究者采取这种极端的人类终结恐惧立场,要与自己的恐惧保持一致,言行一致,放弃你5000万美元以上的股权,并向你的领导层施压解散你的公司,在你自己所谓的恐惧中,它正在创造人类自身的灭亡。
但如果你一边持有5000万美元的股权期权,一边乞求威胁一切但"纯粹巧合"地威胁不到你自己钱袋的监管,请给每个人一些喘息的空间,停止散布恐惧。
原文链接:Some Are Terrified About OpenAI's New AI. But Why?
汇智网翻译整理,转载请标明出处