主流AI模型的相似度研究

Arena 的 Battle Mode 让我们能够比较两个模型对同一用户提示的回答。这使得我们不仅可以衡量偏好,还可以衡量它们在概念上共享多少共同基础。

我们审查了 2026 年 5 月 1 日至 9 月 2 日期间提交的 30,086 对针对相同真实世界 Text Arena 提示的 AI 回答。以下是我们关于模型相似度的发现。

主要发现:

  • 不同的 LLM 覆盖不同的领域。模型仅共享 43.1% 的想法。
  • 同一模型家族的相邻代际会相互呼应。Grok 4.5 和 Grok 4.6 共享 59.7% 的想法,GPT 5.5 和 GPT 5.6 共享 59.2%。
  • 美国和中国模型汲取相同的想法。Fable 5 和 GLM 5.3 共享 55.9% 的要点,GLM、Kimi、Opus 和 Sonnet 形成一个更高重叠的邻域。
  • 支付更高的 token 价格并不能买到不同的视角。Fable 5 和 DeepSeek V4 Pro 价格相差 12 倍,但共享 59.2% 的想法。
  • 模型在思维方式上正在趋同。大多数最新发布的模型比其前代版本更频繁地覆盖相同的想法。

1、模型输出的变化比你可能预期的更大

为了捕捉模型响应内容的相似程度,我们定义了一个名为“概念相似度”(conceptual similarity)的指标。这种方法将用户-AI 交互提炼为两个独立 LLM 对同一查询所提出的五个关键要点,并估计这十个要点之间的重叠。

平均而言,一场对战中识别出的约四成不同要点出现在两个响应中。尽管前沿模型遵循相似的训练配方,我们可以注意到它们经常选择可用想法中的不同子集。
例如,两个模型在被要求提供煎饼食谱时可能覆盖相同的步骤,但第一个可能决定推荐配料,而另一个可能包括要避免的错误。

这种差异在相邻模型代际中被缩小——它们往往导致有限的第二意见。Grok 4.5 和 Grok 4.6 共享 59.7% 的想法,而 GPT 5.5 和 GPT 5.6 共享 59.2%。这些配对在目标是验证时可能有用,但提供的概念范围相对较小。

观察到的最高重叠是在 Kimi K3 和 Muse Spark 1.2 之间,为 63.5%。在另一极端,字节跳动的 Dola Seed 2.0 Pro 尤其与众不同,在其观察到的配对中平均约为 31.1%。

2、美国和中国模型思考方式相似

鉴于同一实验室发布的模型之间关系更密切,我们可能也预期看到美国发布的模型与国外发布的模型之间有更强的联系。

然而,事实证明模型相似度跨越了国界。GLM、Kimi、Opus 和 Sonnet 占据同一个更高重叠的邻域,而不是形成孤立的美国和中国阵营。当叠加与三个 Claude 模型的重叠时,这一点尤其明显。

虽然具体原因很难确定,但前沿的概念相似度可能只是源于模型共享其核心训练材料以及最近跨实验室的关注焦点。

3、模型重叠正在增长

这种相似度也在上升。将每个发布与之前出现在 Battle Arena 中的模型进行比较,显示概念重叠已经增长。例如,Muse Spark 1.2 (xHigh) 与早期模型的概念重叠高于 Muse Spark 1.1——48% 对 45%。

整体图景还表明,产生意外响应的可能性可能正在下降,而下一代低成本模型可能会将稳健性的门槛提得更高。

另一方面,在某些场景中,“回归均值”可能是个问题。例如,与一组代理一起头脑风暴一本书章节,或寻找在新地理市场营销某品牌谷物的创新方式。

4、创意工作从第二视角中获益最多

幸运的是,任务类型会大幅改变模型重叠,并且方向上同时兼顾想法的探索和利用。

医学和医疗保健产生了最相似的回答,为 51.1%,其次是生命和社会科学的 49.1%,以及法律和政府的 48.9%。在另一端,创意写作产生了最不相似的回答,为 34.9%。娱乐和媒体紧随其后为 36.8%,编码为 39.7%。

由于受约束的任务倾向于包含更窄的事实或程序集,模型会趋同。相反,开放式任务给模型更多空间选择自己的框架和例子,回答之间的多样性也高得多。

5、支付更多并不能带来更好的头脑风暴

如果探索而非利用才是关键呢?数据表明,一旦一个前沿模型提供了坚实的基础,使用另一个 SOTA 模型来扩展它的回报很差。

例如,在有 Fable 5 回答可用的地方,使用 MiniMax M3 比启动 Opus 5 能产生更多想法。同样,伴随它使用 Mistral Medium 3.5 的回答会比使用 GPT 5.6 Sol 提供每美元更多的想法。

其中一个局限是想法可能质量不等。然而,一旦由人类专家审查,它们的多样性很可能激发更多横向思维,而这最终是创意任务所需要的。最优的做法是将一个前沿模型与一个较小但仍然稳健的 LLM 配对。

6、方法论

6.1 数据

分析涵盖了 2026 年 5 月 1 日至 9 月 2 日记录的 30,086 次 Text Arena 比较。它聚焦于英语提示,并包括 Battle 和 Direct Battle 交互。

6.2 方法

LLM-as-a-judge 从每个模型的回答中提取最多五个支持的关键想法。第二次 judge 通过审查两个原始回答和合并的想法,将每个想法分组为两个模型共享、仅存在于 A 或仅存在于 B。完整判断在模型顺序反转后重复进行,以减少顺序效应。这些判断的平均值构成了本分析的基础。

对于每次比较:

概念相似度 = 共享想法 / (共享 + 仅 A + 仅 B 想法)

分数为 1 意味着每个支持的想法都被共享;分数为 0 意味着没有共享。

7、两个显示重叠含义的真实世界例子

  • 撰写在线文章

用户要求一篇关于在 MacBook 上解压文件夹的 SEO 优化文章。DeepSeek V4 Pro High 和 Fable 5 High 产生了高度对齐的响应,包括相似的结构。它们少数差异很窄:DeepSeek 指出 macOS 缺乏对某些归档格式的原生支持,而 Fable 强调了如文件损坏等失败情况。

概念相似度分数为 0.833。第二个回答大多验证了第一个。

  • 起草 HR 政策邮件

用户要求一封沟通 HR 医疗政策变更的邮件。Opus 5 High 讨论了登记的家庭成员、PTO 保护以及发送消息前要解决的问题清单。GLM 5.3 Max 则提出政策可能如何影响已经在休 PTO 的员工。

概念相似度分数为 0.106。两个回答都没有简单重复对方。合在一起,它们揭示了更广泛的政策风险集。


原文链接:The model most similar to Fable isn’t Opus. It’s not Sonnet either.

汇智网翻译整理,转载请标明出处