GPT-6 Astra 代码审查评测

最大的跃升出现在更困难的跨文件审查中,Astra 的收益达到 20% 超过 Sol,33% 超过 Opus 5。在客户规模上使用这种能力也意味着保护客户数据并评估模型的公共 API 定价。

GPT-6 Astra 代码审查评测
梯形图转SCL | 博途AI辅助编程文档 | AI模型价格对比 | AI工具导航 | ONNX模型库 | Vibe Coding教程 | PLC在线仿真器 | Tripo 3D | Meshy AI | ElevenLabs | KlingAI | ArtSpace | Phot.AI | InVideo
CodeRabbit 对 OpenAI GPT-6 Astra 的模型评测,白色 CodeRabbit 标志与深绿色网格:代码审查的收益、隐私与成本。

代码审查中最困难的工作往往发生在修改的代码行之外。一个更改在孤立状态下可能看起来正确,却可能在系统的其他地方引发问题。

这正是我们早期对 OpenAI 的 GPT-6 Astra 评估结果最引人注目的原因。在我们的评估中,Astra 通过可操作的发现捕获了约 4% 更多的标记缺陷,相比 GPT-5.6 Sol,以及 22% 更多相比 Opus 5

最大的跃升出现在更困难的跨文件审查中,Astra 的收益达到 20% 超过 Sol,33% 超过 Opus 5。在客户规模上使用这种能力也意味着保护客户数据并评估模型的公共 API 定价。

1、Astra 为代码审查带来的改进

我们的衡量标准是可操作缺陷覆盖率,即模型通过开发者可采取行动的发现捕获了多少标记缺陷。

整体可操作缺陷覆盖率(0–100% 刻度):GPT-6 Astra 61.3%,GPT-5.6 Sol 59.0%,Opus 5 50.2%。Astra 排名第一,以橙色高亮显示。

覆盖率四舍五入到一位小数;相对收益使用未四舍五入的值。

在整体评估中,相比 GPT-5.6 Sol 的收益显得较为温和。此评估还包括更简单的审查,其中更强的模型可能没有太多差异化空间;Astra 的更大优势出现在更困难的跨文件子集中。这是一个早期的、方向性的结果。

跨文件可操作缺陷覆盖率(0–100% 刻度):GPT-6 Astra 57.1%,GPT-5.6 Sol 47.6%,Opus 5 42.9%。Astra 排名第一,以橙色高亮显示。

覆盖率四舍五入到一位小数;相对收益使用未四舍五入的值。请在此图表内比较模型,因为其审查难度与整体评估不同。

更困难的跨文件比较更令人鼓舞。Astra 的相对优势增长到 20% 超过 Sol,33% 超过 Opus 5。这表明将更改的意图与分布在代码库中的后果联系起来具有价值。

这些结果描述了审查性能的一个方面。它们并未建立审查质量的总体排名、预测团队的缺陷率,或承诺在每个拉取请求上都能获得相同的收益。

2、利用上下文进行推理

大的上下文窗口为信息提供了空间。有用的推理需要模型识别哪些信息重要,将它们联系起来,并得出有证据支持的结论。

我们的解释是,Astra 最有趣的进步在于连接正确的信息。它在更困难的跨文件审查中更大的收益表明,在信息分布广泛的工作上取得了进展。这些并未孤立出这种进展的原因,或证明更多的上下文单独就能提升模型性能。

OpenAI 将 Astra 定位为 跨代码、浏览器和专业软件的多步工作

对于使用模型的团队,有用的问题是额外的推理在何时改变结果足以证明其成本合理。一个具有分散证据的困难任务比一个不太昂贵的模型已经可靠处理的常规任务更值得调查。这并不意味着将每个会话切换到 Astra,将推理 effort 调到最大,然后任其运行。

3、更强的推理能力代价不菲

Astra 的标准 API 费率为 每百万输入 token 10 美元,每百万输出 token 50 美元,根据 Astra 公布的定价Fable 5.1 具有相同的基础输入和输出费率,尽管缓存价格不同。Anthropic 的定价文档 提供了完整的细分。

为了将这些价格置于背景中,请考虑一个使用 100,000 个未缓存输入 token 和 10,000 个可计费输出 token(包括推理 token)的说明性任务。保持 token 使用量恒定使得公布的费率更容易比较;实际任务成本随使用量而变化。

固定 token 使用量下的估计 API 成本:GPT-6 Astra $1.50,GPT-5.6 Sol $0.60,GPT-5.6 Terra $0.32,GPT-5.6 Luna $0.032。Astra 排名第一,以橙色高亮显示。

所有数字均使用公开列出的标准 API 价格,截至 2026 年 9 月 4 日核实。OpenAI 数字使用短上下文费率。Sol 的公开促销价至少在 2026 年 11 月 21 日前可用。示例不包括缓存、缓存写入、工具、重试、区域上浮和服务层级调整。实际任务可能使用不同数量的 token。

模型 每百万输入 token 每百万输出 token 说明性任务成本
GPT-5.6 Luna $0.20 $1.20 $0.032
GPT-5.6 Terra $2.00 $12.00 $0.32
GPT-5.6 Sol $4.00 $20.00 $0.60
GPT-6 Astra $10.00 $50.00 $1.50
Claude Fable 5.1 $10.00 $50.00 $1.50

在固定使用量下,Astra 的成本是 Sol 的 2.5 倍,约 Terra 的 4.7 倍,约 Luna 的 47 倍。这些是显著的溢价。它们并非预测每个完成任务的成本差异。需要更少 token 或更少尝试的模型可以缩小差距。

OpenAI 在其自身的一些评估中报告了 Astra 更低的估计任务成本,尽管 token 价格更高。这使得每个成功结果的总成本值得在你的工作中测量,而不是假设 token 价格或能力分数决定决策。阅读 OpenAI 的效率指南

4、可能超越代码审查的迁移应用

可迁移的思想是跨独立来源的关系推理。我们的发现表明 several 种值得评估的用途;我们尚未在这些任务上测量 Astra:

  • 研究综合: 协调冲突的报告,将主张与其证据联系起来,并识别每篇文档摘要会遗漏的差距。
  • 操作调查: 从日志、事件笔记和操作手册中组装连贯的解释,同时区分观察和假设。
  • 需求和策略分析: 跟踪拟议更改跨越规范、内部策略和实施计划,标记不一致之处供专家审查。
  • 文档和电子表格工作: 检查假设、公式和叙述结论是否在报告及其支持材料之间一致。

共同结构是分散的证据及其部分之间的依赖关系。从答案可以检查的有界工作开始。测试 Astra 是否适合你的工作流程或产品的最简单方法是在相同任务上同时运行它与你当前的模型,然后比较答案质量、验证时间和总成本。

5、构建与平衡 NIGHTSHIFT

我们还使用 Astra 构建了一款完整的游戏:NIGHTSHIFT,一款使用 Godot 和 GDScript 制作的动作角色扮演游戏。其最困难的问题是平衡系统之间的交互,然后随着游戏的变化重新审视这种平衡。

NIGHTSHIFT 标题屏幕,玩家角色与发光的橙色丝状物。

NIGHTSHIFT,通过人类指导和迭代使用 Astra 构建。

这意味着跨七个职业、一个 988 节点被动技能树 受传奇的《流放之路》被动节点树启发、主动技能、符文和可镶嵌升级、技能进化以及合作进行推理。在 10 个章节的 40 个区域中,战役引入了越来越复杂的敌人蜂群和组合。更改一个职业也可能改变哪些升级有用、技能如何发展以及团队能应对什么。

我们在开发过程中对核心系统进行了根本性更改,并要求 Astra 处理后果并重新平衡它们。在这种游戏中,“平衡”是引人入胜的游戏玩法最困难的创造性挑战。如何进行大规模更改或引入全新的游戏系统和机制,同时保持进度、战斗和难度连贯?

我们还希望通过职业、属性、物品、被动技能和主动技能的巧妙组合,让玩家发现超强力的终局构建。挑战在于塑造一个进度,其中达到中期游戏甚至不确定,但创造性和实验性可以以壮观的方式获得回报。找到这些组合的回报是逐步构建一个可以令人满意地融化敌人蜂群的构建。

这个过程意味着在其他工作间隙回到游戏,给 Astra 反馈,并给予它完全自主权来运用其判断力来完善平衡。Astra 还构建了原生 PS5 和 Xbox 控制器支持、原生 macOS、Web 和 Linux 构建以及合作。合作特别有趣,因为 Astra 能够为在同一计算 LAN 上玩游戏而构建,由于我们想分发给使用 macOS 的同事,这需要生成新的 Xcode 项目、App Store Connect 账户、建立多个证书和权限以及公证。

Astra 全自主处理了这一切,只在偶尔需要它没有的权限和授权时暂停。作为一个有趣的奖励,游戏也为代理本身作为玩家而构建,能够与 Astra 作为队友进行实时合作会话有些超现实。我们中的一些人发现很难放下。“我正在进行模型评估”成为当经理路过时游戏开着的有用解释。

一个早期的 NIGHTSHIFT 街机原型,在 18 秒自动游戏演示中展示。

游戏为我们提供了一个创造性的环境,来探索在代码审查中突出的相同能力。Astra 必须推理每个更改如何影响系统的其余部分。

6、我们期待的下一步

下一个令人兴奋的进步将使这种推理深度足够可靠,以便更频繁地使用。这意味着在困难工作中持续获得收益,人们可以验证的结论,以及成功结果更低的总成本。

这需要更好地选择相关上下文、更清晰的支持证据和更少不必要的步骤。这也意味着隐私保护部署路径,使高级功能在真正的客户承诺下可用。

Astra 给了我们一个关于跨文件推理的令人鼓舞的信号。实际机会是将这种能力转化为更有用且更易信任的工作。


原文链接: GPT-6 Astra in code review: Gains, privacy, and cost

汇智网翻译整理,转载请标明出处