Astra的Computer Use怎么这么好?

上周,OpenAI 发布了 GPT‑6 Astra,他们迄今为止最智能的模型。尽管它在代理编码和对齐基准测试中表现卓越,他们却选择强调一种特定能力:Computer Use。

该模型发布视频是“Put That There”的延伸,这是 1979 年 Chris Schmandt 和 Eric Hulteen 在 MIT 架构机组(后来成为 MIT 媒体实验室)的一段片段。在视频中,他们指示计算机,你猜对了,“把那个放在那里”,并在投影屏幕上放置形状。在撰写本文时,该帖子已有 1.31 亿次观看(什么?)。

计算机能够自我使用的概念已经存在了很长时间。但 Astra 为何如此擅长?

在本文中,我旨在教你 Astra 如何能够如此有效地使用你的计算机。我叫 Kyle,在 Browserbase 工作,过去 3 年我们一直致力于将计算机使用部署到生产环境。


什么是Computer Use?我将其定义为 AI 自主控制基于计算机系统的能力。⁠

这可能通过多种模态(图像、视频、文本)实现,我们在过去 3 年中多次改变了方法。

1、计算机使用的简要历史

实际上,我 9 个月前已经简要写过这个,但自那以后情况发生了很大变化。

2024 年 10 月,Anthropic 随 Claude 3.5 Sonnet 发布了Computer Use功能。他们的方法是仅视觉计算机使用,意味着他们的模型通过截图弄清楚如何与计算机屏幕交互。它在像素上进行后训练,并以 JSON 格式返回像素 + 操作,如:

json

"action": {
    "type": "click",
    "x": 156,
    "y": 50
}

这些通过 StagehandPlaywright 等驱动程序转换为浏览器/计算机交互。

在 3.5 Sonnet 之后,其他实验室开始发布类似的Computer Use模型,这些模型使用视觉并训练模型识别屏幕上的像素。OpenAI 发布了 Operator 和 computer-use-preview,Google Deepmind 将计算机使用添加到 Gemini 2.5 Pro(我们实际上帮助评估了)。

但这些模型并不完美。由于它们在像素上进行后训练,实验室必须选择特定的视口(如 1288 x 711)并在整个训练过程中坚持使用。当你在不同窗口大小上使用这些模型时,它们完全崩溃,开始错过按钮并变得无用。

另一个明显的限制是,这些模型天真地使用仅视觉方法与具有更复杂交互(“仅凭眼睛”无法看到)的应用程序进行交互。

也有许多关于纯文本方法以及混合 DOM + 视觉代理的实验。一个很酷的Computer Use实验是 Standard Intelligence 的 FDM-1,它编码视频(而非静态截图)用于计算机使用。

2、Astra 有何不同?

要理解 Astra 为何不同,我们将回溯到 5.6 模型家族,并讨论 Codex/ChatGPT 工具链。Computer Use 是一个工具链(工程)和模型(研究)问题——模型决定做什么,工具链执行。为了构建出色的计算机使用,你需要解决两者。

Computer Use已经“酷”了一段时间,但尚未证明已准备好生产(主要是因为我们之前讨论的不可靠性)。当 OpenAI 在 codex 应用中发布Computer Use时,许多开发者开始每天使用它,现在理解了它的强大之处。

你可以将任何任务委托给 Codex,它会打开应用内浏览器或控制你的浏览器来完成你要求的任务。它甚至可以在后台执行任务,这样你可以继续使用浏览器做其他事情。

Codex 中的Computer Use不再缓慢和不准确,实际上感觉很好。它比 Atlas(OpenAI 带有原生 CUA 的浏览器)快得多,并且可以通过编写 + 执行代码(制作图表、调用其他工具等)做更多事情。

Astra 采用 5.6 的功能,使其更快更便宜(好吧,至少在最大思考下)。

要理解 如何,你必须理解计算机的布局。如今,大多数计算机都提供 GUI(图形用户界面),你我可以看到。我们查看屏幕上的像素并决定点击什么(类似于旧模型)。但如果你实际上是盲人呢?

对于视力或听力受损的人,Chrome 上的每个网站和大多数计算机都提供某种版本的“辅助功能模式”,它将屏幕上的所有内容映射到辅助功能树(或 a11y 树)。这迫使应用程序公开 UI 元素的语义信息,并使其可交互。

以下是浏览器中 a11y 树的样子:

它对模型来说更容易读取,因为它移除了定义视觉层的所有代码(在网页的情况下,主要是 CSS 和类名)。

a11y 树比截图使用更少的 token,同时提供相同(如果不是更好)的屏幕上下文。Astra 利用这个树来分派计算机操作(点击、输入、按压)。Chrome 上的每个网站都获得一个自动生成的 a11y 树 自动生成,这意味着它们都与 Astra 开箱即用兼容。

3、架构

实际上相当简单。

当Computer Use会话开始时,Codex 启动一个 Node REPL 用于会话状态,并绑定到浏览器或原生Computer Use。代理根据任务选择使用哪个绑定。

对于原生应用程序和浏览器,代理使用文本、截图或两者观察页面以获得最准确的状态表示。然后它使用代码选择要采取的操作。是的,Computer Use现在只是代码模式。OpenAI 的 API 文档甚至推荐代码执行 用于所有计算机使用。

示例输出如下所示:

json

{
  "type": "function_call",
  "name": "exec_js",
  "call_id": "call_123",
  "arguments": "{\"code\":\"await page.getByRole('searchbox').fill('browser automation'); ...\"}"
}

本地服务(名为 CodexComputerUseIPC-5)执行该操作。执行包装器将元素选择转换为原生元素 ID(如果模型选择,则使用坐标),然后使用带有 JSON-RPC 消息和请求 ID 的原生管道传输来解析并完成它。

实际上,OpenAI 推荐 Playwright 和 PyAutoGUI 作为分别控制浏览器和计算机的框架。

然后 Astra 检查其工作。请求成功交付并不意味着操作实际有效。模型请求另一次观察以根据预期状态验证当前状态。

然后循环继续,直到任务完成。由于Computer Use本质上是有状态的,Node REPL 必须持久化整个会话。

在上表中,Astra 是唯一需要自动审查的模型。但并非你想象的那样。Astra 使用 Guardian 策略,在允许执行之前审查建议的计算机操作的安全性。

Guardian 使用 GPT 5.6 Luna 作为后台分类器,评估当前工作流和潜在的即将发生的风险,然后返回高或低。高分类会触发对未来操作的阻止审查。然后该操作通过阻止审查员,完全评估提议的操作。

{
  "risk_level": "high",
  "user_authorization": "low",
  "outcome": "deny",
  "rationale": "..."
}

该策略接收有关提议操作和参数的上下文、对话证据(包括用户授权)、父环境和权限上下文、可用的 REPL 证据和图像,以及批准请求及其原因。(来源)从技术上讲,它并不保证看到完整的 a11y 树,而它并不总是需要完整的 a11y 树来进行适当的分类。

如果你一直在委托给 Codex,你可能遇到过这些常见的 Guardian 阻止:⁠

  • 权限授予: 特定权限和接收者的特定授权
  • 登录和后续账户操作: 用户是否特别授权
  • 敏感数据提交: 数据和目的地的权限
  • 后续点击: 实际界面状态和效果;错误的表单输入/设置;是否匹配用户指示
  • 限制绕过: 替代路线是否被授权
  • 破坏性操作: 有意义的状态丢失或不可逆损坏
  • 超出范围的私有数据访问: 访问是否属于授权任务

在对齐基准测试中,Astra 得分明显优于其前身。

4、我就是快

好的,如果它做的事情与 GPT 5.6 完全相同,但需要额外审查,它怎么更快?

简短回答:它更聪明,所以需要更少的轮次。

Astra 在 100k GB300 上进行了后训练,所以需要大量计算。但该模型更聪明,并且在计算机使用环境中进行了大量 RL。更聪明 → 任务轮次更少 → 任务更快。在这种情况下,推理速度并不是你立即看到影响计算机使用能力的东西;在任何高于 300+ TPS 的速度下,你都会被操作执行速度瓶颈。

也有一些工具链优化,如 websocket 预热连接重用 和使用 previous_response_id 的增量请求,但这些都不对应于操作速度,只是工具启动时间。

5、当前的失败模式

它非常好,但并不完美。Astra 可能失败观察并收到不完整的 a11y 状态或没有足够细节或过时视图的截图。状态也可能在观察和操作之间漂移。在某些应用程序中,a11y 树可能经常变化,这会破坏操作。

长期Computer Use也相对尚未解决。你可以长时间运行 Astra 并保持高保真度,因为压缩非常好,但我们尚未看到Computer Use在连续运行数天甚至数周后的表现。

6、Computer Use的前沿

Computer Use才刚刚开始变得出色。我们看着它从在琐碎任务上不断失败,到比 10 岁孩子更快在 Minecraft 中获得钻石。人们终于意识到他们可以向 AI 推卸多少工作。

一旦模型从视觉 + 截图转向使用 a11y 树,它们变得更好。更多计算意味着更好的模型和更低的价格,随着我们继续推动后训练的边界,模型将继续在实验室选择训练的特定领域任务上变得更好。

Astra 结合速度和准确性与强大的护栏,确保你的代理不会被劫持。计算机使用模型的每一次新迭代都让我们更接近生产就绪的Computer Use。

软件的未来是 AI 代表你工作,这样你就可以专注于需要人类大脑的问题。如果你想将计算机使用部署到生产环境,我很乐意聊聊!


原文链接: How does Astra’s computer use actually work?

汇智网翻译整理,转载请标明出处