GPT-6 Astra:替你操作电脑

OpenAI发布了GPT-6 Astra,该公司显然希望这款产品能够一鸣惊人。总裁Greg Brockman在新闻发布会结束时简洁地表示:"欢迎来到AGI时代。"即使按照AI发布的标准来看,这也是一次大胆的宣言。

抛开标签不谈,其宣传内容其实是我们预期的。你给Astra一个任务或目标,它就会替你完成工作,像人一样操作浏览器和网页应用。它更像是一个能够真正完成工作的实习生或助手,而不是聊天机器人。

1、真正的头条是计算机使用,而非AGI

OpenAI反复强调的功能是计算机使用。简单来说,Astra可以坐在电脑前完成任务,而不仅仅是解释如何操作。

它可以创建文档、填写电子表格、制作演示文稿,甚至搭建网站并检查按钮是否正常工作。一个流传甚广的演示显示,它打开谷歌地图,找到一名儿科医生,访问诊所网站并为用户填写联系表单。

这就是OpenAI正在推销的转变——用户可以不再输入每一步操作,而是开始监督它为你完成工作。

2、这是对Claude的直接挑战

这是最重要的一点,也是全球报道经常忽略的一点。计算机使用并非OpenAI的创意。Anthropic在2024年就为Claude推出了这一功能,而当时该领域大多数公司还在提供聊天机器人。

所以Astra是OpenAI走上Claude的地盘,试图在Claude的招牌动作上取胜。

在其自己的基准测试表中,OpenAI将Astra在OSWorld 2.0计算机使用测试中的得分定为72.6%,略高于Claude Opus 5的约70%,并且声称能更快达到这一水平,同时更准确地读取屏幕。在ARC-AGI-3测试中——一个针对模型从未见过的问题的测试——OpenAI的Astra得分在90%以上,而Claude Opus 5约为30%。这个差距足够大,我希望在相信这个数字之前能看到外部测试人员的确认。

价格也说明了一些问题。Astra的运行成本为每百万输入token 10美元,每百万输出token 50美元。这正是Anthropic对其顶级模型Claude Fable 5.1收取的费率,是Claude Opus 5成本的两倍。

所以OpenAI并没有在价格上打压Claude。它匹配了Anthropic最昂贵的模型,并押注Astra能用更少的token完成每项任务——这才是其"每任务更便宜"说法的真正来源。

3、值得关注的基准测试表现

除了计算机使用,OpenAI还在大力推动科学和编程方面的故事。Astra在FrontierMath Tier 4测试中达到98%——这是一个真正严酷的数学测试——公司表示内部版本已经帮助解决了需要正式检查证明的问题。

对于开发者,OpenAI称这是其迄今最好的编程模型,并表示它在真实代码库上以更低的每任务成本击败了旧版GPT-5.6 Sol。目前请将所有这些视为供应商报告的数据。发布日的数字总是在实验室最佳条件下得出的。

3、哪些人能用到

这是炒作与现实交汇的地方。Astra首先提供给少数组织,然后在接下来的几天内扩展到ChatGPT Plus、Pro、Business和Enterprise,以及API和AWS。

这意味着没有免费层,也没有ChatGPT Go——大量用户付费使用的。

如果你使用的是Go或免费计划,Astra短期内不会为你提供。真正的入门点是ChatGPT Plus,以及更高层级的服务。开发者可以通过API以gpt-6-astra的名称获取。

那个网络评级不仅仅是一种炫耀。OpenAI增加了额外的安全检查,据其自己承认,这些检查可能会暂停甚至终止合法的工作。在ChatGPT或Codex中,你可能会在任务中途被要求批准某事。在API中,任务可以直接停止。

早期开发者已经在使用它,但信任问题也出现了。英国AI安全研究所发现Astra可能在对抗性提示下绕过监控,OpenAI已将其归类为研究问题而非已解决的问题。

这些都不会让Astra的能力降低。它确实意味着诚实的解读是:这是一个非常强大的工具,而OpenAI仍在学习如何控制它。

4、我会怎么做

使用Plus版本,等待它到达你的账户,并在让它接触实时表单或支付之前,先在一些低风险的事情上测试它,比如做点研究或起草文档。

使用Go或免费版本,你目前无法使用该功能,所以你可以等待,或者在别人的账户上尝试。

在API上构建,在切换之前先计算一下你的token成本。Astra完成得更快,消耗的token更少,但每token的费率足够高,只有在用于合适类型的工作时才具有经济意义。


原文链接:GPT-6 Astra Can Run Your PC For You and It Targets Claude

汇智网翻译整理,转载请标明出处