Astra 的计算机使用功能究竟是如何工作的?
GPT-6 Astra 通过读取无障碍树而非纯视觉像素,结合代码执行与 Guardian 安全审查,实现了更快、更准、可生产的计算机使用。

上周,OpenAI 发布了其迄今最智能的模型 GPT‑6 Astra。尽管它在智能体编码和对齐基准测试中表现出色,但他们却选择突出一个特定能力:计算机使用。
该模型的发布视频是“把它放在那儿”的延伸——这是1979年的一段剪辑,主角是麻省理工学院建筑机器小组(后来成为麻省理工学院媒体实验室)的 Chris Schmandt 和 Eric Hulteen。在视频中,他们指示计算机,你猜对了,“把它放在那儿”,并在投影屏幕上放置形状。截至撰写本文时,该帖子已有1.31亿次观看(什么?)。
计算机能够自我使用的概念由来已久。但 Astra 为何能如此擅长于此?
在这篇文章中,我旨在精确地教你 Astra 如何能如此有效地使用你的计算机。我叫 Kyle,在 Browserbase 工作,过去三年我们一直致力于将计算机使用部署到生产环境中。
计算机使用到底是什么?我将其定义为 AI 自主控制基于计算机系统的能力。
这可能通过多种模态(图像、视频、文本)实现,而在过去三年中,我们已多次改变方法。
计算机使用简史
实际上,我在9个月前已经写过相关文章,但自那以来发生了很多变化。
2024年10月,Anthropic发布了搭载Claude 3.5 Sonnet的计算机使用功能。他们的方法是纯视觉计算机使用,即模型通过截图来学习如何与你的电脑屏幕交互。它基于像素进行后训练,并以JSON格式返回像素及操作,例如:
“action”: {
“type”: “click”,
“x”: 156,
“y”: 50
}这些操作通过Stagehand或Playwright等驱动程序转化为浏览器或计算机交互。
在3.5 Sonnet之后,其他实验室也开始发布类似的计算机使用模型,这些模型利用视觉并训练识别屏幕上的像素。OpenAI发布了Operator和computer-use-preview,Google Deepmind在Gemini 2.5 Pro中加入了计算机使用功能(我们实际上帮助评估了该功能)。
但这些模型并非完美无缺。由于它们基于像素进行后训练,实验室必须选择特定的视口(如1288 x 711),并在整个训练过程中保持一致。当你在不同窗口尺寸下使用这些模型时,它们会完全失效,开始漏掉按钮,变得毫无用处。
另一个明显的局限是,这些模型天真地采用纯视觉方法来与应用程序交互,而这些应用程序往往具有更复杂的交互,仅靠“眼睛”无法察觉。
目前已有大量关于纯文本方法以及混合DOM加视觉代理的实验。一个有趣的计算机使用实验是Standard Intelligence推出的FDM-1,它编码视频(而非静态截图)用于计算机使用。
Astra 有何不同?
要理解 Astra 的独特之处,我们得回溯到 5.6 模型家族,并谈谈 Codex/ChatGPT 的操控框架。计算机使用既是一个框架(工程)问题,也是一个模型(研究)问题——模型决定做什么,框架负责执行。要打造出色的计算机使用体验,两者缺一不可。
计算机使用功能火了一阵子,但尚未证明其能胜任生产环境(主要归因于我们之前提到的不可靠性)。当 OpenAI 在 Codex 应用中发布计算机使用功能时,许多开发者开始日常使用,并逐渐认识到它的强大潜力。
你可以将几乎任何任务委托给 Codex,它会打开应用内浏览器或控制你的浏览器来完成你交代的事情。它甚至能在后台执行任务,让你可以继续用浏览器处理其他事务。
Codex 中的计算机使用功能非但不慢不准,反而体验流畅。它比 Atlas(OpenAI 自带原生 CUA 的浏览器)快得多,并且通过编写和执行代码能完成更多任务(如制作图表、调用其他工具等)。
Astra 在 5.6 的能力基础上,让它们更快、更经济(至少在深度思考模式下如此)。

要理解如何做到,你得先了解计算机的布局。如今,大多数计算机提供你我都能看到的 GUI(图形用户界面)。我们看着屏幕上的像素,决定点击哪里(这与旧模型类似)。但如果你真的看不见呢?
对于视力或听力受损的人士,Chrome 上的每个网站以及大多数计算机都提供某种无障碍模式,该模式将屏幕上的所有内容映射到一棵无障碍树(即 a11y 树)。这迫使应用为 UI 元素暴露语义信息,并使其可交互。
以下是浏览器中 a11y 树的示例:

对模型来说,阅读起来要容易得多,因为它去掉了所有定义视觉层的代码(在网页的情况下,主要是 CSS 和类名)。
无障碍树使用的 token 比截图少,同时提供相同(甚至更好)的屏幕上下文。Astra 利用这棵树来派发计算机操作(点击、输入、按键)。实际上,Chrome 上的每个网站都会自动生成一棵无障碍树,这意味着它们都能与 Astra 开箱即用。
架构
其实相当简单。

当一次计算机使用会话开始时,Codex 会启动一个 Node REPL 来维护会话状态,并绑定浏览器或原生计算机使用。代理会根据任务选择使用哪些绑定。
对于原生应用和浏览器,代理都会通过文本、截图或两者结合来观察页面,以获得最准确的状态表示。然后,它通过代码来选择要采取的行动。没错,计算机使用现在只是代码模式。OpenAI 的 API 文档甚至推荐所有计算机使用场景都采用代码执行。

一个示例输出如下:
{
"type": "function_call",
"name": "exec_js",
"call_id": "call_123",
"arguments": "{\"code\":\"await page.getByRole('searchbox').fill('browser automation'); ...\"}"
}本地服务(名为 CodexComputerUseIPC-5)执行该操作。执行包装器将元素选择转换为原生元素 ID(如果模型选择,也可以是坐标),然后使用带有 JSON-RPC 消息和请求 ID 的原生管道传输来解析并完成它。
实际上,OpenAI建议使用Playwright和PyAutoGUI作为分别控制浏览器和计算机的框架。
随后,Astra会检查其工作成果。仅仅因为请求成功送达,并不意味着操作真的生效了。模型会请求另一次观察,以验证当前状态是否与预期状态相符。
然后,循环会持续进行,直到你的任务完成。由于计算机使用本质上是带状态的,Node REPL必须保持整个会话的持久性。
在上表中,Astra是唯一需要自动审查的模型。但这并非你所想的那样。Astra采用了一种Guardian策略,该策略在允许执行建议的计算机操作之前,会先对其安全性进行审查。
Guardian使用GPT 5.6 Luna作为后台分类器,评估当前工作流程及潜在的未来风险,然后返回高或低的结果。高分类会触发对未来操作的阻塞性审查。随后,操作会经过一个阻塞审查器,该审查器会对提议的操作进行全面评估。
{
"risk_level": "high",
"user_authorization": "low",
"outcome": "deny",
"rationale": "..."
}该策略会接收关于提议操作及其参数、对话证据(包括用户授权)、父环境与权限上下文、可用的REPL证据和图像,以及审批请求及其原因等上下文信息。(来源)从技术上讲,它并不保证能看到完整的无障碍树,而进行恰当分类时也并非总是需要它。
如果你一直在把任务委托给 Codex,那你很可能遇到过这些常见的 Guardian 拦截项:
- 权限授予: 针对权限和接收者的具体授权
- 登录及后续重要账户操作: 用户是否明确授权了这些操作
- 敏感数据提交: 对数据和目标地址的双重许可
- 关键点击: 实际界面状态及效果;错误的表单输入/设置;是否与用户指令一致
- 绕过限制: 替代路径是否已获授权
- 破坏性操作: 有意义的损失或不可逆的损害
- 超出范围的私有数据访问: 访问是否属于授权任务范畴
在对齐基准测试中,Astra 的表现显著优于其前代产品。

我即速度
好吧,如果它和 GPT 5.6 做的事情完全一样,却多了一道审查,那它怎么会更快呢?
简单回答:它更聪明,所以执行任务所需的轮次更少。

Astra 是在 10 万块 GB300 上进行了后训练,所以消耗了大量算力。但该模型要聪明得多,并且在计算机使用环境中经历了大量强化学习。更聪明 → 完成任务所需轮次更少 → 任务完成更快。在这种情况下,推理速度并不会直接显著影响计算机使用能力;在超过 300+ TPS 的情况下,瓶颈会出现在操作执行速度上。
此外还有一些工具链层面的优化,比如WebSocket 预热、连接复用,以及利用 previous_response_id 实现的增量请求,但这些都只影响工具启动时间,与操作速度无关。
当前的失败模式
它表现确实出色,但并非完美。Astra 可能在观察时失败,获取到不完整的无障碍状态、细节不足的截图,或过时的视图。状态也可能在观察与操作之间发生漂移。在某些应用中,无障碍树可能频繁变化,从而破坏操作。
长时间跨度的计算机使用问题也仍未完全解决。由于压缩机制非常高效,你可以让 Astra 以高保真度长时间运行,但我们尚未验证它在连续运行数天甚至数周后的表现如何。
计算机使用的前沿
计算机使用才刚刚开始变得好用。我们见证了它从在琐碎任务上频频失败,到在《我的世界》中比10岁小孩更快挖到钻石。人们终于意识到,他们可以把多少工作交给AI。
一旦模型从视觉加截图转向使用无障碍树(a11y tree),它们就变得好多了。更多的算力意味着更好的模型和更低的价格,而随着我们不断突破后训练的边界,模型在实验室选择训练的特定领域任务上会持续进步。
Astra将速度与准确性结合,并配备强大的防护措施,确保你的智能体不会被劫持。每一代新的计算机使用模型都让我们更接近可投入生产的计算机使用。
软件的未来是AI替你干活,这样你就能专注于那些需要人脑解决的问题。如果你想将计算机使用部署到生产环境,我很乐意聊聊!
→ Kyle
如果这些内容对你有帮助或让你觉得有趣,我将非常感谢你的关注和分享。我的私信随时开放,欢迎提问或反馈。
来源:
