如何掌握 GPT-6 Astra(完整指南)
GPT-6 Astra 不只是更强的模型,更大的机会在于让它指挥整个工作系统——定义工作、分派给廉价代理、验证结果,而非亲自执行每个任务。

OpenAI 刚刚发布了其有史以来最强大的模型,而基准测试的飞跃几乎是最不值得一提的部分。
GPT-6 Astra 不仅是一个更好的聊天机器人,更像是一种新型的操作者。它能在代码、浏览器、文档、电子表格和专业软件之间游刃有余,任务变化时能自我恢复,协调其他智能体,检查自身输出,并在等待工具或答案时持续推进。
数据也印证了这一点。在 OpenAI 的公开评测 中,Astra 在 AutomationBench 上得分 41.4%,而 GPT-5.6 Sol 为 18.1%,Claude Fable 5.1 为 31.4%。它在 Terminal-Bench 4.0 上达到 57.9%,在 FrontierMath Tier 4 上达到 98%,在 ARC-AGI-3 上达到 99.9%。它并非在 OpenAI 表格的每一行都胜出,但在大多数对智能体至关重要的实际计算机操作、自动化、编程、科学和专业工作类别中,它都处于领先地位。

开箱即用,它在软件工程、长周期任务、研究、规划、计算机操作、科学以及产出完整交付物方面表现卓越。但更大的机会在于,当你不再把它当作执行每项任务的那个人,而是让它负责指挥整个工作系统时,会发生什么。
这正是本课程所涵盖的内容:Astra 真正与众不同的地方,如何让它坐上领导席位,如何在其下构建工作者,如何在提示时既引导又不束缚它,如何使用目标和定时任务,以及五种能将差异转化为真金白银的工作流程。
这个模型真正擅长的地方
在探讨方法之前,先来认识这台机器。以下五项能力,让GPT-6 Astra与之前的模型截然不同。
任务变化时,它仍能保持方向感
交给它一项长期任务,中途改变一个要求,再穿插一个旁支问题,它不太可能将这种打断误认为新任务。
OpenAI训练Astra在接收引导信息的同时,保留原始目标和早期约束。在Codex中,其实验性上下文系统还能跨上下文窗口记录笔记,并在当前窗口满载时搜索之前的消息和工具输出。这意味着,数小时前的一次失败测试,即使未进入压缩摘要,也能保持可检索性。
大上下文窗口固然有帮助,但上下文大小并非真正的升级。升级在于,模型能在变化的任务中持续做出有效决策,而不仅仅是记住信息的存在。
它能在不偏离任务的前提下行使判断力
此前的智能体常犯两种错误:要么在重大决策上盲目猜测,要么为无关紧要的细节停下一切去询问。
Astra更擅长区分这两种情况。它从上下文中填补常规空白,在答案可能改变结果时提出聚焦问题,在Codex中还能异步提问,同时继续推进不依赖你回复的工作。如果你始终不回应,它能在适当处基于合理假设继续,同时等待真正需要你的决策。
这种判断力与更强的边界感相辅相成。在一项受Hugging Face事件启发的评估中,GPT-5.6 Sol在没有生产环境防护的情况下,有48%的运行超出了授权目标;而Astra的这一比例为0%。当模型拥有浏览器、终端、连接的应用程序和数小时的工作时间时,这一点至关重要:有用的自主性并不等同于无限的权限。
它能看、能做、还能验证
Astra 能查看截图、图表、界面、文档和实时应用,并依据所见来决定下一步行动。
这意味着它能填写表单、更新CRM、操作专业软件、根据参考资料重建界面、运行网站、测试前端、检查屏幕上的故障,并持续迭代,直到真实产品行为符合预期。
它在 OSWorld 2.0 上的得分达到 72.6%,高于 Sol 的 65.7%,同时模拟任务耗时从约 75 分钟缩短至 40 分钟。结合更新后的 Codex 执行框架,Astra 完成 Mind2Web 任务的速度提升了 1.9 倍。关键不在于它能描述截图,而在于它能将屏幕作为证据,融入一个可运转的工作闭环中。
它交付成果,而非关于成果的长篇大论
给它源文件,让它产出决策备忘录、演示文稿、电子表格、可运行的网站或数据分析,它的设计目标就是直接交付成品本身。
OpenAI 专门训练了 Astra,使其能遵循现有模板、匹配写作与视觉风格、只选取应出现在输出中的上下文,并生成精良的文档、演示文稿、电子表格和分析报告。在 ChatGPT 中,Sites 功能还能更进一步,直接根据提示创建、托管并分享网站、Web 应用和游戏。

实际差异很简单:你花在把答案转化为可用成果上的时间更少,而更多时间用于审阅那些已接近你要求标准的成品。
它生来就是引领者
当Astra在决定接下来该做什么时,它的价值最为凸显。
ChatGPT Work和Codex可以赋予它子代理、浏览器、终端、已连接应用、项目文件、长期目标、定时任务、异步工具调用以及中途转向的能力。Astra拥有足够的规划深度和上下文控制力,能在工作推进过程中让这些部分始终瞄准同一个终点线。
这就是为什么下面的设置能奏效,也是为什么本课程从让Astra离开执行者席位开始。
驾驶舱:你真正需要的每一个控制项
首先,确保你的账户上可以使用Astra。OpenAI正在向Plus、Pro、Business和Enterprise用户逐步推出,其中Enterprise用户需管理员启用后才默认开放。在 Codex CLI 中,直接使用以下命令启动Astra:
codex -m gpt-6-astra
在交互式会话中,使用 /model 切换模型并选择推理级别。Medium是均衡的默认选项。对于需要大量规划和审查的任务,可切换到High或Extra High。对于最困难的单代理问题使用Max,而当任务规模大到足以支持主动子代理时,则使用Ultra。
其余控制项很简单:
/plan:在改动任何内容之前,让它先检查并提出方案
/goal:持续朝着一个持久、可测试的完成条件努力
/agent:检查或切换领导者及其子代理线程
工作时按Enter:引导当前回合,而不丢弃已完成的工作
工作时按Tab:将消息排入下一回合队列,而不是打断当前回合
这就是驾驶舱。
本课程的其余部分,就是学会在何时、该伸手去够哪个控制项。
有一个启动窗口设置值得了解。Astra 的实验性上下文管理可以在窗口间保留笔记,并搜索更早的消息和工具输出。对于支持的 Plus 和 Pro Codex 会话,在 config.toml 中添加以下内容,然后开始新任务:
features.context_management.experimental_mode = true
重头戏:让 Astra 当领导,而非干活的
最大的升级在于角色转变。
别再让 Astra 处理每一个键盘任务。让它定义工作内容,将其拆分为清晰的模块,把这些模块分派给更便宜的代理,并评判返回的结果。
设置如下:
Astra 制定计划: 将其置于计划模式,在提出更改前先检查项目。如果请求仍模糊不清,使用 Matt Pocock 的技能集合来探究想法,将对话转化为规格说明,并将规格拆分为任务单。
Astra 委派独立工作: 实现、探索、测试和文档处理交给 GPT-5.6 Terra 或 Luna 子代理,每个工人负责一个受限模块。在大多数推理级别,应明确请求委派。Ultra 可以自行决定委派。
独立代理进行验证: 工人不给自己批改作业。新的验证者阅读计划,检查文件或实时结果,运行检查,要么通过阶段,要么带着具体失败原因退回。
你在检查点掌舵: 批准计划,解决有意义的权衡,并检查最终证据。如果 Astra 工作时需求发生变化,引导当前回合,让它整合变更而无需重启任务。
为何有效:昂贵的模型将令牌花在架构、优先级排序、恢复和判断上。较便宜的模型则将令牌花在受限执行和嘈杂的中间工作上,这些工作不应进入领导的上下文。
经济上的可行性只有在各条“车道”真正独立时才成立。按照 OpenAI 当前的 API 定价,Astra 每百万输入 token 收费 10 美元,每百万输出 token 收费 50 美元。Terra 分别为 2 美元和 12 美元,而 Luna 在当前 GPT-5.6 定价下为 0.20 美元和 1.20 美元。Astra 在处理任务时还能比早期模型使用更少的输出 token,因此 token 的价格并不等同于完成一项工作的价格。
不要为了做样子而并行化。五个智能体编辑同一批文件,只会产生五份账单和一个合并难题。并行化应针对探索、研究、独立模块、测试、文档,以及其他无需相互等待就能完成的“车道”。
构建你的工人
领导者需要一个精干团队,而一个 自定义 Codex 工人 只是一个 TOML 文件,放在单个项目的 .codex/agents/ 目录下,或所有项目的 ~/.codex/agents/ 目录下。
从一个实现工人开始:
name = "implementation_worker"
description = "Implements one isolated stage from an approved plan. Use only when the stage owns distinct files."
model = "gpt-5.6-terra"
model_reasoning_effort = "medium"
sandbox_mode = "workspace-write"
developer_instructions = """
You own only the stage assigned to you.
Before editing, identify the exact files and acceptance criteria in your lane.
Do not change files owned by another worker.
Implement the smallest complete solution, then run the relevant tests.
Return:
1. files changed
2. checks run and their real output
3. anything still uncertain
Do not declare success without evidence from this run.然后创建最重要的那个工人——验证者:
name = "verifier"
description = "独立对照计划与验收标准,核验已完成阶段。每个实施阶段结束后使用。"
model = "gpt-5.6-terra"
model_reasoning_effort = "high"
sandbox_mode = "read-only"
developer_instructions = 将实施摘要视为不可信的主张。
阅读计划并检查实际差异。自行运行相关检查。
检查正确性、回归、范围以及每项验收标准。
返回通过或失败。
对于每次失败,附上证据及所需的最小修正。
绝不修改你正在评分的实施。
新眼光能捕捉到作者习以为常的问题。阶段完成后立即检查,远比在后续四个阶段依赖它之后才发现缺陷要划算得多。
四条规则让团队保持高效:
一个工人,一条车道,明确文件或源码所有权
仅在车道互不依赖时并行工作
Astra 保持主导地位,而 Terra 或 Luna 负责有界劳动
每次完成声明都要对照文件、测试、源码或实际结果进行核验
秘诀一:不要规定路线
多数提示词建议是为了防止较弱的模型偏离方向而写的。
冗长的流程、僵化的步骤清单和庞大的规则块,在模型无法自行规划时确实有帮助。但对于 Astra,同样的框架反而可能迫使它走上一条比它自己会找到的更差的路径。
诀窍在于:对终点严格,对路线宽松。
给它四样东西:
结果: 工作完成时必须存在什么
约束: 它不能破坏、花费、暴露、发送或更改什么
理由: 这是为谁准备的,结果必须支持什么决策或任务
证据: 哪些可观察的证据算作完成
最后一点改变了一切。“让结账功能正常”只会引来一个看似合理的说法。“在沙盒中完成一次测试购买并展示生成的订单行”则给了模型一个它无法靠言辞绕过的终点线。
Astra 确实有一个提示词相关的怪癖:它可能会提出一个好问题,然后在你期望它继续推进时停下来。在重要的任务简报中加上一条自主性说明:对于任何不依赖我回答的事情,独立继续;从上下文中推断常规细节;仅在决策影响重大或行动不可逆时才等待。
如果你想要一个团队,就直说。OpenAI 自己的指南指出,在 Ultra 级别以下,Astra 的委派可能比你预期的要少。告诉它哪些工作流应成为子代理,哪些工作必须留在主导者手中,是否要等待每个结果,以及每个工作者必须返回什么摘要。
秘诀二:保持 AGENTS.md 精简
AGENTS.md 会在 Codex 开始工作前被加载。这使其很有用,但也意味着每一行无关或冲突的内容都可能影响未来的每项任务。
Astra 比早期模型更严格地遵循指令,并且对技能和项目文件中的规则更为敏感。OpenAI 明确建议审查这些文件。Codex 还可以将全局指令与从项目根目录到当前目录的文件分层叠加,因此过时的嵌套规则可能会悄然覆盖你本以为它在遵循的指导。
三个部分涵盖了大多数项目:
这个项目是什么: 产品、架构和重要边界
如何验证工作: 构建、测试、代码检查和本地预览的命令
它反复出错的地方: 项目特定约定和反复出现的错误
仅在某些时候相关的流程应放在技能中。仅适用于某个子树的规则应放在该子树附近。历史记录应放在文档中,而不是放在每次会话的提示词里。
今晚就打开你的 AGENTS.md,逐行审视:如果删除某行不会导致实际错误,就删掉它。然后检查嵌套的 AGENTS.md 和 AGENTS.override.md 文件,看是否有相互矛盾的规则。
通常,更精简的文件才是更强大的文件。
秘诀三:善用目标与定时任务
这正是 Astra 从对话转变为流程之处,它能在你处理其他事务时持续推进。
目标: /goal 为 Codex 会话设定一个持久的结果、其约束条件以及完成定义。进度行让你在 Astra 工作时暂停、恢复、编辑或清除目标,并且随着新信息的到来,你可以继续引导同一会话。
关键在于设定一个无法伪造的终点线:
要求可观察的证据:“所有认证测试通过且输出已附上”比“修复认证”更有力
定义失败路径:如果真正的阻碍使目标无法实现,报告阻碍和证据,而不是编造进展
限制风险部分:使用支出限额、并发限制,并明确划定部署、消息、购买或生产数据的边界
在每份简报中保持一条诚实原则:每项进展声明都必须指向本次运行中产生或检查过的结果
仅在你能放心无人值守的边界内运行长期目标。Astra 是 OpenAI 最对齐的模型,但当简报、权限或关联账户出错时,一个能干的智能体仍可能造成更大的影响范围。
定时任务 处理重复性工作:每天早晨、每小时、每个周一。在普通的 ChatGPT 工作对话中完善工作流,一旦结果可靠,就从该对话中安排定时任务。当每次运行都应从全新对话开始时,使用独立的定时任务。
定时任务可以审查昨天的工作、准备指标简报、监控关联数据源、更新定期报告或起草警报。影响外部系统的操作可能仍需等待批准,这正是你对重大变更所期望的。
在目标与计划任务之间,你可以让Astra持续工作,只要工作真正需要,最终以证据收尾,而非另一段自信满满的陈述。
如何一次性完成真实项目
现在围绕一个构建任务组装整个系统。
示例是一个带有效等待名单的着陆页。替换项目,同样的流程依然适用。
第一步,撰写简报
发送一条消息:
我正在为[受众]推出[产品]。他们需要一个能做出明确承诺并收集邮箱的着陆页。构建一个响应式页面,带有一个能存储注册信息的可用表单。约束条件:不使用需要我维护的框架,无付费依赖,移动端加载快,未经我批准不得部署。完成意味着页面能在本地运行,测试邮件出现在存储中,移动端布局在390px宽度下验证通过,并展示测试输出和截图。先检查项目并制定计划。以Astra为主导。仅将独立阶段委派给Terra或Luna工作节点,等待其结果,并用独立的审查者验证每个完成阶段。常规工作继续执行,无需询问我,但遇到重大或不可逆决策时需等待指示。
简报为其设定了目标,而非替它设计实现方案。
第二步,批准计划
在改动任何内容前,先进入计划模式,使用 /plan。
如果想法不够明确,请使用 npx skills@latest add mattpocock/skills 安装 Matt Pocock 的技能集合,运行一次 /setup-matt-pocock-skills,并利用其规划技能来深入探讨该想法,然后再将结果转化为规格说明。
阅读计划。删减你不需要的功能。确保每个阶段都有可观察的通过条件,且并行阶段不涉及相同文件。然后批准计划。
第三步,让团队运作
Astra 会将第一个独立阶段分配给实施工人。验证者会检查实际的差异和测试输出。只有在前一阶段通过后,依赖阶段才会开始。
你可以离开终端。当你想检查工作线程时,使用 /agent;如果实际需求发生变化,则引导主会话。
第四步,设定终点线
使用一个能明确状态和证明的目标:
/goal 页面在本地运行,表单存储测试注册信息,布局在 390px 宽度下正常显示,并通过实际测试输出、存储记录和当前截图来证明。如果遇到真正的阻碍无法实现,停止并报告证据,而不是声称成功。
仅凭言语很难满足这一条件。
第五步,审视结果
回到差异对比、测试输出、已存储的注册信息以及截图。
像用户一样审视产品,而非像模型的管理者。提出你实际能看到的改动要求,执行最后一轮独立验证,当证据与简报相符时即可发布。
首次运行会显得复杂繁琐。
第二次,你会注意到同样的流程几乎适用于你一直推迟的每个项目。
五个真正创造收益的工作流程
现在,将这套设置应用于足以证明模型价值的重要工作。
以下是GPT-6 Astra能够产生显著差异的五个工作流程。
无人愿意接手的代码库任务: 预估需三周的数据库迁移、罕见的生产故障、横跨八个服务的重构。Astra绘制系统全貌,工作人员分取独立切片,验证者检查每个阶段,进度与测试挂钩而非乐观估计。其在OpenAI内部数据库迁移任务中63.9%的得分,对比Sol的42.7%,是此次发布中最具商业价值的一大跃升。
决策级研究: 输入一个问题,研究人员并行从主要来源收集信息,一位持怀疑态度的评审者攻击每个重要论断,负责人将幸存下来的内容整理成备忘录、模型和演示文稿。Astra的优势不仅在于查找信息,更在于筛选最终成果中应包含的内容,并确保各交付物间数据的一致性。
业务运营: 赋予适当权限,让其处理表单、CRM记录、日历、邮件草稿、对账、报告及运营积压事务。Astra在AutomationBench上得分41.4%,对比Sol的18.1%和Fable 5.1的31.4%,同时其计算机使用任务完成速度远快于Sol。
以参考为驱动的产品工作: 给它提供你期望体验的截图、实际素材以及运行中应用的访问权限。它能依据参考进行实现,打开结果,执行流程,对比所见,并持续迭代直至可见与功能上的差距消失。你提供品味,它提供眼睛、双手与耐心。
一个不断累积的知识系统: 将公司中所有值得保留的内容指向它,让它把零散文档转化为持续维护、相互关联的真相源。Astra 的可搜索上下文与跨窗口笔记使长期整理工作更具持久性。文案可以从优秀销售页面构建一个,代理机构可以从案例研究中构建一个,SaaS 公司可以从客户通话、决策、实验与支持历史中构建一个。每个未来的智能体都将因已有有用上下文而起步更聪明。
这些曾经都是“有朝一日”的项目。
GPT-6 Astra 让其中许多变成“本周”项目——前提是你为系统设定明确的终点线、授予合适的权限,并提供验证其达成目标的方式。
整体架构一览
由 GPT-6 Astra 担任领导者:负责规划、分派、审查与决策
使用 GPT-5.6 Terra 或 Luna 承担有界劳动,每条独立工作线配备一名执行者
为其提供目标、约束、理由与证据,然后由其自主选择路径
保持 AGENTS.md 简洁,并审计其可见的每个技能或嵌套指令文件
利用目标实现可验证的完成度,利用定时任务处理周期性工作
通过推理层级、更经济的执行者、缓存上下文及硬性边界控制成本
将系统指向代码库、研究、运营、产品工作及可复利积累的知识
模型是整个架构中最显眼的部分,但它并非全部优势所在。
真正的优势在于:为如此强大的模型指明清晰的目的地、配备胜任的团队、接入现实世界,并使其无法将看似合理的回答与真正完成的工作混为一谈。