
我们究竟从 GPT-6 Astra 中看到了什么?
Astra 的演示证明的不是「规模化解决了物理智能」,而是**规模化正变得有能力利用结构**——能力是整个系统的属性,需先厘清「我们究竟看到了什么」。
关于机器人学、3D、结构,以及我们真正应该衡量什么的一些思考
过去几天,我更加仔细地审视了 GPT-6 Astra 在机器人学、3D、CAD、仿真和自主实验方面涌现出的结果。
我最初的立场相当怀疑。围绕这些演示有大量炒作,尤其是在机器人学领域,我们应当非常谨慎地看待一段成功视频究竟证明了什么。
- 模型接收到了什么信息?
- 提示词里有什么?
- 有哪些工具和抽象可用?
- 是模型直接产生了行为,还是它构建了一个最终产生该行为的系统?
- 任务在训练中有多熟悉,模型在测试时能检索到什么信息?
然而,在更系统地审视这些结果之后,我认为有一些有趣的事情正在发生。我并不认为证据支持“机器人学已被基础模型的规模化突然解决”这一说法。仅凭物理操作方面的结果就足以说明这一点。同时,我也不认为把这些结果斥为检索、数据污染或精心挑选的演示合集就足够了。
能力上似乎确实发生了实质性的变化,但我们需要更精确地界定这种能力究竟是什么、它由何而来,以及结构在产生这种能力的过程中扮演了什么角色。所谓能力,我指的是系统所展现的一系列技能或胜任力,例如它解读视觉输入、推理空间关系、生成动作,或构建代码与工作流的能力。在此语境下,结构既指围绕模型所提供的显式计算框架与抽象,例如动作空间、工具、仿真环境和控制器,也指模型所学表征内部的结构,例如归纳偏置、等变性或关系编码。厘清这一区分之所以重要,是因为我们观察到的行为是整个系统的属性。理解这种行为有多少来自模型所学到的东西,又有多少是通过围绕它所提供的结构才成为可能,是解读这些结果的核心所在。
Astra 究竟在做什么?
从观察到可执行的假设
拿一些 3D 结果来说。在 BenchCAD 中,Astra 接收一个物体的多视角渲染图,并被要求生成可执行的 CadQuery 代码来重建其几何形状。借助工具,Astra 在 OpenAI 自行报告的结果 中于 BenchCAD 上达到 95.9% 的平均体素 IoU,而在修改后的评估协议下,GPT-5.6 Sol 为 83.3%,Claude Fable 5.1 为 84.3%。BenchCAD 本身是弗吉尼亚大学的一个独立基准,包含约 17,900 个经过执行验证的 CadQuery 程序,涵盖 106 个工业零件族。据我所知,Astra 的分数尚未由 BenchCAD 团队独立重新评定。
Blender 演示则是另一种情境。在那里,Astra 可以使用 Blender Python 构建场景、渲染场景、检查结果、修改场景,并持续迭代。我们不应将其与 BenchCAD 的结果混为一谈,但两者之间存在一个有趣的共同点。
在这两种情况下,模型都能观察问题、构建假设、通过代码或工具使该假设可执行、观察结果,并在需要时修正假设或其执行。模型未必需要直接给出最终解决方案。它可以构建一个能产生解决方案的过程,观察这个过程做了什么,然后再次介入。
在机器人领域,Astra 可以扮演截然不同的角色
现在让我们考虑机器人领域。在这里,Astra 以几种相当不同的角色出现,重要的是将它们区分开来,而不是把它们统统归入 Astra 控制机器人这一说法之下。
在某些实验中,Astra 实际上被直接用作策略本身。RoboCurve 提供了一个有用的例子,因为其设置有详尽的文档记录。Astra 接收三路相机视角——来自一个顶部相机和两个腕部相机——以及本体感受状态。它生成绝对末端执行器位姿和每条手臂的夹爪指令,这些随后通过 IK 转换为关节角度。
在积木放入碗中任务上,Astra 在 20 次试验中成功 19 次,而 Claude Fable 5.1 为 20 次中成功 8 次。然而,在精度要求高得多的拼图块插入凹槽任务上,两个模型都仅在 20 次试验中成功 2 次,并且往往在同一最后阶段停滞。RoboCurve 正确地指出,20 次试验足以区分 19 与 8,但不足以在 2 与 2 之间确立有意义的差异。
这些结果表明,模型内部确实存在一种有趣的从视觉空间到动作的能力。但这种能力究竟代表什么,则远没有那么清楚。模型是否习得了一种足够通用的、将视觉观察与空间动作联系起来的表征?其中有多少是对训练中遇到的任务与轨迹结构的重新组合?同样的能力在一种新的具身形态、不同的坐标约定、不熟悉的物体几何形状或不同的交互动力学下会表现如何?
即便在这些直接控制的例子中,模型也并非在一个完全无结构的动作空间中运作。预测末端执行器位姿,与生成实现该运动所需的底层运动指令,是两回事。运动学、IK 和底层控制已经解决了物理控制问题的重要部分。这并不会让结果变得不那么有趣,但它改变了结果所告诉我们的内容。
而转笔的例子又是另一回事了
Wentao Zhu 报道的由其学生 Chengyang Li 完成的一次自主运行中的转笔演示,引起了相当多的关注。根据他们的描述,Astra 创建了笔的网格模型,在 Isaac Lab 中实现了 Sharpa 手任务,训练了 PPO 策略,并在大约一天半的时间里完成了最终的可视化。
对最终视频最直观的解读是:GPT-6 Astra 现在能够完成灵巧操作了。但实际情况并非如此。Astra 并未在最终行为中直接控制手部。它构建的是仿真、任务和学习环境,随后通过这一环境训练出了一个专用策略。
这里还有一个重要的先例。Eureka 使用 GPT-4 为 Isaac Gym 中的强化学习生成奖励函数,而其标志性演示恰恰是用 Shadow Hand 转笔。因此,将 LLM 作为 RL 设计流程一部分的总体模式并不新鲜,转笔本身也绝非新任务。真正有趣的问题是:Astra 能在多大程度上超越 Eureka,自主地构建、集成、调试并执行完整的学习工作流。
在本案例中,Astra 的角色并不是灵巧控制器本身,而是构建并运行那个最终产出控制器的计算过程。
我们在 HARBOR 中也研究了这一模式。在该工作中,我们提出了一个面向机器人 RL 的 harness,将任务分解为有边界的阶段,包括环境搭建、奖励设计、算法调优和评估,并配有明确的验证门和持久化的实验产物。在操作、运动以及双臂灵巧控制领域的六个基准和十六项任务中,由此得到的策略达到或超过了专家默认配置,并能迁移到真实机器人上。
我觉得这在科学上至少和直接控制一样有趣。一个足够强大的通用模型或许并不需要直接习得每一项专门能力。它可能转而变得能够识别需要什么机制、构建该机制、评估其结果,并不断修正过程,直到某种专门解决方案涌现出来。
规模并未使结构消失
在这些例子中,有一点很容易被忽视。许多最令人瞩目的成果,并不是规模让既有的计算结构消失的情形。Astra 恰恰是通过这种结构在运作。
BenchCAD 提供了一套由几何基元、参数、约束和操作构成的结构化语言。Blender 提供了对象、变换、场景结构、相机、材质和渲染器。在机器人学中,笛卡尔动作空间和 SE(3) 动作空间为运动提供了结构。运动学与逆运动学(IK)编码了任务空间与构型空间之间的关系。仿真器编码了动力学。控制器为期望运动如何实现提供了结构。强化学习则提供了一种用于搜索专门策略的算法过程。
但这里还有另一个重要的区分。到目前为止,我主要描述的是模型周围的结构。在机器人学和机器学习中,我们也已经花费了数十年研究学习到的表示内部的结构。
对于具身系统而言,这可能意味着对工作空间几何对称性的等变性、尊重机器人形态对称性的表示、对物体与接触的显式关系表示、对学习动力学的物理约束,或扎根于多模态交互的表示。这些并不只是模型在感知之后调用的工具。它们决定了观测如何被表示、该表示尊重哪些变换,以及关于一次交互的哪些信息从一开始就被保留下来。
Astra 的演示提供了有力的证据,表明能力足够强的模型可以利用外部计算结构。但它们远未告诉我们,学习表示内部的结构是否已变得不再必要。
我不认为这两种结构形式可以相互替代。IK 求解器可以将末端执行器目标转换为关节配置,但它并不会使视觉表示对参考系的变化具有等变性。模拟器可以将已知状态向前传播,但它不会告诉模型,当状态和物理参数不确定时,观察到的交互中哪些方面应当被表示。
这使得结构与规模之间的关系远比手工设计结构与端到端学习之间的简单对立要有趣得多。
这与 Ken Goldberg 围绕他所称的智能体机器人学(agentic robotics)所提出的一个相关论点相呼应。他指出,这些系统可能成为基于模型与无模型机器人学之间的桥梁,其中通用模型可以利用经典模型、控制方法、学习策略和其他计算工具,而不需要其中一种范式取代另一种。我认为这是对当前结果的一个重要视角。
我的问题或许更进一步。如果能力日益增强的模型不仅能够使用现有结构,还能够选择、构建并最终改进它们用以解决问题的结构,那么边界本身可能变得动态。哪种结构应当组织模型所学习和表示的内容,哪些可以保持外部,哪些可以日益由模型自身发现或构建?
在机器人领域,还有一个额外的考量。有些结构需要保留在模型之外,不是因为模型能力不足,而是因为物理系统需要独立的机制来保障鲁棒性、可验证性和安全性。
从静态几何到可交互的物理结构
当我们从静态三维几何转向物理交互时,理解这一边界的难度会大幅上升。
BenchCAD 以及许多 Blender 演示主要关注的是形状、位姿、组合与外观。机器人领域的要求不止于此。几何会在接触、摩擦、柔顺性以及机器人自身动作的作用下随时间演化。因此,相关的场景并非简单的三维场景,而是一个可交互的四维过程——干预会改变接下来发生的事情。
目前 Astra 的结果只能为这种层次的物理理解提供有限的证据。在直接控制实验中,大部分物理过程由世界本身来解算:机器人行动,摄像头报告发生了什么,模型据此做出反应。在强化学习实验中,物理过程则由模拟器提供。这两种设定都无法告诉我们:模型是否具有接触动力学的内部表征,是否能从观测中推断质量、摩擦或柔顺性,或者是否能预测这些属性会如何影响干预的后果。
StationeryBench 在这里很有参考价值。Astra 在 100 次试验中仅完成 7 次,尽管其平均进度得分为 46 分(满分 100),而 MolmoAct2 为 12 分。MolmoAct2 是一个视觉-语言-动作模型,它在训练分布之外的场景中进行了零样本运行,因此这一比较更多说明的是 Astra 的绝对表现,而非两种方法的优劣。按任务来看,Astra 在打开马克笔笔帽任务中 20 次成功 5 次,从一叠便利贴中抽出中间那张 20 次成功 1 次,在两臂之间递送尺子 20 次成功 1 次,打开盒子、取出橡皮并盖上盖子 20 次成功 0 次,将回形针倒入举起的碗中 20 次成功 0 次。评估本身存在局限,但这些失败模式仍然很有意思。
倾倒、交接、插入和关节式操作,要求的不仅仅是对物体位置的估计。它们要求预判物体如何响应力和接触。
这正是结构化表示尤为 relevant 的地方。几何等变性与对称性、显式的物体与交互表示、接触约束、物理结构化的动力学,以及来自视觉、本体感觉和触觉的多模态信息,都是在尝试捕捉对物理交互至关重要的结构。
问题不在于每一条这样的先验是否都应被硬编码。而在于:足够强大的通用模型是否会隐式地学到这些结构,它们能否在需要时发现并使用这些结构,其中一些是否应作为归纳偏置来组织学习,而另一些则可以留在模拟器、控制器和工具中作为外部结构。
安全性、鲁棒性与交互仍是未解难题
基准测试结果还暴露出当前演示基本未能回答的一些问题。
RoboCurve 在此再次发挥作用,因为其实验条件明确可查。Astra 的运行采用了 25% 的速度上限、20 次调用预算以及默认的安全护栏。各次试验之间,物体由人工手动重置。这些都是完全合理的选择,但它们意味着我们观察的是一个已经受到系统约束的模型——该系统本身就限制了模型能够如何行动。
Astra 也不是一个高频反应式控制器。它进行观察、推理、发出末端执行器指令,然后接收下一次观察。因此,反应式安全仍然依赖于底层控制和周边系统来负责。对于意外接触、物体滑落、执行过程中的扰动或分布偏移下会发生什么,我们知之甚少。
人机交互则完全不在这些评估的范围内。工作空间内没有一个人,其行为会随机器人的动作而变化。然而,与人的交互会引入额外的要求:有界力、可预测且易于理解的运动、关于人类行为和意图的不确定性,以及在执行过程中纳入纠正性反馈的能力。
这同样部分地关乎结构应当置于何处的问题。有些安全约束显然应当保持外部可强制执行,无论模型变得多么强大。而其他能力,例如表征不确定性、预判接触的后果,或推理另一个智能体的反应,则需要模型自身具备某些东西。
强大的视觉空间推理能力本身,并不构成安全交互智能的证据。
但那个实验到底是什么?
还有一个方法论问题值得更多关注。对于许多病毒式传播的单次运行演示,我们对实验条件了解得远远不够。完整的提示词并不总是可得的,系统指令、可用的工具、检索到的上下文、中间干预措施,以及失败的运行记录也同样如此。
这种批评不应被不分青红皂白地套用。RoboCurve 接近我们应当期待的标准。它公开了其测试框架、提示词、每次试验的记录、视频和重跑文件。对于 Astra,它报告了中等思考强度、20 次调用预算、25% 速度上限、默认安全护栏,以及所使用的开源 Inspect Robots 测试框架的版本。
这些信息之所以重要,是因为提示词和测试框架本身就是实验的一部分。
转笔这个案例很好地说明了这一点。公开的提示词并不是简单地要求一只转笔的机械手。它指定了 Isaac Lab 作为模拟器、Sharpa 手作为具身形态,并要求笔的网格应由智能体自行创建,还授予了智能体搜索网络和下载论文的权限。因此,这个任务是在一个已经给定模拟器、平台和文献访问权限的抽象层级上提出的。这是一个合法的实验,但它与要求智能体自行选择这些要素的实验是不同的实验,而最终视频在两种情况下看起来会一模一样,尽管对模型所要求的推理截然不同。
因此,提示词、上下文、检索、工具访问、动作接口、反馈和测试框架配置都应被视为实验方法论。缺少这些信息,一次成功的演示只能证明整套设置是有效的。它对于解释为什么有效,能告诉我们的要少得多。
这对记忆与重组同样重要。我并不认为我们目前有证据可以断言 Astra 只是在记忆机器人轨迹。但许多演示也没有将可迁移的空间-动作能力与对熟悉任务结构的重组区分开来。这需要刻意设计的实验。
能力究竟存在于何处?
这引出了我认为这些结果所提出的更深层问题之一。
假设一个成功的行为是由一个基础模型在检索文献、现有代码、模拟器、机器人模型、RL 算法、IK、控制器以及大量算力的共同作用下产生的。那么,能力究竟应该定位在哪里?
周围系统的重要性即便在机器人领域之外也显而易见。ARC Prize 报告称,Astra 在其 Standard harness 下于 ARC-AGI-3 上得分 62.7%,而在 Provider Adapter harness 下得分 99.9%。模型是同一个,而围绕它的接口却发生了实质性变化。
我们在 HARBOR 和 Nautilus 上的经验使我们对此问题尤为敏感。在 Nautilus 中,我们追问:一个通用编码智能体,在仅给定单一请求(例如在某个基准上评估一个策略)的情况下,能否产出一个正确且可复现的机器人学习工作流。机器人学习至今仍碎片化地分布在不同的策略家族、基准和物理平台之间,而每一种配对都编码了关于动作空间、观测、控制频率和坐标约定的假设。因此,类型化接口、过程性先验和验证关卡可以实质性地改变工作流能否成功。
这并不意味着 harness 就是智能。它意味着,单看模型本身可能越来越成为一个错误的分析单元。我们需要理解哪些贡献来自模型,哪些来自围绕它的表示与算法,以及这些组件如何相互作用。
什么样的实验才能真正揭示我们所看到的现象?
与其再收集一批令人印象深刻的视频,我更希望看到那些明确设计来分离这些效应的实验。
首先,我们应当改变先验暴露和信息获取条件。让同一个模型不接触任何外部信息、文档、论文、代码库或不受限的检索。尽可能使用私有的或程序化生成的任务。
其次,我们应当在固定模型不变的情况下改变外部结构。比较关节空间控制与末端执行器控制,然后加入逆运动学、模拟器、规划器、运动基元、预训练策略或其他工具。
第三,我们应当改变内部表征结构。比较通用表征与几何等变表征、无结构场景表征与显式物体及交互表征、无约束学习动力学与物理结构化动力学,以及仅依赖视觉的状态与基于本体感觉和触觉的多模态表征。
最后,我们应当改变物理交互本身。改变具身形态、坐标约定、物体几何、质量、摩擦、接触配置和动力学。在执行过程中注入扰动。在干预条件下测试物理属性推断与预测。将同样的受控变化扩展到安全性,并最终扩展到与人类协作者的交互。
然后我们就能提出更有意义的问题。模型是否拥有可迁移的空间-动作表征?哪些结构能改善系统性泛化?模型能否自行发现合适的结构?它何时需要专门的策略?哪些结构必须组织学习到的表征,哪些可以保持外部化?
在规模固定的情况下,当我们改变可用结构时,什么会发生变化?在结构固定的情况下,当我们扩展模型规模时,什么会发生变化?
这些实验在我看来会提供多得多的信息量。我邀请学术界携手开展这些实验,回答更深层的研究问题。
科学溯源也是问题的一部分
Toru Lin、Guanya Shi、Jitendra Malik 等人提出了关于科学贡献认定与溯源的重要问题:当智能体能够检索论文与代码仓库、整合已有想法、运行实验并给出可用的结果时,这一切该如何归属?
这与上文的方法论问题直接相关。如果一个智能体阅读论文、检查代码仓库、尝试不同的表述方式、运行实验、排除失败方案,最终产出可用的成果,那么它的检索与实验轨迹本身就是证据的一部分。我们应当知道它检索了什么、复用了什么、修改了什么、哪些尝试失败了,以及究竟什么才是真正的新东西。
有意思的是,智能体系统最终可能让这一切比人类研究更加透明,而非更不透明。每一次检索、代码修改、实验和修订,原则上都可以被记录下来。但要实现这一点,我们就不能再把提示词、检索到的上下文和智能体轨迹当作实现细节。
那么,我们实际看到的究竟是什么?
我开始研究这些结果,是因为我想弄清楚,最近的演示是否真的支持了关于机器人技术的一些更宏大的论断。我仍然不认为它们表明规模化已经解决了物理智能问题。但我也认为,有些事情已经发生了重要的变化。
通用模型在感知、空间推理、行动、代码、工具、仿真和学习之间切换时,正变得出人意料地强大。有时它们直接生成动作,有时它们利用我们提供的某种结构,有时它们构建出找到专门解决方案的过程。这些是不同的能力,我们的评估需要将它们区分开来。
长期以来,结构和规模常常被当作相互竞争的方法来讨论。我在想,这是否仍然是正确的框架。
也许规模并不会让结构过时。也许规模正在变得有能力利用结构。
但这留下了一个更困难的科学问题尚未解决:哪些结构应当作为归纳偏置被构建到学习到的表示中,哪些应当在没有先验约束的情况下从数据中学习,哪些可以通过工具和算法从外部提供,以及随着模型不断扩展,这些边界如何移动?
对于具身智能而言,这意味着关于几何与形态对称性、物体与接触表示、动力学、不确定性、多模态交互、安全性,以及最终与人交互的具体问题。
Astra 的结果令人兴奋,因为它们让这些问题更难被忽视。在判定什么已经被解决之前,我们应当先理解我们实际看到的究竟是什么。
参考文献
ARC Prize.(2026年9月)。OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上的表现。https://arcprize.org/blog/astra
Jin, Y., Guo, J., Jia, X., Deng, Y., Li, Z., Liu, H., Liao, W., Prasad, V., Franzius, M., Neumann, G., & Chalvatzaki, G.(2026)。Nautilus:从单一提示到即插即用的机器人学习。arXiv:2605.11665。https://arxiv.org/abs/2605.11665
Li, Z., Jin, Y., Liu, X., Liu, P., Prasad, V., D'Eramo, C., & Chalvatzaki, G.(2026)。HARBOR:面向智能体机器人强化学习的框架。arXiv:2606.08610。https://arxiv.org/abs/2606.08610
Ma, Y. J., Liang, W., Wang, G., Huang, D.-A., Bastani, O., Jayaraman, D., Zhu, Y., Fan, L., & Anandkumar, A.(2024)。Eureka:通过编码大型语言模型实现人类水平的奖励设计。ICLR 2024。arXiv:2310.12931。https://arxiv.org/abs/2310.12931
Menon, A., Machcha, S., Zou, S., Chan, T. K., & Chooi, J.(2026年9月4日)。GPT-6 Astra 在机器人操作上的表现。RoboCurve。https://openai.robocurve.org/gpt-6-astra/
OpenAI.(2026年9月3日)。GPT-6 Astra:新一代智能。https://openai.com/index/gpt-6-astra/
RoboCurve.(2026)。Inspect Robots(版本 0.58.0)。https://github.com/robocurve/inspect-robots
Zhang, H., Liu, K., Chen, M., Li, L., Yang, S., Peng, C., & Chen, H.(2026)。BenchCAD:面向程序化 CAD 的综合性行业标准基准。arXiv:2605.10865。https://arxiv.org/abs/2605.10865
Zhang, Z. J., Machcha, S., Zou, S., Chan, T. K., & Chooi, J.(2026年9月10日)。GPT-6 Astra 与 MolmoAct2 在双臂机器人操作上的对比:StationeryBench。RoboCurve。https://openai.robocurve.org/stationerybench/
Goldberg, K.(2026年9月18日)。关于具身智能机器人以及基于模型与无模型机器人学之间关系的反思。 X 帖子。
Zhu, W.(2026年9月16日)。GPT-6 Astra 测试 4/n:Isaac Lab 中的 Sharpa 手转笔强化学习,由 Chengyang Li 自主运行 [帖子]。X。https://x.com/walterzhu8/status/2100212420840989112