使用Astra学到的五件事
**GPT-6 Astra 通过访问应用、承担产品思考与持续自检,让作者用十分钟重做了旧模型数小时未竟的乐高搭建,并总结出五条使用心得。**

早在二月份,让 Codex 搭建乐高模型还需要自定义技能、复杂指令和数小时的反复调试,而且效果依然不尽如人意。我当时得出的结论是,这类任务并非模型所擅长。
而借助 GPT-6 Astra,我让它访问 BrickLink Studio 并搭建金门大桥。大约十分钟后,我就得到了一个初版,桥面上甚至还有小汽车。之后我又不断优化。
诸如此类的体验让我重新思考如何使用 Codex:我会给它哪些应用、需要多大程度的细化说明、以及任务需要多少推理。以下是我在使用 Astra 过程中学到的五点心得。
1. Astra 能使用你的所有应用(有时甚至比你用得更好)
2. Astra 承担了更多产品层面的思考
3. Astra 在 Blender 中表现出色
4. Astra 无需 Max 也能令人惊艳
5. Astra 会持续检查自己的工作
1. Astra 能使用你的所有应用(有时甚至比你用得更好)
让我们回到那座乐高桥。我之前已经见过 Astra 在其他应用中的表现,所以想看看它会如何处理 BrickLink Studio——这款用于设计数字乐高模型的应用。
我给了它一个简单的请求:

这是它的初版成果:


Astra 弄清了 Studio 内置库中可用的零件,用 Python 组装模型,然后在 Studio 中打开进行查看和迭代。
让我惊讶的是,它如此自然地将代码与应用结合起来。它的速度之快,让我开始怀疑自己动手做是否真的会更省时。
这也促使我重新审视了为之前模型构建的技能。在为发布活动让Astra编辑视频时,我们的一些旧技能反而碍手碍脚。一个更简洁的配置,不包含视频编辑技能,反而在该任务中表现更佳。
如果你有一个围绕旧模型无法完成的任务而构建的技能,不妨尝试在没有该技能的情况下执行任务,看看是否真的还需要它。
计算机使用功能也让Astra能够跨应用连接工作。它可以在一个地方创建内容,在另一处检查,再将各部分整合起来。赋予它这种访问权限,有助于它自我验证工作并更完整地完成任务。
因此,思考一下你会为这项工作选用哪个应用,并让Astra访问它。比如,LEGO用Bricklink Studio,3D建模用Blender,视频编辑则用DaVinci Resolve或类似编辑器。如果有专门的应用能帮上忙,它不必非得通过FFmpeg来完成所有视频处理。
提示:给Astra提供你工作中会用到的应用,并先尝试不添加额外技能。它可能比你想象的更需要更少的指导。
2. Astra 承担了更多产品层面的思考
有一次测试,我想构建一个 Thumbnail Studio 来辅助制作创意素材。我得以快速梳理一些想法,并参考了与同事的对话记录。Astra 自行理清了许多你期望在浏览器图像编辑器中看到的细节交互,包括 ⌘-Z 及其他常见快捷键、图层,以及隐藏图层的功能。我不必像以前那样事无巨细地指定每一步。


后来,我要求增加一个“产品反馈”模式,以及一个用于检查、排序并实施反馈的自动化流程。令我惊讶的是,Astra 对反馈界面的思考如此周全。我可以高亮应用的各个部分,将评论固定到这些位置,设置优先级,编辑反馈,并将其标记为已解决。这些交互细节我并未详细描述过。

我可以迅速为我想要的功能发出一个任务指令,Astra 便会自行推敲出应有的体验流程。这让我构建个性化软件变得容易得多。我可以针对它构建的成果做出反应,而不必在动手前规划好每一次交互。
我在 WebMCP 文章及本文中的动画是另一个例子。我很喜欢 Nick Baumann 在 X 上的动画,于是我将该动画的 Appshot、我正在撰写的文章,以及 Codex 应用的代码库访问权限提供给了 Astra。该 Appshot 包含了应用的截图和相关上下文。

Codex阅读了文章,理解了我所指的3D演示,并重新创建了一个完整的3D界面供其动画展示。它思考了构图、摄像机角度以及解释正在发生内容的文本。然后它为我构建了一个小型预览工具,让我可以播放、暂停、重复动画,并从不同角度查看。
我并没有要求那个预览工具,但它让迭代变得容易得多。我可以使用应用内浏览器中的注释工具给它详细的反馈。

在某些情况下,这种行为可能会适得其反。如果你有非常具体的想法,请确保你对期望有明确的说明。
我也在减少向模型提问前准备所有内容的时间。为了进行上述比较,我让Astra浏览旧对话,恢复动画的早期版本,在桌面某处找到屏幕录制,并从X文章获取最终动画。
它找到了这些片段并将它们组合成视频,而无需我指向每个文件。我可以描述我想要的结果,让它自己想办法把所有内容整合在一起。
当我要求一个展示网站来展示其LEGO模型时,我希望人们能以3D方式浏览它们并下载构建文件。Astra还添加了一个上传更多模型的界面。它用“使用ChatGPT登录”来限制该界面,这样只有我作为管理员才能使用。

我仍需明确自己的需求,并为其指明方向,以便充分利用Astra。为了展示效果,我提供了更多示例,并请求生成可交互、旋转的行星,以实现我心中的太空主题。但我不必对每个功能都苛求细节。我提供的参考越优质,Astra在构思体验时就越能细致入微,令人惊喜。
提示:无需一开始就详尽列出每个交互。只需给Astra一个构想和几个优质参考,若希望其精准执行,则明确告知需求,再逐步优化它构建的体验。
3. Astra在Blender中的卓越表现
我们团队此前已对Astra利用Three.js乃至原生WebGL构建3D体验的能力印象深刻。但尤为突出的是,它能通过计算机操作和命令行熟练运用Blender。即便最终成果需在浏览器中呈现,我发现让Astra在Blender中构建部分内容也颇为有益。
为测试此能力,我提供了十张家中小吧台的快速照片,要求其在Blender中重建该房间,未提供任何尺寸数据。
Astra对比例把握极为严谨。它从照片中识别参照物,如鸡尾酒书籍,据此估算尺度。它逐一建模各个物体,单独检查,置入场景,并持续迭代优化。它构建了房间、家具、架子、酒瓶及玻璃器皿,甚至精准还原了角落的椅子和房间内杂乱的线缆。
在Blender中拥有独立物体,使其能细致检查并优化场景的每个部分。我不断调整材质与光照,并能打开场景,从不同角度环视。

提示:若项目涉及3D内容,可让Astra使用Blender以获得更佳效果。
4. Astra无需Max也能令人印象深刻
在Light/Low推理级别上我能走多远,一直是最令人惊喜的发现之一。随着每一代新模型的推出,尝试使用最高级别推理的诱惑总是很大,尤其是如果你之前一直在用最高级别的话。
在我用Blender进行的实验中,Astra在Low级别上取得的结果,我甚至比Sol在Max级别上的结果更偏爱。无论推理级别如何,Astra在验证自身工作方面都非常细致,这使得Low推理变得异常强大。

如果你一直在用Sol的高推理级别,别想当然地认为Astra也需要调高。不妨先试试Medium这样的级别,然后向两个方向实验,看看哪种更适合你的任务。若需要更多对比的灵感,可以查看我们的模型观测站。
提示:从Light/Low或Medium推理级别开始。先看看得到的结果,再决定是否需要更强的推理。
5. Astra持续自我检查
Astra倾向于确认自己是否真正完成了任务。如果你正在构建一个游戏,它可能会开始试玩。要求它优化某些内容,它可能会搭建环境来评估优化是否生效。对于视频,它可能会检查个别帧甚至声波图,以确认其操作效果。
当我让Astra处理这篇文章的标题图片时,它通过浏览器使用功能检查了X实时文章页面的代码,并确认了头部图片的要求。它发现了一个5:2的宽高比和1200×480的封面尺寸。

这很有用,但我需要明确我希望它做到何种程度。如果你想要一个自己试玩的原型,请明确说明。如果你希望它完整游玩游戏并修复发现的问题,也请明确告知。对于最终检查,你可以要求它对你关心的检查项进行一次全面审查,然后报告发现的问题及任何未解决的事项。
提示:告诉Astra最终成果应是什么样子、你希望它验证什么,以及何时应将工作交还给你。
尝试你曾放弃的任务
我曾花数小时试图让 Codex 搭建乐高模型,最终认为它并不擅长此事。而使用 Astra,我大约十分钟就完成了桥梁的首个版本。
给它提供你工作中会用到的应用和几个好的参考示例。从轻度或中度推理开始。告诉它最终结果应是什么样,以及你希望它验证什么,然后观察它在需要更多指导前能推进多远。
如果你有曾用旧模型尝试过但放弃的任务,不妨再用 Astra 试一次。