Fable 5.1 的真正价值不在基准提升,而在于它能作为「领导者」规划、委派、验证,把一次性对话变成可无人值守的完整工作系统。

DANIEL CH(@CHDDANIEL)教程 · 已翻译 · 约 18 分钟
阅览室 · AI 最佳实践#Fable#工作#模型#验证#目标#持续原文

Anthropic 刚刚发布了其有史以来最强大的模型,而基准测试的飞跃几乎是最无趣的部分。

Claude Fable 5.1 给人的感觉不像是一个更好的聊天机器人,更像是一种新型的操作者。它能与一个问题共处数小时,在计划破裂时恢复,协调其他智能体,检查自己的输出,并持续前进,无需每隔十分钟就有人来救场。

数据支持了这一点。根据 Anthropic 发布的评估,Fable 5.1 在智能体科学研究上的表现比 Fable 5 提升了一倍多,在业务自动化方面从 17.1% 跃升至 31.4%,并在 CursorBench 上达到了 73.4%。在 Anthropic 报告的大多数编码、自动化、计算机使用和知识工作测试中,它也领先于 Fable 5、Opus 5 和 GPT-5.6 Sol。

查看原推文

开箱即用,它在困难编码、长周期工作、研究、规划、计算机使用以及生成完整交付物方面表现出色。但更大的机会在于,当你不再把它当作执行每项任务的人,而是让它负责整个工作系统时,会发生什么。

这正是本课程涵盖的内容:Fable 5.1 真正与众不同之处,如何让它坐上领导席位,如何在其下构建工人,如何在不束缚它的前提下进行提示,如何使用目标和循环,以及五种能将差异转化为实际收益的工作流程。

如果你不关心终端、智能体文件和编排,只想把一个想法变成一个可用的应用,那就是我们构建 Shipper 的目的。

这个模型真正擅长的地方

在探讨方法之前,先来认识一下这台机器。以下是让 Fable 5.1 与前代模型截然不同的五大能力。

超长运行中保持连贯性

交给它一个需要数小时完成的任务,它中途迷失方向的可能性大大降低。

一位早期测试者报告了一次无人值守的38小时机器学习运行,期间 Fable 诊断出早期结果的问题,进行了修正,并行启动了六个实验,并带着发现和后续步骤返回。另一位测试者提到,它自行记录,条件变化时重新调整优先级,并从上次中断的地方继续执行。

百万级 token 上下文窗口 有所帮助,但上下文大小并非真正的升级点。真正的升级在于,模型能在该上下文中持续做出有效决策,而不仅仅是记住信息的存在。

追寻根本原因,而非最快补丁

以前的智能体常常找到第一个能让错误消失的修复方案。Fable 5.1 更愿意深入挖掘,直到理解错误为何存在。

在 Anthropic 的发布测试中,Millennium 给它一个大约每百万次运行才出现一次、且四五年来一直无法解释的崩溃问题。Fable 5.1 拆解了一个外部库,将其与核心转储关联起来,并将崩溃追溯到实际 bug。他们尝试过的其他所有模型,包括 Fable 5,都未能发现这一点。

这一能力远不止于调试。同样的直觉也体现在研究、策略、财务分析和运营中:当底层系统出错时,不要优化症状。

它能观察、行动并验证

Fable 5.1 能够检查截图、图表、PDF、界面和文档,然后利用所见信息指导下一步行动。

这意味着它能根据参考资料重建界面,读取金融文档中深藏的图表数据,操作浏览器,将其实现与原始设计进行对比,并在宣称工作完成前捕捉视觉问题。

在Anthropic的测试中,其OSWorld计算机使用得分超过了Fable 5和Opus 5。更重要的是,该模型越来越能够将视觉作为验证循环的一部分,而不仅仅是描述你提供的图像。

它交付成果,而非关于成果的讲解

给它一个文件夹的文档,要求撰写投资备忘录、演示文稿、可运行原型或分析报告,它更有可能直接返回成果本身。

早期测试者报告称,这是Anthropic迄今最佳的PowerPoint成果,对金融文档的引用回忆更强,合同修订意见更简洁,对复杂多部分请求的完成度更高。一位MongoDB工程师描述了一次为期三天的原型运行,模型研究了现有服务,设计了系统,以无人值守阶段实施,并返回了带有各阶段工作证据的可视化演示。

实际区别很简单:你花在将答案转化为可用工作上的时间更少了。

它生而为领航

Fable 5.1 在决定接下来该做什么时最具价值。

Claude Code 已经能为其提供子代理、后台会话、代理团队、动态工作流、目标、循环、浏览器、终端和项目文件。Fable 拥有足够的规划深度和上下文,能让这些组件在更长时间内指向同一终点线,远超早期模型的能力。

这正是下述配置之所以有效的原因,也是本课程从将 Fable 移出执行者席位开始的原因。

驾驶舱:你真正需要的每一个控制

在开始其他操作之前,先更新 Claude Code。根据当前的模型配置文档,2.1.255 或更高版本会使 fable 别名解析至 Fable 5.1,且近期版本包含下文使用的 goal、loop、background-agent 和 effort 控制。

然后选择模型和努力级别:

/model fable
/effort high

对于实质性工作,high 是合理的默认选择。若需更便宜、更快速的执行,可降至 medium。仅在问题足够复杂、值得更多思考时,才提升至 xhigh 或 max。Fable 的自适应思考始终开启,因此 effort 才是关键控制项。

其余控制项很简单:

/plan 或 Shift+Tab:在修改文件前,让它先检查并规划
/goal:跨轮次持续工作,直到满足可测试的条件
/loop:在会话保持活跃期间,按计划重复运行提示
/tasks:查看后台工作者的动态
/context:查看哪些内容在消耗上下文窗口

这就是驾驶舱。

课程其余部分在于了解何时该用哪个控制项。

重头戏:让 Fable 当领导,而非苦力

最大的一项升级是角色转变。

别再让 Fable 包揽所有键盘操作。让它来定义工作内容、将其拆分为清晰的执行线、把这些任务分派给更廉价的智能体,并评估返回的结果。

具体设置如下:

Fable 制定计划: 将其置于计划模式,让它在提出更改前先检查项目。如果请求仍不明确,使用 Matt Pocock 的 技能集合 来深入探究想法,将对话转化为规格说明,并将规格拆分为任务清单。
Fable 委派独立工作: 实施工作交由 Opus 或 Sonnet 子智能体执行,每个工作者负责一条有界任务线。如果你已在用 Codex,它也可以作为另一个工作者,但必须遵循相同的文件边界和证据规则。
独立智能体负责验证: 工作者不能给自己的作业打分。一个全新的验证者会阅读计划、检查差异、运行测试,要么通过该阶段,要么附上具体失败原因将其退回。
你在检查点掌控方向: 批准计划、审视重要的权衡取舍,并在最后检查证据。你无需盯着每一条命令。

为何有效:昂贵的模型将其令牌花费在架构设计、优先级排序、问题恢复和判断上。较便宜的模型则将其花费在有界执行上。

只有当任务线真正独立时,这种经济性才成立。根据 Anthropic 当前的 API 定价,Fable 5.1 每百万输入令牌收费 10 美元,每百万输出令牌收费 50 美元,而 Opus 5 的价格是其一半,Sonnet 5 则为其五分之一。Fable 5.1 还将缓存读取费用降至每百万令牌 0.25 美元,这使得在稳定项目上下文中进行长时间会话变得更加切实可行。

不要在剧场里并行化。五个代理编辑同一批文件,会产生五份法案和一个合并问题。并行化研究、独立模块、测试、文档以及其他无需相互等待就能完成的路径。

构建你的工人

领导者需要一个小团队,而一个自定义工人只是.claude/agents/内的一个Markdown文件。

从一个实现工人开始:


name: implementation-worker
description: 根据已批准的计划实现一个独立阶段。仅当该阶段拥有不同文件时使用。
model: opus
tools: Read, Grep, Glob, Edit, Write, Bash
maxTurns: 25


你只拥有分配给你的阶段。

在编辑前,确定你路径中的确切文件和验收标准。
不要更改其他工人拥有的文件。

实现最小的完整解决方案,然后运行相关测试。

返回:

  1. 更改的文件
  2. 运行的检查及其真实输出
  3. 任何仍不确定的事项

没有本次运行证据,不要宣布成功。

然后创建最重要的工人——验证者:


name: verifier
description: 独立验证已完成阶段是否符合其计划和验收标准。在每个实现阶段后使用。
model: opus
tools: Read, Grep, Glob, Bash
maxTurns: 15


将实现摘要视为不可信声明。

阅读计划并检查实际差异。亲自运行相关测试。
检查正确性、回归、范围以及每个验收标准。

返回PASS或FAIL。
对于每个失败,包括证据和所需的最小修正。
绝不修改你正在评分的实现。

新鲜的眼睛能捕捉到作者习以为常的问题。一个立即检查的阶段,远比在四个后续阶段依赖它之后才发现缺陷要便宜得多。

四条规则保持团队高效:

一个工人,一条路径,明确文件所有权
仅当路径不相互依赖时并行工作
Fable 稳坐主导之位,而 Opus 或 Sonnet 则承担具体劳作
每项完成声明都会对照文件、测试或实际结果进行核查

秘诀一:不预设路径

多数提示词建议是为防止较弱模型偏离方向而设。

当模型无法自行规划时,冗长的流程、僵化的步骤清单和庞大的规则块曾有所帮助。但在 Fable 5.1 中,同样的框架可能将其推向比它自行发现更糟的路径。

关键在于对目标严格,对路径宽松。

给它四样东西:

结果: 工作完成时必须存在什么
约束: 它不能破坏、花费、暴露或更改什么
理由: 这是为谁而做,结果必须支持何种决策或任务
证据: 哪些可观察的迹象将视为完成

最后一点改变一切。“让结账功能正常”会引来模棱两可的声明。“在沙盒中完成一次测试购买并展示生成的订单记录”则给模型一个无法绕过的终点线。

不要要求它展示隐藏的思维链过程。要求它提供计划、关键决策、证据和剩余不确定性。Fable 的思考始终在运行。对你而言重要的是结果能否经得起检验。

也不要反复提醒它预算正在耗尽。相反,将边界置于系统中:限制工作轮次,定义允许的花费,并告知它在达到上限时该做什么。

秘诀二:保持 CLAUDE.md 精简

CLAUDE.md 在每次 Claude Code 会话开始时加载。这使它很有用,但也意味着每一行无关内容都会拖累未来的每项任务。

Anthropic 现在建议将每个文件控制在 200 行以内。实际上,你的文件通常可以短得多。

三个部分即可覆盖大多数项目:

这个项目是什么: 产品、架构和重要边界
如何验证工作: 构建、测试、代码检查和本地预览的命令
它反复出错的地方: 项目特定约定和反复出现的错误

只在某些时候有用的流程应归入技能。仅适用于特定文件的规则应归入路径限定规则。历史记录应归入文档,而不是每次会话的提示词中。

今晚就打开你的 CLAUDE.md,逐行审视:如果删除某行不会导致实际错误,就删掉它。

更精简的文件通常是更强大的文件。

秘诀三:善用目标与循环

这是 Fable 从对话转变为流程的地方——它可以在你做其他事情时持续推进。

目标: /goal 为会话设定一个可检验的完成条件。每轮之后,一个独立的小模型会检查该条件是否满足。如果未满足,Fable 会开始新一轮,而不是将控制权交还给你。目标在通过、变得不可能、遇到不可恢复的错误或你清除它时结束。

关键在于写出一条它无法伪造的终点线:

要求可观察的证据:“所有认证测试通过且输出已附上”比“修复认证”更有力
定义失败路径:如果真正的阻碍使目标无法实现,报告阻碍和证据,而不是编造进展
限制风险部分:为 worker 设置 maxTurns,为付费服务设置支出限额,并为部署或生产数据设定明确边界
在每一份简报中坚持一条诚实原则:每一项进展声明都必须指向本次运行期间产出或检查过的结果。

仅在您放心无人值守的边界内,以自动模式运行目标。当简报有误时,更智能的代理会产生更大的影响范围。

循环: /loop 按间隔重新运行提示。使用 /loop 15m 检查部署并调查任何故障,以保持固定节奏;或省略间隔,让 Claude 自行决定何时再次检查。

Claude Code 中的循环是会话范围的,最终会过期。将其用于构建、拉取请求、迁移和临时监控。对于需要在会话或机器关闭后继续运行的工作,请使用持久例程或桌面计划任务。

在目标与循环之间,您可以让 Fable 持续工作,只要任务真正需要,最终以证据收尾,而非另一段自信的文字。

如何一次性完成真实项目

现在围绕一个构建组装整个系统。

示例是一个带有可用候补名单的着陆页。替换项目,相同的流程依然适用。

第一步,撰写简报

发送一条消息:

我正在为[受众]推出[产品]。他们需要一个能做出明确承诺并收集邮箱的落地页。构建一个响应式页面,包含可用的表单并能存储注册信息。约束条件:不使用需要我维护的框架,无付费依赖,移动端加载快,且未经我批准不得部署。完成标准:页面能在本地运行,测试邮箱出现在存储中,移动端布局在390px宽度下验证通过,并展示测试输出和截图。先检查项目并制定计划。只委派独立阶段。验证每个已完成阶段。

简报为其设定了目标,而不代为设计实现方案。

第二步,批准计划

在改动任何内容前,使用 /plan 或 Shift+Tab 进入计划模式。

如果想法不够明确,使用 /plugin install mattpocock-skills 安装 Matt Pocock 的技能集,运行一次 /setup-matt-pocock-skills,并在将结果转化为规格说明前使用 /grill-with-docs。

阅读计划。删减你不需要的功能。确保每个阶段都有可观察的通过条件。然后批准它。

第三步,让团队协作

Fable将首个独立阶段分配给实施工作者。验证者检查实际的差异和测试输出。依赖阶段仅在先前阶段通过后才开始。

您可以离开终端。当您想查看仍在运行的任务时,使用/tasks。

第四步,设定终点线

使用一个明确命名状态和证据的目标:

/goal 页面在本地运行,表单存储测试注册信息,布局在390px宽度下正常,由真实测试输出、存储记录和当前截图证明。如果真正的障碍使这不可能实现,停止并报告证据,而不是声称成功。

仅凭言语很难满足这一条件。

第五步,审查结果

回到差异、测试输出、存储的注册信息和截图。

像用户一样审查产品,而不是像模型的经理。要求您能实际看到的更改,运行一次最终的独立验证,当证据与简报相符时发布。

第一次运行会感觉复杂。

第二次,您会注意到同样的流程几乎适用于您一直推迟的每个项目。

真正赚钱的五个工作流

现在,让我们聚焦于那些价值足以证明模型合理性的工作场景。

以下是 Fable 5.1 能够创造显著差异的五个工作流。

没人愿意做的代码库工作: 预计耗时三周的迁移、罕见的生产故障、遍布八个服务的性能问题。Fable 负责绘制系统全貌,工作人员分片处理,验证器检查每个阶段,进度以测试为准而非乐观估计。

决策级研究: 输入一个问题,研究工作人员并行从一手来源收集资料,一位持怀疑态度的审查者攻击每一个重要论断,负责人将幸存下来的内容整理成备忘录。这可以为收购、发布、市场决策或投资论点提供支撑。

业务运营: 授予其合适的工具权限,让它对账数据、调查异常、准备报告、监控流程,或处理运营积压事项。Fable 5.1 在 Anthropic 的 AutomationBench 上得分几乎比 Fable 5 翻了一番,这是本次发布中最清晰的实际提升之一。

参考驱动的产品工作: 给它你想要体验的截图、实际素材,以及运行中应用的访问权限。它可以对照参考进行实现,打开结果,对比两者,持续迭代直到可见差距消失。你提供品味,它提供眼睛、双手和耐心。

复合型知识系统: 将公司值得保留的一切指向它,让它把零散文档转化为一个持续维护、相互关联的真相源。文案可以从出色的销售页面构建一个,代理商可以从案例研究中构建一个,SaaS 公司可以从客户通话、决策、实验和支持历史中构建一个。每个未来的智能体都因为有用上下文已存在而起步更聪明。

这些曾经都是“有朝一日”的项目。

Fable 5.1 让其中许多项目成为“本周可完成”的任务,前提是你为系统设定一个明确的终点线,并提供一个能证明其已跨越终点的方法。

整体配置一览

让 Fable 5.1 担任领导者:它负责规划、委派、审查和决策
使用 Opus 或 Sonnet 处理有界劳动,每个独立工作流配备一名执行者
提供结果、约束、理由和证明,然后让它自行选择路径
保持 CLAUDE.md 简洁,将零散流程移入技能库
利用目标实现可验证的完成度,通过循环进行定期检查
通过努力级别、更经济的执行者、缓存上下文和硬性边界来控制成本
将系统指向代码库、研究、运营、产品工作以及能产生复利效应的知识领域

模型是整个配置中最显眼的部分,但它并非全部优势所在。

真正的优势在于,给予如此强大的模型一个清晰的目标、一支能干的团队、接触现实的途径,并使其无法将令人信服的答案与真正完成的工作混为一谈。

已读完 · 本文由熊猫易读翻译重排