模型、工具、API都已足够,真正的瓶颈在于人类的认知极限、错误的构建与委托方式、上下文供给不足、代理缺乏主动性,以及持久环境的缺失。

DAVID ONDREJ(@DAVIDONDREJ1)观点长文 · 已翻译 · 约 6 分钟
阅览室 · AI 最佳实践#智能体#代理#任务#上下文#模型#环境原文

你完全可以同时运行1000个智能体,全天候为你处理各种有用的事务。然而,你几乎肯定没有这么多智能体在为你工作。这是为什么呢?

人类的极限

模型已经足够强大,工具链也足够成熟,API无处不在,那么……到底缺了什么?

首先,我们来谈谈人类的极限。

我们根本无法同时记住50多个不同的智能体会话,并逐一手动解除它们的阻塞。无论你如何尝试,很快就会触及自己的极限。

你会忘记哪个智能体在做什么,会跟不上那些等待你响应的智能体。而且每个智能体最终都会停下来,需要你——一个权限、一个答案、一个决策——于是你成了瓶颈。这些问题还会叠加:你忘了那些等待中的智能体,它们就只能闲置数小时。

这就像在一家公司里管理50多名直接下属。企业之所以每位经理只带6到12名员工,是有原因的。

Cursor最出色的工程师之一(按产出和PR数量衡量)曾谈到,优秀的经理人如何能同样擅长管理智能体。所以这并非我们的凭空想象,而是那些比我们更专注的人验证过的。

构建与委托的困境

第二个原因:人们不知道在哪里构建智能体。要么不知道如何搭建——Grok Bot是朝着正确方向迈出的一大步,让每个人都能更轻松上手——要么不知道什么样的任务适合交给智能体。

关于这一点,已有针对人脑的研究——我们一天中做的事情,有多少比例是习惯性的,有多少是全新的。结果大约是95比5。

我们一天中做的95%的事情,都是以前做过的、已经知道怎么做的事情。我们不会刻意、深入地思考它们。通常只有5%是需要从头开始摸索的。

例如,前往一个新地点。这栋建筑在哪里?我该怎么到达那里?这就是为什么这些事情需要耗费大量脑力,因为需要大量思考。而大多数任务则是常规性的。通常你做的是同样的事情,或者只是略有不同。

人类日常所做的超过90%的任务本质上都是重复性的,可以委托给智能体。工作单元无处不在。人们只是还没有将他们的工作流程、标准操作程序转化为智能体技能。

什么是适合智能体的良好工作单元?

这是一项无价的技能。知道今天该把智能体放在哪里,与今天不可能实现、也许一年后可能实现的事情,以及根本不值得自动化的事情之间的区别,是一种极其宝贵的能力。

如果你的想法是“我要在这里放一个智能体”,但过于雄心勃勃,智能体可能无法做好,然后人们就会对AI产生糟糕的体验。为智能体确定正确的工作单元至关重要。

上下文与主动性

第三个原因:上下文。显然你需要使用正确的模型——前沿或接近前沿的模型,而不是某个愚蠢的70亿参数模型。但如果你有正确的模型和稳固的框架,限制智能体的就是上下文和连接器。主要是上下文。连接器只是首次使用的问题。上下文则是始终存在的问题。

很多人甚至不描述如何执行任务。他们没有给智能体足够的信息。然后他们又因为智能体没有完全按照他们的期望去做而生气。

我们在David Ondrej团队使用的一些策略包括:转录通话、确保每次会议都开启Fireflies、录制Loom视频、强迫自己教它。共享仓库,比如我们的元学习仓库。这些都是解决上下文问题的好策略。对于连接器,有DeepAPI和Composio。

第四个原因:很多智能体不够主动。很多人把他们的智能体设置为“如果有意外情况,就给我发消息”。这是一个失败策略。这从根本上是在与模型对赌。

Grok Bot 非常主动,这对于完成任务来说是有益的。有时它可能会让人感到烦人,但平均而言,我认为这是好的,因为如果我们不这样设定,就不会有工作进展。我认为 Cursor 的开发人员把系统提示词写得很好。

也许问题在于动态性……如果用户没有给你足够的信息来完成任务,那就应该非常主动。因为一旦我有了明确任务的机器人,它们就不会那么烦人了。最大的风险是:用户没有做好设置,而代理甚至没有机会去做任何工作。

同时,你也不希望代理做你不知道的事情。那么,如何让你更信任代理呢?你真的需要清楚代理做什么、不做什么。明确你创建代理的原因。不应该是因为“哦,我觉得我的生活或业务中需要另一个代理。”那完全是胡扯。这就像在不知道要招聘什么角色时雇了一个员工。

人们应该这样思考:你在雇佣这个代理。这是有成本的,因为它消耗你的计划。那么你雇佣它是为了什么?你希望它做什么?如果你雇佣它来做会计自动化,你可能不希望它头脑风暴营销创意。不要让代理过于通用和宽泛。

Grok 机器人成功的原因之一是它们专门化。人们为不同的事情运行不同的 Grok 机器人,而用户界面非常清楚地表明这不是一个单一的代理。这就是 Hermes 和 OpenClaw 的问题:它们是单一的代理,你必须混合上下文。而使用 Grok 机器人,界面上非常明确地表明你应该有多个代理。界面让这一点显而易见,而且创建新机器人非常容易。

持久环境的缺失

第五个原因:持久环境。代理要存在,就不能消亡。就像为什么人类不多?人类在消亡。道理是一样的。

那么,是什么导致一个代理(agent)死亡?它的环境超时了。出现了一些随机错误。也许任务不再相关。或者出现了错误,而它没有自我修复。这在 OpenClaw 的早期是一个巨大的问题……你把它部署在 VPS 上,然后几天(或几周)后它就停止工作了。或者,由于某个随机更新,代理开始在一个它曾经成功执行过 100 多次的任务上失败。

这是一个大问题。为什么代理数量不多?因为它们不够可靠。不够一致。不够可预测。部分原因在于模型本身,但我认为更大的原因在于环境、框架(harness),以及周围的一切。

模型已经足够好了。框架也足够好了。但周围的一切还不够

作者:David Ondrej(口述,然后手工整理)

已读完 · 本文由熊猫易读翻译重排