LLM 把多种能力捆绑进一个通用产品,但各能力计算需求迥异;智能体让单步成本复合,架构正从「默认前沿」转向「默认廉价、例外前沿」。

JAYA GUPTA(@JAYAGUP10)观点长文 · 已翻译 · 约 6 分钟
阅览室 · AI 最佳实践#智能#能力#成本#廉价原文

过去三年,LLM 的奇迹一直在于捆绑。需要从文档中提取信息?调用 LLM。想要搜索信息、对五个选项排序、判断某件事是否可疑、选择下一个工具、浏览网站、撰写回复、核验工作,或者解决一个真正困难的推理问题?调用 LLM。GPT、Claude、Gemini 和 Kimi 把数量惊人的、此前彼此分离的能力,统统收拢进一个通用产品之中。这是生成式 AI 最伟大的产品突破之一:开发者不再需要把十几个狭窄的系统拼接起来,只需把一个足够智能的模型放在应用中央,让它几乎包办一切。

这种便利掩盖了一件重要的事。这些能力的计算需求截然不同,而不同的模型在捆绑包的不同部分上早已各有所长。随着这些能力在性能、延迟和成本上的差异不断拉大,经济上合理的架构也随之改变。

我认为,我们正在进入智能的大解绑。

为什么是现在?智能体把一个人的目标转化为成百上千个机器决策,因此每一步在成本和延迟上的微小差异会叠加成整个产品的经济账。推理已成为实打实的销货成本,成本和 ROI 越来越成为考量因素。更小的模型和开放权重模型已经足够好,可以承接多得多的常规工作。搜索、检索、重排序、记忆和计算机使用正在成为各自独立的基础设施层。

应用有了更好的评估手段,能够真正判断一个更便宜的系统是否够用。而吊诡的是,前沿模型变得强得多,反而让解绑更安全:应用可以大胆使用廉价智能,因为一旦更便宜的那一层不管用,栈顶始终有前沿模型兜底。架构正从默认用前沿、之后再优化转向默认用廉价、例外才上前沿。面对智能体如此庞大的推理规模,同一个目标内部的不同步骤理应获得截然不同数量与种类的智能。

这正是 Jev 恰逢其时的原因。TypeSafe 从生成式能力的大杂烩中抽出了一个通用能力:判断。给 Jev 混乱的状态、一个有边界的问题和已定义好的可能答案,它返回的是结构化的决策和概率,而不是开放式文本。其底层理念并不新鲜。新鲜的是把一种认知操作直接打包在模型层,以适配智能体内部循环的成本和速度。如果任务只是看看这个然后做决定,模型就不再需要先生成一句话。Jev 恰好在智能体把它变成一个经济问题的那一刻到来。

理解这一点的一个有用方式是解码税。如果软件只需要判断紧急/不紧急、继续/停止、允许/阻止,或者该用哪个工具,今天我们常常让语言模型生成答案,再把输出转换回应用真正想要的决策。智能体一直在这么做。它们内部循环中相当大一部分,可能根本不需要生成。

现在想想这对 LLM 捆绑包的经济学意味着什么。据报道,Anthropic 的毛利率超过 80%。这就是一个强大捆绑包的样子。Claude 能通过单一产品完成写作、分类、提取、排序、判断、编码、规划、验证和推理。今天,一个简单的分类或验证任务之所以要按前沿级价格收费,仅仅是因为它发生在一次 Claude 调用里。解绑提出了一个更令人不安的问题:隐藏在那次调用里的每一项能力,其独立市场价格是多少? 困难的推理或许理应获得巨额溢价。但判断一封邮件是否紧急呢?给五份检索到的文档排序呢?检查一次浏览器操作是否成功呢?如果判断被竞争到不足一分钱,排序转向重排器,搜索转向搜索提供商,精确工作转向代码,普通生成转向更便宜或开放权重的模型,那么应用并不需要直接攻击 Anthropic 的利润率。它们可以攻击推高 Anthropic 利润率的工作组合。

这就造成了前沿推理的逆向选择。如今,前沿模型接收的是混合型工作负载。随着应用在路由方面越来越擅长,它会系统性地剥离掉那些廉价、可预测、高并发的工作。浏览器模型接管重复性的计算机控制。代码模型接管确定性推理。小型和开放权重模型接管普通生成。前沿实验室越来越多地接收到最高阶的工作:那些奇异的、模糊的、长周期的问题——廉价系统对此不确定。因此,前沿智能可能同时变得单次调用能力更强、价值更高,但被调用的频率更低。而且可能存在双重打击。不仅到达前沿模型的操作数量可能减少;由于路由优先选择了最难的问题,那些真正到达前沿模型的平均操作可能需要更多的测试时计算。对前沿推理的威胁不仅仅是更便宜的前沿推理。而是其下方工作负载的解构。

一旦能力变得可分离,就必须有人把它们重新缝合起来。这就是应用层变得更加重要的原因。应用不再问哪个模型应该处理整个任务,而是决定任务需要哪些能力。应用变成了一个智能编译器:接收人类目标,将其分解为认知操作,为每个操作购买最便宜的足够智能,重新组合结果,并且只在必要时升级。

下一步比问哪个模型应该回答这个提示?深入一层。它问的是谁应该提供这个任务内部的每一项能力?一旦一项能力有了稳定的接口,提供商就可以被独立地基准测试、替换、路由和定价。大解绑并不会消除AI利润池。它迫使每一项能力证明自己配得上从中分一杯羹。

而这改变的不只是利润率。廉价的判断力改变了哪些产品在经济上成为可能。以不到一美分的成本和几百毫秒的延迟,你可以在每个智能体动作之后都放一个裁判,而不是偶尔抽查工作。你可以把智能放进浏览器和语音循环中——那些多秒级推理太慢的场景。你还可以从对系统抽样 1% 转向对 100% 进行评估,比如每一段客服对话、每一次检索、每一笔交易、每一份理赔、每一条合同条款或每一个客户账户。它创造了持续监督、持续质量保证,以及全新的产品循环和用例。

如今软件本可以做出的决策,大多数从未被做出,因为智能仍然太昂贵,无法持续应用。一旦判断、排序、验证及其他能力变得足够廉价,软件就能评估每一位客户、每一个工作流、每一个智能体动作,以及每一次状态变化。

廉价的智能扩展了软件能够负担得起展现智能的范围。真正的解锁在于这样一个世界:智能不再是一个事件,而成为技术的一种背景属性。如果所有产品都能以近乎免费的成本去思考一切,会怎样?过去几年我们一直在问,能把多少能力塞进单个模型。未来十年,我们或许会花在把它们拆开,并在应用层重新组合上。

已读完 · 本文由熊猫易读翻译重排