人类将依然重要
**智能体**将接管一切**可验证**的任务,但**品味、判断力与持续学习**是当前AI范式的**根本性局限**,人类在这些领域长期占优。

智能体很快将完成超过99%的所有任务。
任何具有明确目标函数、任何可以被验证的事情,都将由智能体来完成。迟早如此。而且它们会比任何人类做得更好。
然而,有些事情智能体无法做到——或者明显做得不如人类——并且我相信这些是当前AI范式的根本性局限。这些是智能体难以应对的事情。
这些是人类更擅长的领域。
验证器的局限
首先……让我们看看这些模型究竟是如何变得优秀的。预训练给你一个知识渊博的模型。强化学习则让它变得有用。而强化学习只有在存在验证器时才有效。代码编译成功了吗?测试通过了吗?数学答案正确吗?是或否。模型尝试一百万次,每次都得到反馈信号,然后逐步提升。
然而,AI研究者遇到的问题却是……谁来验证品味?谁来验证一个好的决策?谁来验证设计是否美观,或者这是否是对的人说对的话的恰当时机?
没有人能做到。没有客观函数。
这不仅仅是一个缺失的工具……一个缺失的爬虫、一个缺失的连接器、一个缺失的API。那只是一个工具调用,离发布只差一个版本。把你的业务建立在缺失的工具调用上,就是在跟模型对赌。你会输的。
我在这篇文章中讨论的并非如此。问题出在架构层面。Transformer是一个基于已有内容训练的下一词预测器。它在插值。它不发明。它没有创造力。
人类擅长的领域
人类将在(未来数年)更擅长的第一类事物包括判断力、品味、创造力、策略性和务实性。
两周前,我让 Opus 5 检查我持枪执照测验应用里的算法。基本上,就是那个决定下一步给我展示哪个问题的方法。Opus 告诉我,要优先考虑那些我已经连续答对两次的问题。而不是让我专注于那些我费劲且经常答错的问题。
在这种情境下,一个普通的12岁男孩都能给出更好的建议。然而,前沿模型 Claude Opus 5 却表现得完全愚蠢,缺乏基本的逻辑和推理常识。有趣的是,当我问 Grok 4.6 同样的问题时,它答对了。
这并非孤例……如果你问一位人类律师关于某条冷门法律,他会告诉你,是的,它存在,但没人执行,别管它。
但如果你问一个智能体同样的问题,它会告诉你这事百分之百严重,你必须停下一切,围绕它重构整个业务。这不切实际。它完全不懂世界如何运作。在高层次战略思维上,它糟糕透顶。
社交类任务则是另一个问题。如果你有一位优秀的人类销售员(即所谓的“成交手”)在销售电话中,而客户提到某个我们业务能轻松解决但不在标准产品目录中的冷门/独特问题,一位出色的人类成交手很可能会把那项当作赠品,促成交易。
没有任何 AI 模型能想到这一点。它缺乏在那一刻跳出框框的判断力、决策力和创造力。很可能,这个智能体会固守标准产品目录,告诉客户我们不提供那个东西。
持续学习的鸿沟
AI 明显逊于人类的第二个大领域是学习。
在当前 AI 范式下,模型在训练完成那一刻就被冻结了。Sonnet 5 将永远是 Sonnet 5。它不会从两个月前那个糟糕、平庸的模型,变成两个月后的优秀模型。一切都结束了。
但是!你团队里的新开发者,已经不是六个月前的他了。他很可能进步了很多。这被称为持续学习。而这也是当前LLM的一个根本性局限。
现在,你可能会想……David,如果数学/代码是拥有明确目标函数的事情之一,是AI能够(并且已经)超越人类的事情之一……那我们为什么还要雇佣人类开发者呢?
嗯,作为正在积极招聘的人,我可以非常清楚地回答这个问题。不是为了代码。GPT-5.6 Sol Max写的代码比我们任何人都好。我们付钱买的是主动性、对产品的理解、品味,以及判断什么该发布、什么该砍掉的决策力。
当然,还有这个可能性——一年后,这个人会比现在更优秀。
目前尚不清楚这究竟是Transformer的问题,是AI模型架构层面的问题,还是硅基智能的永久局限。
也许人类大脑、DNA或生物学中,有某种东西让我们成为那个获得随机创意灵感的存在。
也许机器人终究还是需要人类。
——作者:David Ondrej