LLM不是AGI,但这并不重要
我们距AGI尚有数年,但自我改进、有经济价值的AI已在当下发生——路径不是一次性突破,而是持续复合的自我改进飞轮。

很长一段时间里,我困在“我们回来了”和“一切都完了”的循环中。每一个新基准和模型都会让我的AGI时间线剧烈摇摆。四个月前,我接受了一个简单的真相:
我们距离真正类人AI(AGI)可能还有数年之遥,但自我改进、颠覆性且具有经济价值的AI正在当下发生。
让我解释一下。
当你用GPT-5.3-xhigh和Opus 4.6 Thinking等最先进的模型处理编码任务时,几乎所有事情都能开箱即用。
然而,如果你曾用它们测试过一种非常冷门、资源匮乏的编程语言,一个深度技术领域,或一个全新框架,你会发现这些模型仍然会惨败。
就连Anthropic的研究人员也承认,Opus 4.6还不足以取代初级研究员,因为它缺乏自主性、理解力、方向感和品味,而且至少在未来3个月内不会有所改善。
另一个最近的例子:Opus 4.6在ARC-AGI-2和FrontierMath等许多公认困难的推理和数学基准上表现出巨大进步,但不知何故,这些巨大提升并没有转移到其他推理密集型任务上,比如解国际象棋谜题。
当前模型存在泛化差距,但这并非致命问题。它只是意味着通往AGI的道路看起来不像是一次性突破,而更像是一个无情的、不断累积的循环。
这些LLM也不仅仅是模式匹配或统计鹦鹉。可解释性研究表明,它们确实以至少与我们有些相似的方式对世界进行建模。但有一个关键区别:它们无法即时调整这些模型。测试时计算有所帮助,但人类天生具备的那种灵活泛化和迁移学习能力仍然遥不可及。
我相信这在很大程度上依然成立,至少在我们实现持续学习之前。在那之后,我不确定我们是否还需要更多突破,可能只需让学习更高效即可。
AI公司清楚自己的模型并非AGI,且高度依赖数据,这正是他们拼命获取更多数据的原因。这也是他们雇佣数千名专业人员从事数据整理,以及推出那些免费Codex和Gemini服务的背后动机。他们想要且需要你的数据。
但我们不必因为缺乏持续学习、仍依赖源源不断的新数据而转为悲观。这并非终结,恰恰相反。
GPT-5.3-xhigh和Opus 4.6 Thinking让我们得以闭合一个自我改进的训练循环。这本质上正是特斯拉自动驾驶团队多年来所描述并努力实现的目标:他们识别出无法正常工作的任务,尽可能多地收集相关数据,启动模拟,并训练新模型。
这个循环的迭代时间随时间推移不断缩短,并日益自动化。
当OpenAI或Anthropic发现某些环节不奏效时,他们遵循同样的策略。他们尽可能从网络上抓取相关数据,生成一系列强化学习环境,或让最佳模型评判另一模型的输出,在极端测试时计算设置下生成数十亿个经过验证的合成token,然后基于结果训练新模型。
这样一来,今天所有分布外的情况,将在几天内而非几个月内变为分布内。
在此之上,大规模计算扩展仍在继续,这既提升了模型本身,也改进了训练流程。
这个飞轮正是我在2024年年中所设想的,尽管当时我想到的是蒙特卡洛树搜索(MCTS)(笑)。在2024年末推理模型问世后,我相当确信这种测试时计算(TTC)+强化学习(RL)的飞轮是(且依然是)前进的方向。
每一次迭代都让下一次更快、更便宜、范围更广。我们不需要奇迹,只需让循环持续转动。而此刻,它正以前所未有的速度飞转。
最坏的情况是,AI在我们关心的每个领域都变得普遍更强大,并大幅提升生产力。尽管模型仍主要依赖训练数据,但通过强化学习、超大上下文窗口、即时工具访问以及超人的思考速度和并行处理能力,它们能在特定任务上超越人类。当前模型或许无法独立开展研究,在这种范式下也可能永远无法做到。但它们能帮助我们消除几乎所有其他瓶颈。仅此一点,就足以改变一切。