AI代理能迭代改进模型,但缺乏重新思考策略的能力,这是递归自我改进(RSI)的核心瓶颈;新研究Metan提出分层方案试图突破。

TURING POST(@THETURINGPOST)深度报道 · 已翻译 · 约 6 分钟
阅览室 · AI 最佳实践#递归#策略#研究#RSI#模型原文

速览: 当前的人工智能代理能够迭代并改进结果,但很少会重新思考改进背后的策略。新研究正探索如何解决这一局限:Metaⁿ 通过递归添加层次来优化代理的策略,而 Recuris 则进化了代理存储、检索、验证及应用经验的方式,基于记忆机制。

RSI 这个缩写在过去几个月里已变得耳熟能详。我们这样定义它:递归自我改进(RSI)是指人工智能能够帮助改进未来的人工智能系统,而这些系统随后又能帮助构建更强大的系统。

多年来,开发者们一直致力于提升模型的能力。如今,随着模型能力的增强,将更多此类工作交给它们处理的诱惑也随之增大。这一前景极具吸引力:模型能够

  • 从经验中学习,就像人类在工作中不断进步一样
  • 帮助设计和训练更强大的后继者
  • 适应未知问题,无需等待人类更新。

这些能力可能会以前所未有的速度推动科学与工程的进步。很难不对人工智能代理成为科学领域的一流贡献者感到兴奋。

今天,我们已经看到人工智能能够改进人工智能(下周我们将发布一篇关于此话题的有趣访谈)。但为何这并未转化为持续的递归自我改进?答案至关重要,它影响着我们对人工智能进步速度的预期。

现在,让我们审视阻碍 RSI 发展的因素。即便你对 RSI 不感兴趣,这些瓶颈也值得了解,因为其中许多问题同样制约着人工智能的整体发展。那么,让我们找出进展受阻的关键所在。

什么限制了递归自我改进?迭代不等于重新思考

我们探索的起点是一篇乍看之下与RSI无关的论文:“AI后训练中缺失了什么:一项实证分析”,由清华大学及其他机构的研究人员撰写。该研究探讨了AI代理对其他AI模型进行后训练的现象。这听起来可能像是一个狭窄的训练问题,但它为我们提供了一个具体视角,来观察AI在改进AI方面已能走多远,以及这一过程中仍缺失哪些环节。

研究人员将代理的能力分为两个层次:

  1. 执行——代理遵循现有的训练计划。它准备数据、调整设置、修复错误、调整奖励,并选择最佳检查点。
  2. 策略——代理自行改变计划。它可能切换至另一种训练方法,增加或移除训练阶段,采用不同类型的数据,或重新分配剩余的计算资源。

研究人员仅在代理实际更新模型参数时,才将其计为一次训练实验。随后,他们审视了实验之间的变化:

  • 同一计划内的小幅调整,如超参数调优,被计为执行层面的变化。
  • 对训练方法的改变,则被计为策略层面的变化。

实验结果显示了一个重要洞见。代理已能成功训练模型。在1,338条轨迹中,它们完成了5,111次训练运行,将平均基准性能从10.4%提升至23.0%。以HumanEval为例,平均性能从22.0%提升至41.4%。因此,代理能够胜任实际工作:准备数据、启动训练、诊断技术问题、修复失败运行并持续迭代数小时。

主要局限出现在策略层面:智能体通常在开始时选定一种训练策略,并倾向于固守该策略,将剩余时间用于微调。智能体仅在约2%的情况下尝试了不同策略。即使结果暗示应尝试其他方法,它们也不会改变改进方式。

有趣的是,首选方法往往更多取决于智能体本身而非任务。Claude Code大多选择全参数监督微调,而Codex CLI则偏好参数高效微调。

研究人员提出,必须找到解决之道。他们尝试了三种修复方法,但均未能达成目标:

  • 更多经验,如赋予智能体记忆、实用技能和反馈,仅能提升其执行能力。智能体得分有所提高:例如,HumanEval性能从22.0%提升至62.8%(相比之下,未修复时为41.4%)。然而,更多经验并不能让智能体在必要时改变策略。
图片来源:“AI后训练中缺失了什么:一项实证分析”论文
图片来源:“AI后训练中缺失了什么:一项实证分析”论文
  • 人工指导有助于智能体在开始时选择不同的初始方法。但训练一旦开始,它们便再次陷入局部微调的僵局。
图片来源:“AI后训练中缺失了什么:一项实证分析”论文
图片来源:“AI后训练中缺失了什么:一项实证分析”论文
  • 最后,给予智能体2至8倍的更多推理计算量有助于处理较简单任务,但在最困难任务上几乎毫无差别。

那么,问题就不在于缺乏经验、指导或算力。AI 已经能通过迭代来改进自身。但能迭代并不等于能重新思考。当前的智能体很少能停下来想一想:也许我的整个方法都错了?它们似乎缺乏一种可靠的方式,在迭代过程中识别错误,因此可能沿着错误方向继续迭代,陷入局部无谓修正的循环中。

所以,这比一个后训练问题更严重。它是实现递归自我改进(RSI)的障碍 →

为什么迭代对RSI至关重要,但还不够

在递归自我改进中,AI成为改进未来AI系统过程的一部分。这里的关键词是递归:一个研究周期的结果被反馈到下一个周期,帮助系统选择更好的改进选项。迭代意味着重复自动化研究循环,同时从每次尝试中学习:

提出想法 → 实施它 → 运行实验 → 评估结果 →修订计划→ 再试一次。

只有当AI利用所学来重新思考下一轮背后的策略——包括训练方法、数据设置、评估过程或模型构建流程——这个循环才变得递归。

目前,大多数智能体在执行层面完成这个循环。但AI改进AI的更广泛过程仍然大多是线性的。

图片来源:“AI后训练中缺失了什么:一项实证分析”论文
图片来源:“AI后训练中缺失了什么:一项实证分析”论文

“递归”部分仍然有限:智能体继续在原始计划内工作。当人类指引它们时,它们可以尝试不同方法。但它们不会自行做出这种改变。

更大的模型可能无法解决这个问题。智能体可能需要被训练来识别方法何时失效,设置检查点,让它们停下来问自己:是继续前进,还是尝试其他路径。

这就是为什么研究人员如此重视策略。它决定了智能体接下来尝试什么。如果方法本身有误,再一轮工作可能只会让它在错误的方向上走得更远。

幸运的是,另一项引人入胜的研究提出了一个实用方案,以改进递归自我改进(RSI)的过程。 →

Metan:一种改进RSI的分层方法

阅读全文请点击此处:https://www.turingpost.com/p/missing-pieces-in-recursive-self-improvement

已读完 · 本文由熊猫易读翻译重排