递归自我改进的进展速度受制于生成可信证据的速度,稳定性就是速度上限。

PEYMAN MILANFAR(@DOCMILANFAR)观点长文 · 已翻译 · 约 3 分钟
阅览室 · AI 最佳实践#速度#上限#自我改进#增益#RSI原文

在人工智能圈子里,递归自我改进(RSI)几乎被赋予了神话色彩:模型调整自身,变得更聪明,再用这份智力重写自己,最终通向超级智能。这个想法直观又诱人。但你要是和控制理论的人聊聊(就是给你带来自动驾驶仪的那门学科),他们会挑起眉毛,因为他们知道这种期待在某个非常具体的意义上过于天真。

我们都知道自我改进是可能的。但任何自我改进的循环都有一个安全速度上限,这个上限取决于你能以多快的速度生成可信的证据,证明某项改动确实是改进。

控制理论的小增益定理指出,当反馈回路的增益乘积保持在 1 以下时,回路保持稳定。增益是放大倍数的度量。在这里,它指的是系统每单位证据(证明改动有益的证据)所做出的改动有多大。RSI 的全部吸引力就在于增益:快速进步。

在 80 到 90 年代,自适应控制是一个热门课题:我们获得了控制器实时修正自身模型的全局稳定性证明。但不到两年,MIT 的研究者就发表了 Rohrs 反例。他们把已被证明的自适应控制策略用在以温和但现实的方式违反假设的被控对象上,系统就失控了。

一个自我改进、重写自身的人工智能系统具有相同的结构。它的自我模型恰恰在它现实经验最少的地方最糟糕,而它越是针对那个模型去优化,就越深地扎进那些空隙里。更糟的是,不稳定的自适应系统往往不会立刻爆炸。它会爆发:先运行得很好,然后毫无预警地变得不可预测——甚至可能又自行平静下来。

原因在于持续激励的丧失,这一脆弱性与AI模型在分布外(OOD)场景中失败的方式直接类似。真值来自与世界的接触,而非基准测试。系统必须以后果展开的速度做出响应。让置信度加速超越证据,会造出一个增益更高、稳定裕度更小的系统。

演化和文明是人们喜欢援引的反例,但两者恰恰证明了这一点。各自改进了自身的基底而没有爆裂:各自相对于反馈运行缓慢、并行推进,没有任何单一主体同时掌握修改权力与评估权威。

Rohrs的反例将整个领域引向了长达十年的鲁棒性建设,始终以牺牲峰值性能换取更大的稳定裕度。这些直接对应到RSI的进展:

  • 当误差处于噪声底之内时,放慢速度并停止适应。
  • 将参数锚定于可信先验——限制与已验证检查点之间的总距离。
  • 把饱和的基准视为一个已经失效的传感器,而非一场胜利。

能够可靠地自我改进的系统,将是被治理的、被阻尼的、缓慢的,并被看似浪费的裕度所约束。因为稳定性就是速度上限。

已读完 · 本文由熊猫易读翻译重排