超级智能时代中作为内部风险模型的模型

最值得信赖的超级智能系统,不是最信任其模型的系统,而是能以最低信任度对待模型的系统。

SATYA NADELLA(@SATYANADELLA)观点长文 · 已翻译 · 约 4 分钟
阅览室 · AI 行业动态#模型#智能#系统#信任#控制#内部#观测原文

过去几十年来,随着传统软件系统在整个经济领域广泛部署,我们拥有将行为追溯到特定代码路径的工具和能力。

而在当今的超级智能系统中,这种机制性的理解却无从谈起,即便驱动这些系统的前沿模型如今已比传统软件系统更为强大。我们无法将模型的行为和输出归因于特定的训练数据输入或模型权重配置。然而,我们却在部署这些复杂的智能体系统和模型,让它们访问我们最敏感的数据,并赋予它们代表我们执行关键任务操作的能力!

正因如此,是时候退后一步,审视这个新时代的信任架构了。我们根本无法将智能代表我们所做之事的责任外包出去。模型提供商的保证并不能免除我们的这一责任。

我们不能把超级智能当作一组嵌套的黑箱,只是简单地接受或拒绝其建议、答案和行动。我们必须构建受控系统——其行为可观察、其边界可测试、其行动始终可约束。

换言之,我们需要将智能的供给与其上的权力分开。

暂且搁置对齐这一难题,我们需要从工程方法入手,实现围控与治理。我们需要用强健的确定性系统设计、人工控制和可靠的操作流程来包围非确定性模型,并在现有行业标准不足的地方建立新的标准。

将前沿闭源和开源权重模型视为内部风险,是构建此类系统的一种方式。并非因为它们必然怀有恶意,而是因为任何足够强大的行为体,只要能够访问重要系统,就可能犯错或被攻破,而围控与控制的架构必须考虑到这一点。

好消息是,关于如何处理企业内部的强大行为体,我们已经学到了很多。这并非新问题!几十年来,我们已建立起最佳实践并不断加以完善(确立身份、限制权限、记录活动、创建遏制边界等)。

而我们现在正开始将同样的原则应用于企业内部的超级智能。起点是将模型思维链的透明度作为不可谈判的前提。“神经语”不能成为模型推理不透明的借口。但仅有思维链透明度还不够,也不可靠,因为我们尚不知道如何让模型输出本身始终忠实或透明!

你可以而且应该用模型来对抗性地测试和验证彼此。然而,最终可能变成一个不透明的模型处在一个不透明的编排层之内,又被另一个不透明的模型所监视。本质上就是嵌套的黑箱。

正因如此,管辖模型能访问什么、能采取什么行动的控制机制必须置于模型之外。这建立在可追溯到20世纪70年代的信息安全原则之上:程序不得绕过或篡改执行其权限的机制。

今天,这意味着将模型与编排其工作的执行框架分离,也与定义其能做什么的行动空间分离。这还意味着将控制与保障措施外部化。

因此,我们应当围绕可观测性原则来设计这些系统:

  • 模型多样性: 不应让任何一个模型成为重要结果的唯一依赖,也不应让它负责验证自己的工作。
  • 观测一切: 每一个有意义的模型行动都必须留下防篡改的人类可读证据。如果无法被观测,就无法被信任!我们需要能够复现某个结果是如何达成的,而不依赖模型自身来证明。
  • 可验证性: 我们需要持续测试整个系统,包括故障、攻击、边缘情况、系统变更等,而不仅仅是成功的任务。
  • 独立控制: 各组织应能独立决定模型可以访问什么、可以执行哪些操作。
  • 独立可审计性: 验证必须独立于被验证的智能体。任何单一模型都不应同时控制系统行为,以及判定该行为是否与原始意图一致所需的证据。
  • 遏制: 我们必须假设模型已被攻破,并从一开始就对其加以遏制。可以把它想象成紧急刹车。经授权的人应始终能够在模型执行任务的过程中暂停或关闭它。更先进的模型将需要更先进的遏制技术,而我们需要在这些技术上实现标准化。
  • 事件披露: 当这些系统确实发生故障或被攻破时,我们需要及时向受影响方披露,并建立机制来共享出了什么问题、哪些控制措施失效,以及如何防止再次发生,并在全行业分享经验教训。这应包括会改变智能体运行时行为的实现细节。

最值得信赖的超级智能系统,不会是我们最信任其模型的系统,而是能让我们以最低信任度对待模型的系统。

已读完 · 本文由熊猫易读翻译重排