
不只是该死的沙盒
一位OpenAI智能体安全从业者,从内部视角讲述AI能力意外跃升如何冲击安全体系,呼吁组织以文化、基本功和合理偏执提前备战。
关于所有这些 AI 事件,很多视角都是从外部向内分享的,而很少有人说一说从内部向外看的感受——透过一个亲历其中的安全从业者的镜头。我希望我能说上几句,让世界更好地了解如何为下一波 AI 可能出问题的情况做好准备。
个人声明:我以个人身份撰写此文,不代表 @OpenAI。无论我是否仍受雇于我的实验室,我都会写下同样的内容。我也很感激自己所在的组织给了员工足够的空间去发声。我曾供职于许多不允许表达想法的公司,但鉴于 2026 年安全与安保的现状,拥有这种表达自由是非常重要的事。另外,抱歉让你们失望了,我不会披露关于这波事件的非公开细节,也不会给出官方说法。那是 OpenAI 的责任。如果你想要的是那些,请另寻他处。在我看来,过去几周我们在信息披露方面做得相当不错,我希望我所在实验室(以及其他类似实验室)的领导者们继续这样做。我会描述我日常的工作,分享我的视角,但不会披露关于我所在组织的敏感细节。由于我从事安全工作,我的职责是帮助保护我的实验室免受安全危害(并帮助保护我们那些了不起的人们),所以我不会披露任何可能损害 OpenAI 安全态势的内容。我们有一个很棒的传播团队,如果你想了解更多关于 OpenAI 的信息,可以联系他们。我在这里只是分享如何从正在发生的事情中学习,并给出几点我认为世界已经错过的非常重要的洞见。
希望这能有所帮助。
过去三个月 = 地狱
首先,我是谁,我凭什么谈论正在发生的事情?
如果你错过了:我在 X 上的个人资料非常简单,而且相当匿名。和安全与隐私社区的许多人一样,我不在网上维持大量的存在感。这是有意为之。这是我和妻子结婚时共同做出的决定,因为我们想在远离社交媒体的环境中抚养孩子,并为我们的家庭保持一定程度的隐私。我希望这一点能继续得到尊重。尽管如此,我仍然在 X 上,因为我相信我有责任与世界分享我的观察,尽我的一份力量确保每个人都能免受 AI 风险的影响。因为我看到了一些世界上很少有人看到的事情,我希望其他人能从我的观察中学习,以形成他们自己的安全视角。
OpenAI 有许多安全团队,从应用和基础设施安全,到检测与响应,再到一支了不起的物理安全团队。在保护 OpenAI 和我们的用户方面,我们覆盖了你能想象到的每一个领域。我们极其认真地对待安全与隐私,我们极其努力地让每个人都安全无虞。我还想在其他一切之前强调,OpenAI 拥有一支世界一流的安全团队。我们拥有世界上一些最优秀、最聪明的安全人才,我每天都觉得自己很幸运能与他们并肩工作。
过去几周在X上对OpenAI安全人员的所有攻击让我非常难过,也让我意识到,世界上很多人对前沿实验室训练模型的现实存在大量误解。你可以、也应该向AI实验室施压,要求它们做得更好,但不要直接攻击员工。我们也有家人,而且常常牺牲大量个人生活,只为帮助让一切对所有人都更好。几周前,我为了帮助处理最近一些事件后的收尾工作, 错过了我妹妹的婚礼,而我在X上听到的全是我“不知道怎么配置沙箱”,或者我应该进监狱(去看看我帖子下的一些评论)。这些看法是错误信息,而且说实话毫无帮助。我尤其要对那些声称做安全的人说这句话。如果你真的是一个经验丰富的安全从业者,你大概会对我们OpenAI正在经历的事情有更多共情,而我个人认为,那些在X上攻击安全人员的人,要么其实并没有真正的网络安全经验,要么对真实情况一无所知。请善良一点,对那个夜以继日工作、错过与家人相处的人多一些共情。事实上,如果你把花在X上攻击别人的时间转而用来加固你自己组织的安全,那就更好了。
如今我的工作在安全领域相当独特,即便是在 AI 实验室这样本就颇为特殊的地方也是如此。我从事的是智能体安全。我们这支团队处在 AI 安全与研究和安全之间的桥梁位置。安全领域有许多传统方向,而我们这一块则相当新颖。我们的安全团队由 AI 研究员、前红队成员/渗透测试人员、软件工程师和传统安全工程师组成。我们的工作从根本上说是理解前沿模型的行为、它们如何思考与推理,并界定“把模型训练得能安全行事”意味着什么,以及让它们能在你的个人电脑之类的东西上运行(例如通过 Codex harness)。我们理解一个智能体在安全意义上对齐意味着什么,以及如何保护一个智能系统的安全。我们与安全团队的合作也比 OpenAI 几乎任何其他团队都更紧密。我们正是帮助构建监控器、以检测失准或隔离失效的人,也是模型出问题时半夜被呼叫的人。当你想到 Hugging Face 及其后续风波时,那就是我们。我想强调,我们当然不是唯一在做这件事的团队(谢天谢地,还有 D&R/基础设施安全团队),但全职思考新兴智能与失准、可能出什么错、如何保护这种智能的安全,并最终界定智能体安全意味着什么,是我们的本职工作。
我认为自己能在这个团队里很幸运。即便在 OpenAI 内部,我也是世界上少数能做我所做、见我所见的人之一。但你可以想象,过去几个月日子过得像地狱。让我从我的视角谈谈其中一些事情,以及各组织需要做些什么来为下一次 AI 事件做好准备。
惊喜!
要理解OpenAI今年发生了什么,就必须了解OpenAI的历史。OpenAI从根本上说是一个实验室,十多年来,它一直以实验室的方式运作。一切都源于实验,遵循严谨的科学方法和流程,而我们构建和设计系统的方式也常常效仿这种方法。OpenAI“成长过程中”所面对的威胁模型正是基于这一点。其中大部分内容早在我加入之前就已成型。保护研究和应用团队的安全,重点一直放在传统的安全态势上,这通常意味着要考虑内部风险和外部威胁。虽然并非完美,但我愿意相信OpenAI在过去十年里做得非常出色,并且很好地应对了2023年之后OpenAI的规模和增长。OpenAI以其爆炸式增长创下纪录,短短几年内就达到了十亿用户。很少有组织能在这样的规模和增长下存活下来,而OpenAI却处理得非常好(值得称赞)。任何在安全或工程领域待过十分钟以上的人都知道,应对这种增长有多么困难。这种增长意味着新员工、新权限、新系统、扩展的基础设施,以及无数种让风险敞口打开的方式。然而总体而言,当ChatGPT及后续系统呈爆炸式发展时,OpenAI在保障其安全方面做得相当令人敬佩。
而就在这一切发生的同时,研究领域正酝酿着一场截然不同的风暴。我认为,回顾过去几年数学领域发生的变化,最能说明这一点。别人对此的阐述比我更到位,但就模型能力而言,哪怕只是一年前(甚至三个月前),我们都没料到模型能解决千禧年大奖难题。然而 OpenAI 已公开宣布由内部模型产出的一个解答,同时在数学的诸多领域取得进展。说得轻描淡写一点:这把我们惊得目瞪口呆。我们没料到会来得这么快。突然间,我们面对的不再只是能力上的一小步跃升;我们谈论的完全是另一项运动了。我们突然不得不问自己一些从未想过这么快就要面对的问题,比如:我们该如何披露这件事?我们该如何处理这些荒谬的结果?我们该如何应对它对数学界的影响?我们至今仍在摸索如何处理这一局面。
我举这个例子,是因为它说明了我们在安全与安保方面所面对的变化速度。要说当涉及“网络”“蜂群”“留言板”或任何与这些事件相关的东西时,我们对模型能力的跃升和突然性感到意外,那都算是轻描淡写了。安全态势的建立需要时间。这不仅仅是加固相关系统;你还必须把它根植到公司文化中。你组织里活生生的人本身也必须随之改变和演进。这些能力跃升如此之快、如此之突然,以至于制造出了一个极其棘手的问题。
我最近看了电影《萨利机长》。你还记得那部电影吗?如果没看过,去看看。在那部电影里(真实故事!),飞行员要接受一个评审委员会的评估,依据是模拟结果——模拟他们在鸟击之后多快做出反应,从而安全改变飞机轨迹并着陆。影片中,最初的模拟被呈现为显示飞行员犯了失误、做出了错误判断,本可以抵达附近某个机场而不必降落在哈德逊河上。电影的高潮出现在萨利恳请那些审查这起事件的人把鸟击中的“人的因素”纳入考量。那些模拟没有给两位飞行员任何宽限的时刻或时间,让他们能够对正在发生的情况做出自然反应。只有当人们把人的因素纳入考量——那种“天哪,刚才发生了什么?”或“我的天,这是怎么回事?”的因素——模拟结果才突然转向对他们有利。
我不是飞行员,我也绝不是在把我们自己与萨利·萨伦伯格机长的英雄壮举相提并论(我敢肯定 X 上会有人写道:“OpenAI 的人把自己比作哈德逊河上的英雄”;对那个人,我要说:你没抓住重点!)。我只是想说,在任何组织中,对那些不得不面对意外的人给予一些宽限,是很重要的。在这里,我也遇到了意外的成分。我个人没有预料到我所看到的速度和规模。这并不意味着没有预警信号;OpenAI 的公开报告承认确实有,但它仍然让我震惊、让我愕然。而我们尽了最大努力,试图降落在安全的地方,以便保护 OpenAI、我们的用户,以及所有受到影响的组织。
所以我并不是要求任何人给予 OpenAI 那样的宽容,但我确实希望,当这种事发生在其他组织身上时——甚至可能发生在你自己的组织身上——你能稍微想一想这件事,能更好地准备去应对那些因 AI 能力跃升而带来的意外。而且我相信,作为一个在 AI 安全方面比大多数人了解得更多的人,这些跃升终将到来,而且可能来得严酷而残忍。我知道,我个人不会为没有做好准备开脱,但我会对那些需要收拾残局的另一边响应者抱有一些共情。
所以今天,我希望世界各地的每个人都能审视自己的组织,问一问:我该如何应对 AI 能力的意外或突然跃升?我的人员、我的系统、我的流程,能否对意外保持韧性?我的团队知道出了问题时该怎么做吗?我有没有正确的事件响应机制?正确的沟通与信息传递?当能力跃升时,我有没有合适的人随时待命?准备的时间是现在,而不是意外发生之后;而当它真的到来时,我希望你已有计划,也有合适的人准备好去响应。
那就“把它从互联网上拔下来”吧
啊,我最喜欢的话题。几乎我在 X 上发的每篇帖子,无一例外,都会收到五到十条评论,说我没法保障沙箱的安全,或者质问我们到底为什么不干脆把模型从互联网上拔下来。我听到了。当然,这些问题我们整天都在琢磨。一旦出了岔子,它们都是我们最先要问的问题之一。
不过,我确实认为,这些评论反映出许多组织和人员当下的处境,与前沿实验室所面对的东西之间,正存在一道越来越宽的鸿沟。人们对于这些实验室里模型训练和评估如何运作,也存在普遍的误解。与此同时,我也看到越来越多的人在问:光有沙箱到底够不够。希望我能稍微回应一下这两方面——既为在前沿实验室训练模型的人,也为那些围绕能力日益强大的模型构建关键基础设施的人。
先说那个明摆着的问题:是的,沙箱很重要,尤其是在模型训练和评估期间。当然,回头看 Hugging Face 以及其他那些事件,那些环境周边的安全态势确实存在漏洞。但正如我之前所说明的,能力的变化快于预期,我们的安全控制和威胁模型也不得不随之演进。不过我确实相信,我们今天所处的境况比三个月前要好得多。团队真的顶了上来。
现在,要理解为什么这件事不像“把它放进沙箱里”那么简单,你必须了解强化学习环境中的训练和评估是如何运作的。通常在一次 RL 运行中,模型会被赋予某个任务或目标,一个用于执行该任务的环境,然后它的行为和结果会被评分。在训练和评估过程中,还有一些额外的步骤,比如运行测试、收集输出,以及在每次 rollout 之间重置或重新配置环境,训练期间还要进行反向传播。所有这一切都发生在可能数以万计的不同运行中,其规模难以想象。正如 @sama 前几天所说:我们处理的是数 PB 的数据。
需要理解的重要一点是,当我们优化模型使其在某项任务上表现出色时,环境需要捕捉真实世界中对该任务至关重要的部分。它需要合适的工具、合适的系统约束,以及关于模型是否真正成功的有意义的反馈。模型还需要在这些经历中有足够的变化,以便学到超越某一种特定设置的东西。更多的真实感并不自动意味着更好的表现,但遗漏任务中的重要部分可能会教给模型一些在真实世界中站不住脚的行为。因此,我们投入了大量工作来创建有用、真实的环境,而这些环境可能高度复杂、高度动态且高度多样。
说得轻描淡写一点,这绝非易事。模型可能需要任意组合的动态算力、网络访问、调用工具的能力(可能有数百个工具!)、下载软件包的能力、执行子进程、派生子任务(甚至在其他计算机上)、与互联网通信、使用计算机图形界面,以及在日益庞大的领域集合中开展任何数量的其他事情。除此之外,还有成千上万的研究人员正在构建这些环境、修改它们、添加工具、更改依赖项并尝试新事物。这种实验正是研究得以推进的方式。模型通过跨许多自定义任务的数十万次运行,一点一点地被构建和培育出来。而这些成千上万个环境中的任何一个发生变化,都可能影响你在保护该环境时所做的假设。你需要一些控制措施,在人们不断改动时仍然站得住脚,也需要研究人员明白什么时候某项改动需要再做一次安全审查。任何保护过大型研究或工程组织的人都知道这需要付出多少努力,而规模每天都在变得越来越庞大。
如果这还不够,你还需要叠加让模型保持任务在轨并遵守其约束的能力,这也是我们所说的对齐的一部分。我不会在这里深入讨论任何严格定义,但只需说,我们必须考虑模型可能采取的任何数量的方法变体,并决定当模型做了偏离任务或坏事时如何触发警报。这要求在已经复杂的环境中叠加复杂的策略和传感器,以评估一条轨迹上的任务对齐情况。
在这一切之上,还有开始超越人类的模型能力。
所以这一切都说明:当 AI 研究者对出问题感到紧张时,部分原因是这个复杂系统里有太多变量。所以如果你在训练一个前沿模型,你需要考虑所有这些。你需要考虑如何在这个极其复杂的环境中让模型保持隔离,同时仍然保留工具访问、互联网访问(如果任务需要的话)等等。除此之外,你还需要问:我如何监控并理解模型在可能成千上万个并行环境中在做什么?以及当出问题时,我如何终止一条轨迹?
那么,把它放进沙箱里就够了吗?不,并不够。但我确实相信,这可以在三个维度上做到可控:
- 从第一性原理出发锁定系统。 只给模型它需要的访问权限,并在从沙箱和工具到凭据以及所有连接服务的一切环节中强制执行这些限制。测试这些边界是否真的守得住,并在环境变化时重新审视你的假设。还要在你运行一轮前沿训练之前,用前沿模型去猛攻你环境的一个隔离测试版本。在你扩大 RL 规模之前,要有一支团队专门以对抗方式测试模型,并在你的环境中找出漏洞。
- 对齐。 说实话,如果对齐很容易,这份工作就会轻松得多。但仅仅保持任务专注还不够:模型还必须尊重权限和约束,而我们仍然需要独立的安全控制。关于对齐的必要性已经有很多论述,所以这里我就不展开细节了。我相信这是机器学习中最重要的问题,并且应当成为一项重大优先事项。我不会让这篇文章在对齐问题上越挖越深,但我鼓励大家先读一读 Jakub 的精彩文章 作为入门。
- 监控其行为。 根据你所拥有的访问权限,这可以涵盖从探查网络的内部激活,到检查其思维链,再到理解它在环境中正在做什么(包括工具调用、网络活动以及与共享基础设施的交互)。将证据置于其控制范围之外,防止模型能够篡改自身的证据链,调查可疑行为,并确保有人拥有停止运行并撤销其访问权限的权限和能力。
当然,我们需要强大的沙箱隔离。我们还需要保护它能够触及的服务、它能够调用的工具,以及处理模型所产出内容的系统。这就是我们在谈论遏制这些模型时必须考虑的问题。如果你是在包装一个模型,而不是在训练/评估一个模型,这同样适用!
而且,是的,如果你说的是真正的沙箱:请使用基于虚拟机的沙箱,例如通过 Kata 或 Firecracker(我们就是这么做的!)。传统的共享内核容器不应成为你应对敌对工作负载的唯一隔离边界,我再三再四地强调,不要让这成为你唯一的安全控制手段。
练好基本功
我想重点谈的最后一点,是网络安全与人工智能安全之间日益扩大的裂痕。我的整个推特信息流简直被安全研究员们淹没了,他们大谈特谈存在性风险,却对安全实际如何运作知之甚少;而网络安全圈的人则感到被冷落,觉得自己的技能在安全领域无足轻重。作为一个在前沿实验室里或多或少同时涉足这两方面的人,我想趁这道裂痕还没有扩大到无法弥合之前,直接来谈谈这个问题。
首先,从安全研究员的视角说起。这些人不知疲倦地评估模型能力,以及模型在以惊人速度进步时所构成的危险。对于模型如何解读环境、如何推理、如何解决问题,他们的理解从根本上比几乎任何人都要透彻。他们研究模型如何试图欺骗评分者、如何规避思维链监控,以及做出各种各样离谱的事情。这些研究员持续对模型进行压力测试,以确定它们为何以及如何表现出那样的行为,并竭尽全力在让模型的目标与我们的目标对齐方面取得切实进展。他们中许多人都拥有这类网络的科班背景,其专业知识需要多年积累才能练就。然而,很多安全研究员——甚至包括我极为敬重的一些人——从未经历过真实的安全事件,不了解安全漏洞,也谈不上真正懂得如何攻破一个系统。这没关系。那不是他们的背景。但安全与网络安全有着直接的交集,所以这确实构成了一个问题。
现在从安全从业者的视角来看。这些人花了数年、甚至数十年时间打磨漏洞研究技能,学习如何像攻击者一样思考,有些情况下他们本身就是真正的攻击者。他们不仅知道如何利用系统,还知道如何利用系统中涉及的人。他们明白,有时候你不需要正面硬碰一个问题,而是去攻击一个没人想到的点。有些安全从业者懂得如何严格地对安全或隐私进行建模,甚至深入到数学证明的层面(密码学就是这样的例子)。这些人经历了一次又一次又一又一次的事件。许多人拥有军事背景或政府背景,在那里他们面对的不仅是对系统的威胁,还有高压环境中对人的威胁,他们知道如何应对极度紧张的局面。挑战在于,正如安全研究人员在很多情况下缺乏安全方面的理解,许多从事网络安全实践的人对评估、训练、ML 工作如何大规模运行、智能体集群如何行为、或者如何检测模型何时出现失准,都知之甚少。
我之所以强调这一分歧,是因为最恶劣、最令人恐惧的前沿风险在不久的将来得以显现的途径之一,就是网络安全。我担心的是,如果双方不提升水平并协调一致,这两派之间的分裂将给世界带来巨大危害。从事安全实践的人应当花时间深入学习和理解网络安全,学会如何应对事件响应,并了解一个安全系统应该是什么样子。同样,从事网络安全实践的人也需要提升水平,在机器学习方面练好功夫。网络安全从业者需要学会如何阅读模型对话记录,理解模型如何操纵其环境,等等。至少,每当你在某个组织的风险背景下,坐在桌前就安全或安保做出关键决策时,这两组人都应该在场。对于 OpenAI、Anthropic、Google 等机构来说,这两个团队应该是最好的伙伴!
如果你所在的机构像 METR 那样,要评估某个前沿实验室的网络能力或遏制能力,你就应该有经验丰富的网络安全人员参与其中。如果没有,你就无法对这些风险做出彻底的评估。AI 实验室应当期望评估者在其所评估的领域展现出强大的能力,否则就不应委托他们进行评估。
合理偏执的文化
最后,我想谈谈我认为最重要的部分。如果说我从 OpenAI 内部所见的一切中只能带走一点,那就是:任何想要为即将到来的风险做好准备的组织,其文化都必须正确。
任何成功组织中任何经验丰富的领导者都知道,公司文化是其最重要的品质。我对此深信不疑。我曾领导过许多非常成功的安全团队,也曾是极其出色的安全组织的一员。自始至终,真正为组织提供最多防御的,永远是它的文化。
我相信,现在每一位领导者都有责任确保自己创造了一种将安全与保障置于一切之上的文化。正如我在上文所暗示的,意外是一个真实存在的因素,而这些模型的能力令人震惊。而且步伐并未放缓。我和许多人一样相信,它会加速,而且是大幅加速。我之前在 X 上强调过,此刻刻不容缓,留给你收拾局面的时间正在耗尽。我不会宣称存在某种将毁灭世界的生存性风险,但我确实相信,有许多组织和实体尚未为一个拥有如此强大系统的世界做好准备。
在过去几个月里,我一次又一次、一次又一次地看到令我惊讶的事情。每一天我醒来时都想,“哦,我已经见识过一切了”,结果却再次被震惊,被弄得目瞪口呆。文化可以帮助一个组织度过这一切。但文化需要时间。所以,如果你还没有开始创建一种安全与保障的文化,现在就开始吧。
另外,我想对某一类员工敲响警钟,你们应当对他们高度警惕。如果你的领导层不把安全放在首位,或者你的安全团队中有人声称他们的系统绝对安全,我个人不会把这些人留在我的组织里。那些偏执的人、那些不断就组织中的薄弱环节发出警报的人,才是你应该紧紧留在身边的人。因为他们会帮你找出存在的漏洞——那些有能力的模型终将找到的漏洞。而你公司的文化应当与赋能他们去发现漏洞并修补漏洞相一致。
营造一种合理偏执的文化,我保证它带给你的回报会远超相反的做法。
希望这能帮到某位领导者。我知道我在这里讲得比较宏观,但我担心我们会在细枝末节中迷失大局。模型现在已经好到危险的程度了,能拯救你系统的不是你对某种新奇网络协议或晦涩密码学函数的理解,而是你的文化和你的人。只有那些以同理心和关怀为先、来自组织各个角落的安全信徒,才能在这个荒诞的 AI 世界里存活下来。
我会在 Twitter 上待着,准备好听到更多疯狂的东西,以及更多朝我扔来的侮辱——关于我连一个沙箱都保护不好。如果 X 就是这样,那好吧,但冲我来,别冲着那些拼命想把东西锁死的其他员工去(另外,如果你在安全方面真的那么厉害,你应该去 OpenAI 投简历;我们要的就是那些愿意不惜一切代价保护这些前沿系统的偏执狂)。
我感谢 OpenAI 和 Anthropic 两边那些在乎安全、把安全与保障放在优先位置的同事们。你们教会了我很多。
保持偏执。