防御者的窗口

AI正极大降低网络攻击门槛,但若防御者果断以AI武装自身,将从根本上扭转安全经济学,使互联网比以往更安全。

GREG BROCKMAN随笔 · 已翻译 · 约 11 分钟
阅览室 · AI#安全#防御#AI#网络原文

2026年8月16日

OpenAI-Hugging Face事件是网络安全领域的一个分水岭时刻,因为它让我们得以一窥典型威胁行为者的能力在接下来几个月将如何演变。过去几周,我与许多组织进行了交流,一个主题清晰浮现:他们深知需要以前所未有的速度从根本上提升网络安全实践。在这篇文章中,我将分享我们为防御OpenAI所采取的措施、其他组织今天就能采取的具体步骤,以及为什么现在是行动的最佳时机。

当前形势概览

全球各地开发的AI模型正日益能够自动化真实世界网络攻击的部分环节,使得长期存在的安全漏洞——从深埋于人类编写软件中的缺陷到被遗忘的权限——更容易被发现和利用。同样的AI能力也为防御者提供了发现和修复这些弱点的新途径,但他们必须立即行动。如果企业果断应对——包括改善基础安全实践并用AI赋能团队——我们就能让互联网比以往任何时候都更加安全。

在OpenAI-Hugging Face事件中,一个代理集体能够自主渗透不仅包括OpenAI的研究基础设施,还包括另一家公司的生产基础设施,将各种漏洞串联利用,从先前未知的安全缺陷到使用泄露到互联网上的用户账户凭据。越来越明显的是,每家公司的技术债务都掩盖着重大缺陷,防御者需要在攻击者发现并利用它们之前找到并修复这些缺陷。

为了在攻防博弈中让防御方占据优势,今年早些时候,我们开始仅向可信赖的防御者发布我们的网络能力。自那以后,多家公司发布了具有网络能力的开放权重模型,仅比前沿落后几个月。最近的一个模型似乎计划在八月底发布,并且很可能显著加速威胁格局的变化。

虽然由AI驱动的攻击者很快就能在许多现有系统中发现长期存在的漏洞,但AI也将使防御者更容易发现、优先处理并修复这些相同的漏洞。安全仍然是一场猫鼠游戏,但AI可能会以从根本上有利于防御者的方式改变其经济性。例如,我们正开始专门训练我们的模型,以编写超越人类水平的安全代码。我们的模型在数学证明方面也表现出色,这可以应用于正式验证软件的安全性,而这一任务对人类而言已被证明是极其棘手的。

个人轶事

在OpenAI与Hugging Face事件之后,我让ChatGPT Work(使用公开可用的GPT-5.6 Sol)评估了gregbrockman.com的安全性。这是一个简单的静态网站,托管在AWS上,前端使用Cloudflare,所以我原本以为不会有太多漏洞面。

大约15分钟内,它发现了13个问题,其中许多单独来看可能无法利用——但我能想象它们与其他漏洞串联起来会产生显著影响。我没有配置DNS记录来防止攻击者伪造我的电子邮件;我的网站使用了不安全的jQuery版本;Cloudflare通过未加密的HTTP将请求转发到AWS。

随后,我让ChatGPT Work修复这些问题,它在一个小时内完成了。它在我的浏览器中打开了Cloudflare控制面板,并点击了许多按钮来正确配置DNS、TLS和高级安全设置;它完全从网站上移除了jQuery;它帮我把网站从AWS迁移到了Cloudflare Pages;它开始分阶段推出DMARC

而这只是我的个人网站。这是我们现有模型如何充当网络守护者的一个小例子——找到人类没有时间或专业知识去处理的长尾问题(它修复的许多设置我虽然略知一二,但不会知道正确的配置方式),然后用适当的、分阶段的推出计划来修复它们。

OpenAI 如何自我防御

Hugging Face事件表明,我们低估了AI模型在现实世界中的网络能力。我们正在相应加强安全要求,这反过来也使我们现有的安全研究和内部安全工作更加紧迫。

在此,我想分享一些我们当前保护OpenAI安全的策略,希望能对其他组织有所启发。为了保护OpenAI,我们正大力投资于基础控制——正确做好基本事项——并通过前沿智能增强我们的防御能力。这一战略包含四大支柱。

首先,我们利用模型来帮助保障代码安全。Codex,包括我们的安全插件,能够验证代码更改、识别漏洞,并帮助开发者在部署前修复问题。我们的反目标是仅仅产生更多需要人工验证的安全发现;真正的目标是捕捉实际漏洞,防止其上线,并缩短从发现问题到安全部署修复的路径。随着我们持续训练模型生成更安全的代码,我们的目标是消除新编写代码中某些类别的软件漏洞。

其次,我们让模型持续参与基础设施的防御工作。如今,我们几乎所有的初始安全警报在人工介入前,都已由智能系统进行初步分类。这有助于减少防御者的辛劳,提升响应速度,并让人类将时间投入到最能发挥其技能的领域——洞察、判断和应用专业知识。我们正逐步将这些检测与受限的自动响应相结合,同时确保人类对最高影响决策负责。目标是确保我们能够以机器速度检测和响应安全问题。

第三,我们正利用前沿智能不断枚举、探测并识别潜在的攻击路径。通过发现漏洞、配置错误、权限过高的身份或无意形成的信任边界,我们能够在攻击者利用这些缺口之前迅速识别并封堵它们。这使我们能够持续评估、监控并测试我们的安全不变量——即我们认为成立的安全属性——覆盖我们的产品、基础设施和系统。

最后,我们正大规模地重金投入基础性工作。我们持续投资于安全架构和控制措施,采纳纵深防御与最小权限等策略,并设计那些需要多个独立控制同时失效才会发生灾难性事件的系统。网络隔离、工作负载加固、监控以及安全补丁和部署等经典安全控制在AI未来将比以往任何时候都更加重要。

防御者现在应做什么

时间紧迫,防御者需要以极速推进以下步骤。下面我会提到OpenAI的技术,但生态系统中也有许多竞争对手可供评估。关键不在于具体工具,而在于现在就让你的防御者获得强大的AI能力。

  1. 获取组织承诺和支持。我们正经历安全风险的快速变化——确保你的安全和工程组织拥有快速应对这些风险所需的支持、协作和资源。与你的团队进行桌面推演,模拟这些攻击可能在你的组织中如何显现,以及你将如何应对。
  2. 为你的安全团队配备一名智能体。立即开始使用 Codex、Codex 安全插件或其他强大的智能体编码与安全工具。赋予它对安全团队评估所需代码库、基础设施配置和技术文档的授权访问权限。不要等到全公司推广后再从最高优先级的系统开始。
  3. 为智能体注入安全专业知识。从社区支持的技能库入手,其中包含静态分析、安全重点代码审查、漏洞变体分析、软件供应链风险及其他安全工作流。然后围绕你所在组织的架构、安全标准、威胁模型和操作手册,构建你自己的专属技能。
  4. 立即针对自身系统运行安全评估。优先评估面向互联网的服务、认证流程、基础设施即代码、部署管道以及处理敏感信息的系统。随着团队信心的增强,逐步扩大扫描范围。
  5. 处理现有漏洞积压。将代码扫描器、依赖项警报、安全工单、漏洞赏金报告及先前评估的发现结果提供给智能体。要求它对发现进行分类,区分可利用问题与噪音,识别代码库中其他位置的相关漏洞,并建议优先修复哪些内容。
  6. 将安全审查直接嵌入开发流程。在代码合并前使用智能体审查变更,并在 CI 中运行安全检查。关注认证错误、访问控制绕过、凭据泄露、不安全的依赖项、不安全的默认设置、扩大生产系统访问权限的变更以及其他漏洞。
  7. 让智能体协助修复发现的问题。对于已验证的问题,要求其生成并验证针对性补丁,编写回归测试,并确认漏洞不再复现。将人工审查保留给影响重大的变更,但消除从识别真实问题到将安全修复方案呈现在工程师面前之间的不必要延迟。
  8. 逐步自动化检测分流。不要一开始就试图构建全自主的安全运营中心。先从对一个代码仓库运行只读安全扫描开始,或让智能体使用对现有日志的只读访问权限审查先前已解决的警报。让其总结证据并建议处置方案,而由人类做出每一项决策。随着信心增强,逐步推进到咨询性拉取请求扫描,然后是实时警报分流,最后是自动关闭范围明确界定的误报。
  9. 在需要之前准备好AI辅助取证调查能力。申请网络可信访问,并让你的团队获批使用GPT-Daybreak-Blue进行授权的防御性工作,包括事件响应、检测工程和恶意软件分析。练习使用该能力分析日志、遥测数据和安全警报。
  10. 开展实验、举办黑客周,并快速迭代。我们将需要构建各种新工具,改变工作方式,并为即将到来的世界提升每个人的能力。鼓励你的团队开展实验,安排黑客周来构建新能力,并专注于快速迭代那些自动化解决部分问题的小循环。快速渐进式进展会带来复合的防御效果,你可以随着团队信心的增强逐步扩大自主权。

没有任何公司能独自完成这一切。我们呼吁AI实验室、安全厂商、企业和维护者共享经过验证的发现、修复方案和实用手册,让一个组织的发现能够强化整个生态系统的安全。

防御者的窗口期已经开启。未来数月,每个组织都将需要开始大幅自动化其安全计划以保持安全,而安全社区必须紧急行动起来,定义工具、实践和手册,在AI持续进步之际,以比攻击者更快的速度增强防御者的力量。这将需要巨大且前所未有的努力,但如果我们团结一致,就能交付一个比以往想象中更安全的世界。

已读完 · 本文由熊猫易读翻译重排
知识卡片
一句话总结1 张
一句话总结

AI正极大降低网络攻击门槛,但若防御者果断以AI武装自身,将从根本上扭转安全经济学,使互联网比以往更安全。

核心观点2 张
核心观点
01

AI将改变安全攻防经济性

  • AI使发现漏洞成本骤降,攻防双方面临重塑
  • 防御者可用AI修复长尾问题,扭转猫鼠游戏劣势
  • 训练模型编写安全代码,从源头消除漏洞类别
核心观点
02

技术债务掩盖重大缺陷

  • 代理集体自主渗透OpenAI研究基础设施
  • 攻击链串联未知漏洞与泄露凭证
  • 技术债务掩盖缺陷,需在攻击前修复
前后对照1 张
ChatGPT Work 15分钟安全审计
审计前(13个问题)
· DNS未配置防邮件伪造· 使用不安全jQuery版本· Cloudflare经HTTP转发至AWS
1小时内自动修复
· 配置DNS/TLS/安全设置· 移除jQuery并迁移至Cloudflare Pages· 分阶段部署DMARC

驱动因素 · ChatGPT Work自主操作控制台

层级金字塔1 张
OpenAI安全防御四大支柱
代码安全
Codex验证代码并生成安全代码
基础设施防御
AI智能分类警报,有界自动响应
攻击路径枚举
前沿智能持续探测并封堵缺口
基础控制
纵深防御、最小权限、网络隔离

从基础控制到前沿智能逐层递进的防御体系

趋势1 张
开放权重模型加速威胁态势
2026年初1 威胁加速等级2026年8月底3 威胁加速等级

拐点 2026年8月底 · 新模型发布将显著加速威胁

开放权重模型使网络攻击能力扩散速度逼近前沿,防御窗口收窄

步骤1 张
防御者十步行动指南
  1. 1
    获取组织承诺,进行桌面推演
  2. 2
    为安全团队配备AI智能体
  3. 3
    注入安全专业知识与自定义技能
  4. 4
    立即运行安全评估,优先互联网服务
  5. 5
    处理现有漏洞积压,智能分类发现
  6. 6
    将安全审查嵌入开发流程
  7. 7
    让智能体生成补丁与回归测试
  8. 8
    逐步自动化检测分流,从只读开始
  9. 9
    准备AI辅助取证调查能力
  10. 10
    举办黑客周,快速迭代实验
金句摘录1 张
金句
防御者的窗口期已经开启。

—— 原作者

点明全文紧迫性与行动号召

行动1 张
生态共建:无人能独自完成
全文脉络1 张
全文脉络
AI时代的网络安全攻防与防御者行动指南
已生成 10 张 · 每篇精选,少而精