智能体时代的网络安全
花1000美元在AI推理上,就足以让恶意行为者攻破你正在构建的任何软件;因此,不自我攻击就无法防御,自我攻击是AI时代无法伪造的"工作量证明"。

在AI推理上花费1000美元,很可能足以让一个恶意行为者攻破你(或你的团队)正在构建的任何软件。
他们可以使用不受限制的模型。他们可以使用中国模型。他们可以用任何东西。如果你没有在自己这边投入相应数量的令牌,你很可能以某种方式被黑客攻击。
也许不是完全的生产数据库访问权限。也许他们会发现点什么。也许他们会对你进行DDoS攻击。地址泄露。支付信息。API密钥。声誉损害。我不知道。取决于他们能走多远。
只需要一个带着几百美元的恶意行为者就够了。
这不是什么未来的科幻情节。我们正在目睹第一代真正强大的不受限制模型,它们能在中档电脑上运行。Qwen 3.8 27B在24GB内存上就能跑,也许32GB。这足以对95%以上安全措施不佳的软件造成巨大破坏。
模型迭代加速风险
现在想象几个月后。几年后。我们从不受限制的小型模型开始。现在我们有了不受限制的中型模型。GLM 5.3 Flash已经是网络安全基准测试中的默认模型之一,即使与前沿模型相比也是如此。那还是受限版本。不受限制的DeepSeek,不受限制的GLM……一个预算普通的人就能把你彻底搞垮。
关键在于你投入的令牌数量。100美元。1000美元。10000美元。这是主要变量。
再过一两代模型,这将成为每个人的问题。每个小网站。每个没有花钱攻击自己的软件。
所以,如果你没有尝试过攻击自己,你就无法防御自己。
这就是AI时代的工作量证明。
比特币之所以有效,是因为在协议层面能量无法伪造。同样的原理。你花了多少钱试图攻破自己的软件?这个数字同样无法伪造。
做法很简单。你拿不受限的模型去攻击自己的应用。设定一个预算。只给它们一个攻击者看网站时能知道的信息——没有内部资料,没有源代码,没有机密。然后修复它们发现的问题。
就这么简单。
大厂无恙小厂危
人们以为首要目标是谷歌、脸书或苹果。但事实并非如此……那些公司没问题。
它们能提前接触新AI模型。它们直接与OpenAI和Anthropic合作。它们有数万名工程师。当Mythos发布时,这些公司率先拿到手,但大多数仍然在自己的系统里发现了安全问题。
问题出在其他人身上。中小型企业。任何开发软件的人。
我之所以知道,是因为我们已经尝到过一点苦头。去年,当我们在Product Hunt上发布Vectal时,立刻收到了大约15封关于漏洞的邮件。大部分是假的。其中一封确实有值得修补的地方。他没有真正的访问权限,但已经足够了。一旦公开发布某样东西,当天就有人开始测试你的产品。
这只是时间问题。可能明天发生。可能下个月发生。但不会拖到一年后。这近在眼前。
如果你跳过这一步,省下的不是钱,只是把代价推迟到以后,用时间偿还。一旦有人侵入,你就得整天整夜地试图赶走他们、恢复访问权限、收拾这个烂摊子。就像跳过会计一样。就像跳过法律一样。
这将成为开发任何软件的主要成本之一。你在自我渗透测试上花了多少token。这就是智能体时代的网络安全。
——作者:David Ondrej(散步时口述,后经手工整理成此文)