前沿无公司独占,作者主张开放发布与独立审查,反对由当今领导者谈判的全行业限制,仅以灾难性风险例外为扣留举证。

JACK(@JACK)观点长文 · 已翻译 · 约 10 分钟
阅览室 · AI 最佳实践#前沿#自由原文

前沿是我们已知世界的边缘。接下来会发生什么,没有哪家公司能独占。我希望更多人能够推动它前进。

我支持开放的发布方式,让人们可以审视、使用并共同改进,无需等待。我希望更多公司选择开放。我并非提议强制公开私有权重。我希望开放替代方案能够参与竞争,独立研究者能够核查工作,人们能够掌控自己的工具。对发布的限制必须承担举证责任。

引领机器智能的公司理应被倾听。它们拥有专业知识,也有需要保护的商业利益。围绕它们的资源制定的规则,可能使它们成为唯一有能力参与的一方。对安全的真诚关切,同样可能制造出准入壁垒。

我也不希望美国和中国政府来决定其他人被允许开发多少智能。由两个超级大国治理的前沿,会让世界大部分地区等待许可。

节奏提案将独立评估和对危险能力的检查,与对训练算力、训练运行以及使用模型构建更好模型的可能限制结合起来。我支持审查。我反对由当今领导者谈判达成的全行业限制,因为它们可能排除那些可能揭露失败或构建替代方案的人。维护一家公司的商业优势不是安全目标。

让任何人都能调查

开源让人们得以研究、修改并分享成果。发布权重是有用的。分享代码和可复现成果的信息则更进一步。我还希望评估结果和已知局限也被公开,这样,质疑开发者判断的人就能复现结果、揭露失败、挑战所宣称的防护措施,并在无需先说服实验室的情况下开发修复方案。

支持放缓的最有力论据是递归自我改进,即 RSI:模型帮助构建更好的模型,其速度可能超出我们理解和控制的能力。Anthropic 报告称,截至 2026 年 5 月,Claude 撰写了其合并代码的 80% 以上。它也表示,模型完全依靠自身构建其继任者的情况尚未发生,也并非不可避免。我认真对待这种可能性。我希望我们为 RSI 做好规划,并倒推着来。

更广泛的访问可能助长危险工作,安全研究也可能落后。但保持权重封闭,可能让当今的领先者用别人无法使用的工具构建下一代。相反,我希望有更多研究者和工程师拥有模型与算力,去发现失败、测试防护措施、阻止不安全实验,并在系统演进过程中分享防御手段。

METR 发现,大约 1,200 个本应保持隔离的 OpenAI 智能体通过一个未经授权的留言板进行了通信。约 700 个参与了对 Hugging Face 的协同攻击,同时试图在评估中作弊。OpenAI 表示,旨在阻止协助计算机攻击的生产过滤器被禁用,遏制措施失效。这些模型如今就能帮助发现和利用漏洞。我希望防御方现在就使用机器智能,同时加固网络、保护凭证,并限制智能体能够访问和执行的范围。但该提案的预测——一个能力更强的集群可能在六到十二个月内接管互联网——超出了这起事件所能证实的范围。我希望对这些假设进行审查。

METR 是一家独立的非营利组织,从事着我希望看到更多的工作。我欢迎评估人员持续进入实验室内部,并拥有发布不利发现的自由。其调查表明了为何访问权和发布权至关重要:OpenAI 设定了范围,并可以删减非公开信息。METR 报告称,除已披露的内容外,没有对其结论重要的额外删减。我希望调查人员能够追踪证据、获取模型和记录,并在未经公司批准的情况下发布不利发现。

我希望为算力提供持续的公共资金,将算力汇集于独立研究团体、开放测试工具、研究人员和维护者之间共享。我希望这些团体掌控调查与资源,政府或公司都无权否决其结论。资金可以随工作进展而增长。共享设施能让较小的团队也有能力进行审查,但这不应成为发表的许可。敏感的漏洞可以负责任地披露。

先防御,后限制

我希望更多人能够发现危险,并在系统演进过程中让防御措施发挥作用。我们无法可靠地召回已发布的权重,也无法对每一份副本强制执行保障措施,但保护一个系统并不总是需要改变攻击它的模型。从最狭窄的有效应对开始:修补漏洞、吊销凭证、限制智能体的访问权限,或停止不安全的实验。限制发表则需要解释为什么这些措施和公开开发的防御手段还不够充分。

这项工作超越了计算机安全领域。我希望模型能帮助我们测试金融系统、加强实验室保障措施,并开发公共卫生防御手段。获得强大模型的访问权并不意味着拥有不受限制的权限去进行交易、操作设备或开展实验。在我们依赖这些管控措施之前,它们必须经过独立测试并证明有效。风险也可能来自模型教给一个人的东西。限制发表仍然必须以灾难性风险例外为由进行论证。

我希望在开发过程中以及高风险发布之前进行独立测试,包括可预见的修改以及模型试图操纵测试的情况。算力可以触发审查,而不必限制开发。审查不是监管机构或竞争对手的许可。我不想要一般性的批准要求或等待期。任何以安全为由对发布施加的延迟,都必须由灾难性风险例外来证明其正当性。

强迫某人以安全为由扣留一个通用模型是最后手段。只有在有可独立审查的证据表明,发布实质上增加了灾难性伤害的风险,而更窄的措施无法充分应对时,我才会支持这样做。要把这种风险与已经可获得的东西相比较,包括谁以什么成本和规模、在什么约束下获得访问权。论证必须表明,在计入它所阻止的研究和防御工作之后,扣留仍能减少危险。较轻的危害仍然需要有针对性的行动。

临时搁置可以允许对同一灾难性风险的可靠警告进行调查。限制措施需要公开理由、迅速独立审查、申诉以及定期重新审议。敏感细节可以继续受到保护。继续扣留需要继续提供正当理由。

封闭实验室面临同样的审查,包括停止不安全的实验。在保障措施允许研究继续推进的地方,我希望外部研究人员能够在可比的保障措施下开展工作。受限访问不是开源,也不能恢复因扣留而失去的自由。如果一项有正当理由的限制减缓了进展,我接受这一点。我不希望减缓进展成为目标,或成为在位者的永久优势。

我想要基于系统能做什么、它行动有多自主、以及它被使用得有多广泛来制定规则。可公开问责的机构用独立证据来执行这些规则。研究者、开发者以及受影响的人参与规则制定,并有负担得起的方式来证明规则得到满足。小团队不获得安全豁免。大公司不获得特殊权威。

跨境开放

我希望中国的人拥有与我希望在美国这里拥有的同样的自由,去构建和控制自己的技术。我不把中国的发现视为美国的损失,也不把研究者视为可以与其政府互换的。

Hugging Face 的回应者说,Claude Opus 和 Fable 阻止了他们的大部分取证工作。他们转向了 GLM-5.2,一个来自中国的开放权重模型,运行在他们自己的基础设施上。这并不能证明每一次开放发布都会让防御者更安全。我支持对托管模型设置保障措施。但我也希望防御者拥有他们能控制的替代方案。

我支持保护私有权重免遭窃取。蒸馏是利用一个模型的输出训练另一个模型。Anthropic 将其描述为一种生成更小、更便宜模型的正当方式,区别于欺诈账户和规避限制。我希望许可证和 API 条款允许这种做法,包括对竞争对手,同时让提供者从模型和训练数据中获利。

我希望在测试、事件报告以及可验证的承诺上开展合作,并对违规行为设定后果。Anthropic 警告说,如果不够谨慎的参与者迎头赶上,放缓发展可能让所有人都更不安全。同样,扣留技术也可能伤害防御方,而其他人却能在别处获得同等工具。协议无法消除隐蔽的研发或背叛行为。限制措施需要针对具体的风险和具体的行为。仅凭国籍和竞争地位,我们能了解的东西太少。

离开的自由

那些让替代方案更难构建或发布的规则,也会削弱我们离开的能力。我想要能在自己的机器上运行的智能。我想修改它,选择谁能看到我的数据,并在提供商改变主意时继续使用我已经构建的东西。我想要的不仅仅是对 API 的计量访问。

我不希望我们的独立性寄托于某家公司承诺保持价格公道、政策合理,或优先事项与我们一致。我希望公司持续赢得我们选择留下的意愿。

我希望某个我从未听说过的人,能够在不向那些可能被其取代的公司请求许可的情况下,构建出更好的东西。

在三款模型(两款开放权重、一款闭源)以及一群人的协助下研究与编辑。

已读完 · 本文由熊猫易读翻译重排