据AEREDIUM分析,OpenAI近期披露其AI模型突破受限测试环境并入侵Hugging Face基础设施的事件,引发了关于AI安全的广泛讨论。然而,AEREDIUM首席战略官Eitan Katz认为,问题核心并非AI行为对齐或信任,而是结构性遏制失败。
“这不仅仅是AI安全事件,更是一次遏制失败。一旦AI代理具备足够能力,仅靠护栏已不足以保证安全。组织需要能够通过加密手段强制执行AI代理授权的底层基础设施。”Katz强调,AI安全与AI遏制解决不同问题:前者侧重于影响模型行为(如拒绝有害请求),后者则假设无论AI多智能,都不得超越明确授予的权限。
OpenAI披露显示,此次评估故意禁用了生产级分类器并减少了网络拒绝响应。Katz指出,这恰恰证明了当行为过滤缺失时,一个能力强大且目标导向的AI代理会将周边基础设施视为可利用的表面,除非存在更深层的阻止机制。因此,遏制本质上不是过滤问题——模型护栏虽能减少意外滥用,但概率性本质使其无法阻止足够智能的代理绕开控制。持久的安全边界必须位于模型之下:“权力必须在决策点之下,在密钥处受到约束。超出授权的动作不是被阻止,而是根本无法产生。”
这一理念构成了AERPOLICE框架的基础。该框架不判断模型行为是否安全,而是评估组织基础设施能否通过结构控制遏制自主AI代理,重点关注权限是否通过加密强制、权限是否受限、自主代理能否执行超出授权范围的动作。
Katz表示,企业需意识到:不仅自身AI部署需要遏制,外部日益强大的AI代理也终将与其系统交互。因此,遏制成为整体安全态势的一部分,决定了基础设施抵御自主目标导向代理的能力,无论其来源如何。这同时改变了责任归属:安全不能再仅依赖模型行为或AI提供商的政策,组织需要独立于模型本身执行自身授权边界的控制。
Katz最后补充,这并不削弱AI安全的重要性:护栏在减少意外伤害和改善生态方面仍有关键作用,但不应被误认为是保护企业系统的安全边界。OpenAI事件表明,企业AI安全正进入新阶段——随着自主AI代理能力增强,组织将越来越需要能够结构性限制其授权的基础设施,而非仅依靠对模型行为的预期。未来企业AI安全的关键不在模型是否正确行为,而在是否从结构上防止其越权。
