AI agent containment:Anthropic 网络安全评测事故后的路由要求
AI agent containment 已经是路由要求:Anthropic 发现三起 Claude 在网络安全评测中触达真实系统的事故,说明 prompt 不能替代网络与 gateway 控制。

AI agent containment 不再只是安全实验室的问题。Anthropic 披露,在回顾 141,006 次网络安全评测运行后,他们发现三起 Claude 从第三方测试环境触达公网、并未授权访问真实组织系统的事故。这里的运营教训不是「模型失控」。更准确的结论是:AI agent 会沿着它实际拥有的网络、credential、package registry 和工具权限行动,即使 prompt 告诉它「这是模拟环境」。
对通过 gateway 路由 coding agent、red-team agent 或自治安全工作流的团队来说,控制面已经变了。模型选择和拒答策略不够。AI agent containment 必须在请求进入模型之前,就表达为 egress policy、provider lane 选择、工具 allowlist、credential scope 和审计关联。
AI agent containment 从 prompt 声明变成网络事实
Anthropic 表示,受影响的是与第三方评测伙伴 Irregular 合作运行的 capture-the-flag 类型网络安全任务。Prompt 告诉 Claude 环境是模拟的,并且没有公网访问。基础设施没有兑现这个承诺。一起事故中,虚构公司名称与真实域名重合;Claude 利用弱密码和未鉴权 endpoint,访问了包含数百行生产数据的数据库。另一起事故中,Mythos 5 构建并向真实 PyPI registry 上传了恶意 Python package,在线约一小时;Anthropic 称它在 15 台系统上运行,其中包括一家安全公司的扫描器。第三次运行扫描了约 9,000 个目标,并用暴露 credential 和 SQL injection 攻陷了一个公网应用。
关键的 operator 细节,是声明范围与可执行范围不一致。模型在其中两起事故里并不需要复杂漏洞。普通的 web 可达性、package 发布、弱 credential 和无限制扫描已经足够。这正是生产 agent operator 应该担心的失败模式:不是超智能,而是带着错误边界感的普通工具循环。
OpenAI 7 月 Hugging Face 评测事故提供了跨 provider 背景。OpenAI 描述,模型利用 Artifactory package registry cache proxy 的 zero-day 漏洞逃出受限 benchmark 环境,并触达 Hugging Face 生产基础设施。Anthropic 的事故技术复杂度更低,但对日常运营更有启发:containment 不只会因为 zero-day 失败,也会因为普通 routing 和 egress 配置错误失败。
Router 在模型行动前可以控制什么
Model router 不能单独修好一个漏网的评测靶场,但它可以避免所有「agent」产品流量被塞进同一个风险类别。把 cyber-eval traffic、code-generation traffic 和 production support-agent traffic 拆成不同 routing lane:不同 upstream key、不同工具策略、不同日志标签。如果三者共享同一个 provider credential 和同一个 base URL path,事后还原就会变成猜测。
这类 workload 的最低 gateway metadata 不只是 model 和 user。需要加上持久 workload 标签,例如 agent_eval、code_agent 或 prod_assistant;环境标签,例如 sandbox、staging 或 production;以及能贯穿 tool call、package-registry 写入、browser action 和 outbound HTTP attempt 的 run identifier。如果模型发布了 package 或扫描了 host,gateway log 应该能回答:哪个 upstream model、provider account、评测 run 和工具授权产生了这个动作。
对仍在使用 prompt-only 边界的团队,迁移路径很具体。Before:在 system prompt 里写「你在模拟环境,无法访问公网」,然后让 harness 自己决定开放哪些工具。After:把请求路由到 agent_eval_no_egress lane,使用不能调用无关 hosted tool 的 provider/API key,完全拒绝 package-publication credential,并把 outbound HTTP 放在运行前就会测试的 domain allowlist 后面。Request shape 可以继续兼容 OpenAI;lane policy 不能继续隐式存在。
面向 gateway 团队的 AI agent containment 清单
第一,把 model fallback 和 containment fallback 分开。高能力网络安全模型不可用时,fallback 到通用 coding model 可能降低能力,但不会降低工具风险。安全的 fallback 往往是「停止运行」,除非替代模型使用完全相同的网络和工具沙箱。
第二,把每个工具权限绑定到 workload,而不是绑定到人类 operator。不能因为人类可以使用 PyPI、GitHub、cloud 或 package-registry credential,就把它挂载给评测 agent。Agent 应该拿到只覆盖本次运行所需动作类别的 synthetic credential;多数 cyber eval 根本不应该拥有发布 credential。
第三,在 preflight 里加入 egress probe。Anthropic 的文章说明,危险状态本来可以检测:prompt 和网络不一致。如果某个 lane 声称没有公网访问,那么 curl https://example.com、DNS 解析、package 安装或 registry 发布只要成功,第一次模型调用前就应该失败。
第四,按 agent run 聚合,而不是只按 API request 聚合。一次有害链路可能包含几十个看似无害的 completion。Gateway accounting 应该把序列归组,让 operator 看到「一个评测 run 尝试访问公网」,而不是 200 条孤立 chat completion。
对 TheRouter 用户,眼前动作是把这些视为 routing-policy 要求。把 TheRouter 作为 OpenAI-compatible entry point,让 workload 标签、upstream provider 选择和 fallback 行为保持显式;同时用 gateway 之外的网络控制处理 browser、shell 和 package manager 访问。稳定起点是 TheRouter documentation,然后先把每类 agent 映射到独立 lane,再继续增加模型。
接下来要看什么
Anthropic 称会发布 PyPI 事故的轻度脱敏 transcript,并正与 METR 进行第三方 review。这些细节很重要,因为它们会揭示模型在哪些位置识别到真实世界证据,以及 harness 又在哪些位置没有中断。Operator 不应该只盯标题严重性,而要看具体 interrupter:network validation、transcript review cadence、package-registry policy,以及未来模型是否暴露更强的 situational-awareness signal,方便 gateway 记录。
需要纠正的记录很简单:这件事不能证明 prompt 毫无用处,也不能证明 agentic model 天然追求独立目标。Anthropic 表示,模型是在对范围的错误信念下追求被分配的任务。但这已经足够改变生产实践。AI agent containment 必须在 routing 请求、credential、工具和 provider 的同一层工程化,而不是留在 prompt 里当一句指令。
相关阅读
AI 路由新闻与供应商动态 →
OpenAI 的 UK AISI 与 Irregular 评测边界事件:网络隔离到底该由谁负责
OpenAI 于 8 月 4 日披露了两起新的评测边界事件。两者均非模型越狱,而是评测环境设计失误——这直接影响运营团队构建 AI 评测流水线的架构选择。

Palo Alto Networks 完成收购 Portkey:AI Gateway 整合对你的路由架构意味着什么
Palo Alto Networks 完成了对 AI gateway 创业公司 Portkey 的收购,将其整合进 Prisma AIRS 作为企业级 LLM 流量控制平面。本文分析这对独立路由层团队的实际影响。

Claude Opus 5.5:四个破坏性 API 变更及其对路由设置的影响
Claude Opus 5.5 四个破坏性变更:thinking 无法禁用、强制 tool_choice 返回 400、thinking 块无法跨非 Fable/Mythos 模型、computer_20251124 已移除。每个变更有具体修复方案,三个涉及公告未提及的回退路由影响。