Claude Code 2.1.181:自定义网关与 Foundry 的 Prompt Caching 恢复正常——运营团队必知

Claude Code 2.1.181 修复了一个静默的 prompt caching 回归问题,该问题会导致所有使用自定义 ANTHROPIC_BASE_URL 或 Microsoft Foundry 端点的团队成本虚增。此版本同时对前台 subagent 强制执行五层深度上限。

TheRouter Newsroom来源 Anthropic
抽象路由示意图,展示缓存层通过自定义网关端点正确拦截重复 API 调用的场景

如果你的团队通过自定义 ANTHROPIC_BASE_URL、自建 AI gateway 或 Microsoft Azure Foundry 接入 Claude Code,那么你一直在损失每一次对话的 prompt cache 命中——而且很可能毫无察觉。2026 年 6 月 17 日发布的 Claude Code 2.1.181 修复了这个代价高昂的静默回归,同时关闭了一个前台 subagent 的治理漏洞——此前该漏洞在后台 subagent 中已被修复,但前台 subagent 尚未覆盖。

发生了什么

2.1.181 包含一个关键 bug 修复及若干对运营侧有实际影响的改进:

自定义 base URL 与 Foundry 上的 prompt caching 失效。 自定义端点和 Foundry 使用的"每请求认证 token"在每次调用时都会变化,导致 Claude Code 将每次请求视为不同的指纹,完全绕过缓存。针对 ANTHROPIC_BASE_URL 或 Foundry 运行的运营团队,实际上零有效的 prompt cache 命中率。以典型 system prompt 体量(约 2,000–8,000 token)估算,每次 cache miss 意味着完整上下文按非缓存输入单价重新计费。对于并行运行数十个编码会话的团队,这可能使每会话有效成本增加 40–60%。

前台 subagent 现在强制执行五层深度上限。 后台 subagent 自 2.1.175 起已受深度上限约束,但前台(交互式)subagent 未受该规则约束——这意味着不受限的前台 agent 可以突破预定的治理边界,生成递归调用链。2.1.181 对两类 agent 统一应用五层深度上限,消除了这一不一致。

/config key=value 提示语法。 团队现在可以在提示中直接设置任意配置键,包括在无头 -p 模式和 Remote Control 会话中同样生效。对于以程序化方式调用 Claude Code 的运营团队——交互式配置菜单不可用的场景——这一功能具有实际价值。

AWS 凭证刷新循环修复。 剩余有效期较短的 awsCredentialExport 凭证会每分钟触发一次刷新,导致 Bedrock 侧 AssumeRole 调用频繁,并在高吞吐量流水线中引发间歇性限流错误。该问题已在本版本中修复。

其余修复包括:长会话历史稳定性(其他进程的清理不再影响活跃会话的上下文)、启动延迟优化(在全新环境中每次启动节省约 120ms),以及 macOS 专项可靠性补丁。

为何对 AI 工程团队重要

Prompt caching 回归修复是使用自定义路由基础设施团队影响最大的一项。Prompt caching 是 Claude Code 成本模型的支柱:Anthropic 官方文档描述了稳态编码会话中 80% 以上的缓存命中率为正常水平。完整会话 cache miss 意味着每次对话都要按标准输入单价重新计费 system prompt、项目上下文和累积对话历史。

对于专门通过托管 AI gateway 或 Microsoft Foundry 接入 Claude Code 以获得集中计费、限流管理和 provider 切换能力的团队来说,讽刺之处在于:他们为改善成本控制而引入的基础设施,恰恰在静默地绕开本可降低成本的缓存机制。

五层 subagent 深度强制执行对运营治理同样重要。2.1.181 之前,前台 agent 可以突破 -p/无头流水线对后台 agent 已经执行的深度限制。在多层架构——编排器 → 规划器 → 执行 subagent——中,这一不一致使得在交互式会话中强制执行与程序化会话相同的调度策略变得困难。

Router 与运营视角

2.1.181 中的多项改动直接关联到路由层关注点:

Prompt cache 验证。 在 Anthropic API 前部署了反向代理或 gateway 的团队,应审查其认证 token 行为。如果你的 gateway 在每次请求时添加了会变化的签名或跟踪 header——即使底层 prompt 未变——你可能正在产生与 Foundry 相同的 cache miss 模式。Claude Code 中的修复调整了其读取 cache header 的方式,但中间代理修改请求指纹的行为仍由你来控制。

subagent 深度作为路由策略。 五层上限现在无论 subagent 是交互式还是程序化启动,都会一致执行。希望施加更严格限制的运营商,应通过 Tool(param:value) 权限规则(2.1.178 引入)按模型 tier 限制 subagent 访问,而非依赖深度上限。

无头 /config 用于 fleet 自动化。 新的 /config key=value 语法使得在 -p 模式中编写配置变更脚本变得实际可行,意味着运营团队现在可以为每次调用设置模型、effort 级别或 sandbox 策略,而无需在容器镜像中硬编码环境变量配置。

Bedrock 限流保护。 AWS 凭证刷新修复减少了 Bedrock 在高并发环境中触发 AssumeRole 速率限制的虚假调用。在多个并行 Claude Code 会话同时访问 Bedrock 的团队,应能看到与凭证抖动相关的间歇性 429 错误减少。

TheRouter 用户的关注与建议

如果你通过 TheRouter 或任何 OpenAI-compatible gateway 运行 Claude Code,请验证你的代理层是否在每次调用时注入了会变化的 token。一致的请求指纹是 prompt caching 正常工作的前提——如果中间 gateway 以破坏 cache key 的方式转换请求,Claude Code 上游的修复也无法生效。

管理跨多个后端 provider 的 Claude Code 团队,还可以使用新的 /config 提示语法,在每会话自动化脚本中注入 provider 专属设置(模型名称、base URL、effort 级别),而无需依赖容器镜像中的环境变量配置。

在治理层面,统一的五层 subagent 深度上限从 fleet 策略推理中消除了一个变量:交互式和无头 agent 在深度压力下现在行为一致。如果你的成本模型或安全策略需要更严格的限制,通过 Tool(model:tier) 权限规则配置模型 tier 限制,而非单独依赖深度约束。

参阅 TheRouter 文档 了解将 Claude Code 接入自定义 API 端点的当前指南。

客服支持