Claude Code 2.1.198:anthropicAws Provider 与 failover 链升级,运维团队必须了解的 Gateway 变更
Claude Code 2.1.198 将 AWS 上的 Claude Platform 作为原生 gateway 上游节点,对 model-not-found 错误触发 failover 链,并自动刷新 AWS STS Token——三项变更直接影响路由团队的 provider fallback 配置。

当模型不可用时,你的 failover 链会自动启动,还是 Claude Code 会直接报错等待?Claude Code 2.1.198 对通过自定义 gateway 路由的团队,明确改变了这个答案。本次版本的两项 gateway 层变更——原生 anthropicAws provider 支持和 model-not-found 自动 failover——在 changelog 里篇幅不长,但对生产环境行为影响显著。
发生了什么
Claude Code 2.1.198 包含数十项变更,但运维团队需要重点关注的是路由层变更:
Gateway:新增 Claude Platform on AWS(anthropicAws)作为上游 provider。 配置 claude gateway 或兼容代理的团队现在可以直接引用 anthropicAws 作为命名上游,无需手动构建 Bedrock 兼容的 endpoint 字符串。
model-not-found 响应现在会推进 failover 链。 此前,如果上游返回"model not found"错误——无论是因为 gateway 的模型目录过期、provider 下架了某个模型,还是 alias 发生变化——Claude Code 会直接把错误暴露给用户。现在该错误会像 rate limit 或超时一样,自动推进到 fallback 列表中的下一个 provider。
修复:Claude Platform on AWS 和 Mantle session 在 STS token 过期时直接死锁并提示"Please run /login"。 新的 awsAuthRefresh 机制会在 token 过期前自动刷新,避免了长时间运行的 background agent 在 Bedrock 和 Mantle 上被强制重新登录的问题。
2.1.198 在 gateway 层之外的其他重要变更:从 claude agents 启动的 background agent 在完成代码工作后会自动 commit、push 并开启草稿 PR(而不是停下来询问用户);内置 Explore agent 现在继承主 session 的模型(最高到 Opus);subagent 和上下文压缩现在继承 extended thinking 配置;瞬时网络错误(ECONNRESET)现在会以退避策略重试,而不是直接中止。
对 AI 工程团队的影响
model-not-found failover 变更填补了 Claude Code gateway 弹性模型的一个空缺。此前,错误配置的模型 alias 或 provider 端模型目录变更可能让用户直接收到报错,而不是触发 fallback。新行为意味着:
- Provider 模型目录变更不再需要运维介入。 如果上游下架了某个模型 ID——就像 DeepSeek 在 2026 年 6 月对
deepseek-chat所做的,或 OpenAI 定期进行的 snapshot 弃用——gateway 会自动尝试链中的下一个 provider,而不是抛出硬错误。 - Alias 漂移变得可容忍。 通过 gateway 暴露通用 alias(例如
best-coder映射到特定模型)的团队,在底层模型被重命名或移除时有了第二道防线。 anthropicAwsprovider 标准化了 AWS Bedrock routing。 每个运维团队不再需要各自维护 Bedrock endpoint 配置,anthropicAws提供了一个 Claude Code gateway 层原生理解的稳定命名 provider 句柄。
awsAuthRefresh 修复对在 Bedrock 或 Mantle 上运行长时间 background agent 的团队至关重要:AWS STS token 的有效期很短(通常一小时),之前 token 在 session 中途过期会强制触发重新登录中断,破坏任何无人值守的工作流。
Router/Operator 视角分析
将 model-not-found 视为软错误而非硬停止。 2.1.198 在 Claude Code 的 gateway 协议中正式确立了这一原则。如果你运营的自定义 gateway 有多 provider fallback 列表(例如 providers: [anthropic, anthropicAws, google-vertex]),应验证你的 gateway 也将 model_not_found(模型层的 HTTP 404)视为 fallback 触发条件,而不仅限于 429 和 5xx。部分 AI gateway 实现只在 rate-limit 或服务器错误时推进 fallback;本次版本明确表明完整的 failover 合约还包括模型可用性错误。
审查 Bedrock 凭证刷新配置。 awsAuthRefresh 修复在 Claude Code 2.1.198 中是自动生效的,但通过自定义 gateway 代理 Bedrock 凭证的团队需要确认其凭证轮换管道不会在没有刷新机制的情况下向 gateway session 下发短期 token。如果你的 gateway 在 session 启动时注入凭证且从不刷新,Claude Code 内置的 awsAuthRefresh 就无法发挥作用——它仅在 Claude Code 自身持有 STS 凭证时生效。
Background agent 的 PR 自动化改变了成本模型。 Background agent 自动 commit、push 并开启草稿 PR 的新行为,意味着此前需要人工操作的步骤现在自主完成。如果你使用 token 预算或每 session 成本上限,需要将 push/PR 创建流程产生的额外 API 调用纳入计算。Agent 在写 PR 描述时会汇总自身工作,产生额外的上下文消耗。
Subagent extended thinking 继承 是一项容易被忽视的变更:在 2.1.198 之前,在 extended thinking session 中启动的 subagent 会退回标准模式,输出质量偏低。现在它们会继承 thinking 配置,这提高了多 agent 工作流的 token 上限。如果你有每 session token 预算,在启用了 thinking 的父 session 带 subagent 的场景下,预算会更快耗尽。
TheRouter 用户应关注的内容
如果你通过 TheRouter 路由 Claude Code 流量,anthropicAws provider 命名与上游 fallback 配置直接相关。检查路由策略,确认来自任何 provider 的 model-not-found 错误都能触发 fallback,而不仅限于 rate-limit 或超时条件。/docs/ 路由配置指南涵盖了 provider fallback 顺序和错误类型映射。
对于在 Bedrock 上运行 background agent 的团队,在部署长时间无人值守工作流之前,请确认已升级到 Claude Code 2.1.198 以获取 awsAuthRefresh 修复。
相关阅读
AI 路由新闻与供应商动态 →
Claude Code 2.1.281:Bedrock 上游获得跨账号 IAM 和 Guardrail 强制执行
2.1.281 新增三个字段,改变 Bedrock 上游的认证与策略执行。assume_role 通过 STS 将凭证转为按开发者隔离的会话令牌;guardrail 强制每个请求通过 Bedrock guardrail。两者均影响多账号 AWS 部署的信任边界。

Claude Code 2.1.275 让每个网关代理都返回 400。2.1.276 当天就修好了。
2.1.275 引入的一个内部请求 tag 导致所有通过 ANTHROPIC_BASE_URL 代理的调用全部返回 400。2.1.276 数小时后作为定向 hotfix 发布。本文拆解这次故障的机制、受影响配置,以及 2.1.275 中值得审查的三处次要 operator 变更。

Claude Code 2.1.274:MCP 可靠性全面修复、Gateway Postgres 配置项与会话自愈
Claude Code 2.1.274 修复了六个在生产环境中静默失败的 MCP 问题,新增 store.connect_timeout_seconds 和 CLAUDE_CODE_GATEWAY_DRAIN_TIMEOUT_MS 两个 gateway 配置项,并让损坏的会话记录自动修复而非无限循环。