Claude Code 子智能体现在可以嵌套生成自己的子智能体:五层委派如何重塑你的模型路由与成本架构

Anthropic 在 6 月 10 日的 Claude Code 更新中开放了最多五层子智能体嵌套。本文解析这对 agentic 编程工作流的模型路由、成本控制与治理意味着什么。

TheRouter Newsroom来源 Anthropic (Claude Code Releases)
五层 Claude Code 子智能体嵌套委派示意图,每层对应不同的模型层级路由

Anthropic 在 6 月 10 日为 Claude Code 发布了一项重要架构变更:子智能体现在可以再生成自己的子智能体,最多支持五层嵌套。这不是细枝末节的改进——它把 Claude Code 的 agent 运行时变成了一个分层委派引擎,而这个层级结构正好是一个天然的模型层级路由接入点,每个 AI 工程团队都应该理解它。

发生了什么

6 月 10 日的更新引入了递归子智能体生成能力,最大深度为五层。父智能体可以将子任务分发给子智能体,子智能体再向孙智能体分发,以此类推,最多五层。

同次更新还包含:

  • Amazon Bedrock 区域优先级修复:在未设置 AWS_REGION 环境变量时,Claude Code 现在会从 ~/.aws/config 读取 AWS 区域,与标准 AWS SDK 解析顺序保持一致。
  • 插件市场搜索栏:/plugin 命令在浏览市场插件时新增了搜索功能。
  • OTEL 模型属性:claude_code.lines_of_code.count OpenTelemetry 指标现在携带 model 属性,让可观测性管道可以按模型分别追踪使用量。
  • 1M 上下文自动压缩:没有用量额度的会话在触及 1M token 上限后,现在会自动压缩回标准上下文限制,而不是卡死。
  • 后台 agent 安全修复:修复了后台 agent 在使用预热 worker 时错误读取其他目录 .mcp.json 授权与信任设置的问题。

嵌套变更是本次更新的核心。其余改进扎实,但都不像五层委派这样从根本上改变团队设计 agent 工作流的方式。

对 AI 工程团队意味着什么

此前,Claude Code 的 agent 模型是扁平的:主智能体生成子智能体,每个子智能体只运行一层,主智能体等待结果。这迫使团队把复杂的任务分解逻辑塞进单一 agent 的 prompt——既冗长,又脆弱,成本也高。

五层嵌套从根本上改变了任务分解模型。一个编程工作流现在可以这样设计:

  • 第 0 层(规划 agent):读取完整代码库,理解任务,决定分解策略。使用最强模型(Opus)。
  • 第 1 层(编排 agent):接收子任务,将其拆分为并行工作项。使用中等模型(Sonnet)。
  • 第 2 层(执行 agent):实现某个工作项,编写代码,运行测试。使用同等或更低成本的模型。
  • 第 3 层(验证 agent):审查 diff,运行 linter,检查回归。使用更低成本的模型(Haiku)。
  • 第 4 层(叶节点辅助 agent):获取文件、统计行数、运行工具命令。使用最低成本的可用模型。

每一层委派都是一个天然的路由决策点。父智能体隐式地决定向哪个模型层级分发任务。这不是纸上谈兵——Claude Code 已支持通过 CLAUDE_CODE_SUBAGENT_MODEL 环境变量覆盖模型,且本次更新中 /model 选择器现在能正确将 availableModels 限制传递给子智能体的模型覆盖配置。

Router/Operator 视角

五层嵌套创造了一个路由层级,与运营者在 API gateway 中使用多年的级联服务委派模式如出一辙。对于大规模运行 agentic 编程的团队,以下方面发生了变化:

成本粒度化。 每个委派层级可以路由到不同的模型层级。在第 3–4 层使用 Haiku 而非 Opus 的五层工作流,在典型的代码重构任务中可节省 40–60% 的单次任务成本。本次更新的 1M 上下文自动压缩功能也防止了会话意外触达上下文上限时的 token 失控消耗。

可靠性分层。 如果叶节点 agent(第 3–4 层)失败——幻觉了测试路径、触发了限流、产出了错误代码——第 2 层的父节点可以检测到失败,重新分发给另一个模型,或自行完成该工作。这是 agent 层面的 fallback,不需要任何外部路由基础设施,但其模式与 API gateway 的 provider 故障转移完全相同。

治理控制。 五层深度上限本身是一个治理参数。需要更严格成本控制的团队可以通过 availableModels 限制将嵌套控制在三层以内。OTEL 指标变更也让在可观测性管道中按嵌套层级追踪成本和延迟成为可能。

Provider 依赖。 将 ANTHROPIC_BASE_URL 指向兼容端点,团队可以将整个五层层级结构运行在不同的模型 provider 上。嵌套架构在路由层面与模型无关;成本和延迟特性会变,但委派模式保持不变。

值得关注的问题

  • 限流叠加:每个嵌套层级都会发起自己的 API 调用。第 0 层 agent 分发给 3 个第 1 层 agent,每个再分发给 3 个第 2 层 agent,会产生 9 条并发 API 流。限流规划需要考虑乘法式扇出。
  • CI 中的深度限制:在 CI 流水线中运行 Claude Code 的团队应测试工作流是否会触及五层上限,以及运行时在边界处的行为。
  • Bedrock 区域变更:~/.aws/config 优先级修复意味着 Bedrock 上的 Claude Code 可能会解析到与之前不同的区域。如果你的路由依赖明确的 AWS_REGION,更新后请验证环境配置。
  • 成本可观测性:Claude Code 指标中新增的 OTEL model 属性与 gateway 层请求账本配合,可以提供按委派层级细分的成本数据,是搭建编程 agent 成本看板的关键信号。
  • 模型层级路由策略:五层嵌套使 coding agent 的模型层级路由变得有据可依。规划任务需要最强的模型,叶节点任务则不需要。如果你的 provider fallback 策略目前还是扁平的——所有请求走同一模型——这次发布是着手分层的契机。
编辑风格示意图,展示 Claude Code 用量归因流按 skill、agent 和 MCP 维度分支,经由 routing 层流出

Claude Code 在 VSCode 中按 Skill、Agent、MCP Server 细分用量成本——企业运维团队需要了解的三项变化

6月12日 Claude Code 更新为 VSCode /usage 对话框增加了按 skill、agent 和 MCP server 细分的成本归因能力,修复了 Bedrock GovCloud 推断配置文件前缀错误,并关闭了后台会话凭据泄漏问题。三项变更,同一运营主题:你现在可以看清——并控制——token 预算真正花在哪里。

来源 Anthropic (Claude Code Releases)
编辑风格插图,展示分叉的 API 路由路径,其中标有 agents sessions 的分支偏离主网关,背景为低饱和深色调

OpenAI Agents API 公测:网关运营商需要正视的新绕道路径

OpenAI 的 Agents API 公测版引入了 client.beta.agents 这个独立命名空间,它根本不经过 /v1/chat/completions。对于通过 AI 网关路由流量的团队来说,这意味着账单盲区、缺失的审计记录,以及一个需要单独管理的 API key 权限范围。

来源 OpenAI
帮助与联系