Anthropic 40 万次 Claude Code 会话研究:专业度、成功率与 AI 路由
Anthropic 40 万次 Claude Code 会话研究显示,专家验证成功率从 15% 提升到 28–33%,输出量增加 5 倍;路由团队应重设模型层级、Token 预算和 prompt caching。

Anthropic 于 6 月 16 日发布了一篇研究论文,分析了 2025 年 10 月至 2026 年 4 月间约 23.5 万名用户产生的约 40 万次 Claude Code 会话。表面上这是一个劳动力市场研究,但其中的数据对任何通过网关、计费系统或路由层大规模运行 Claude Code 的团队都具有直接的运营价值。
发生了什么
该论文引入了一个九类会话分类体系(构建、修复、测试/编排、运行软件、规划、探索、数据分析、文档/非代码产出),并从三个维度对每次会话进行衡量:任务模式、用户专业度和会话成功率。
对运营团队的关键发现:
- 会话构成:56% 的会话涉及代码编写或修复(25% 编写、26% 修复、5% 测试/编排);17% 是运行软件;13% 产出分析或文档。"修复"类别从 10 月的 33% 降至 4 月的 19%,被"运行软件"(14% → 21%)和编写/分析类填补。
- 专业度放大效应:专家用户平均每次提示触发约 12 次 Claude 操作,产生约 3,200 词的输出;新手用户触发 5 次操作,约 600 词输出。这一 2.4 倍的操作倍数和 5 倍的输出倍数在所有工作模式和任务价值段上均成立。在控制模式、月份和模型变量的回归中,每个专业度级别大约带来额外 9% 的操作量和 13% 的输出量。
- 任务价值增长:按自由职业平台报价估算的平均会话经济价值,在 2025 年 10 月至 2026 年 4 月间上涨了 27%,构建、运行和修复类任务各上涨约三分之一。
- 成功率:在编码任务上,各主要职业的完成率与软件工程师基本相当。领域专家成功率更高,从错误中恢复也更容易,但中级与专家用户之间的差距较小。
- 分工模式:用户承担约 70% 的规划决策,Claude 承担约 80% 的执行决策。当 Claude 掌控规划时,每轮操作约 16 次;当用户保留执行控制时,Claude 约执行 8 次操作。
为什么对 AI 工程团队重要
会话分类体系和专业度数据改变了大规模 Claude Code 部署的资源规划与成本预测方式。
Token 预算规划取决于用户专业度。 如果路由团队将每次会话的 token 消耗建模为均匀分布,将系统性地低估专家密集型工作负载的成本。由领域专家组成的团队(写合同工具的律师、编分析 pipeline 的科学家、编排 agent 的高级工程师)产生的会话,输出体量是普通会话的 5 倍,对 context 积累的贡献也成比例增长。如果计费系统按统一的会话预算摊销 context 成本,结果要么是专家用户被新手用户补贴,要么反之。
任务模式的变化影响模型层级的选择逻辑。 调试类会话(下降趋势)通常有明确边界——测试通过即结束。运行软件和编排类会话(上升趋势)往往是开放式的,涉及运行 pipeline、部署基础设施或跨多轮协调 sub-agent。这些场景是 prompt caching 收益最大、context 窗口大小最重要、每轮延迟最直接影响开发效率的地方。将编排密集型工作负载路由到最强模型层级的理由,比对一个调试队列这样做要充分得多。
27% 的任务价值增长意味着去年的路由策略已经过时。 如果平均会话价值已上涨 27%(按自由职业等价值衡量),那么六个月前针对更轻量工作负载校准的模型层级策略,如今对应的已是更复杂的任务。以成本控制为由路由到更便宜层级的团队,可能正在用更高价值的工作去换取这种节省。
路由与运营角度
该论文的多项发现可直接转化为路由策略决策。
会话模式作为路由信号。 论文的九种模式可以大致映射到路由层级:带快速迭代的调试/测试会话适合低延迟、高性价比的模型;有大量 context 积累的构建会话(专家级每轮平均 2,400 词输出)适合更大 context 窗口和更强推理能力的模型;执行 sub-agent 协调或运行 pipeline 的运行/编排会话,是最强层级使用价值最高的场景——仅输出倍数一项,在任务价值匹配的情况下就足以证明成本差异的合理性。
专业度推断作为动态路由输入。 论文的专业度分类器通过提示措辞、纠错模式和领域特异性推断用户专业度——这些信号在网关层可以获取。一个观察会话前 2-3 轮的代理可以判断会话是否趋向专家模式,并相应调整模型选择。根据会话复杂度动态路由的模式与数据一致:专家级会话从高能力模型中获得的每 token 价值更高。
Prompt caching 的 ROI 随专业度提升。 专家级会话每轮积累更多 context,且跨越更多轮次持续积累。Prompt caching 的收益与缓存能吸收的重复 context 量成正比,在专家级编排和构建会话中的 ROI 高于短暂的调试交流。最近修复了 prompt caching 行为的团队(参见 Claude Code 2.1.181),在评估收益时应将会话构成中的专家比例纳入权重。
Sub-agent 深度限制与操作链的交互。 论文发现高专业度、高自主度会话中 Claude 每轮可能执行超过 100 次操作。设置了 sub-agent 深度限制的团队(最近 Claude Code 版本引入的治理控制)应该对这种交互建模:5 层深度上限加上专家用户每轮 12 次操作,意味着叶节点层面可能有数十个并行操作。路由层面的延迟和成本治理需要考虑这种扇出,而不是将每个用户会话视为单线程。
TheRouter 用户应该关注和尝试的事项
如果你通过 TheRouter 或自定义 AI 网关路由 Claude Code,会话模式和专业度数据对路由配置有直接参考价值:
- 审计当前会话的 token 分布,检查专家密集型用户是否驱动了不成比例的 context 成本。如果是,考虑为显示早期高专业度信号的会话设置独立的路由策略或 token 预算。
- 将运行/编排工作负载与调试/测试工作负载的模型层级分配分开评估。这些模式现在代表着与六个月前显著不同的使用场景。
- 参阅 /docs/ 中关于多会话 Claude Code 部署的路由配置、fallback 策略和 token 计算的当前文档。
Anthropic 研究页面提供了论文 PDF 和附录,包含会话级统计数据,可用于将你自己的部署与整体用户群基线进行对比。
相关阅读
AI 路由新闻与供应商动态 →
Claude Code 2.1.181:自定义网关与 Foundry 的 Prompt Caching 恢复正常——运营团队必知
Claude Code 2.1.181 修复了一个静默的 prompt caching 回归问题,该问题会导致所有使用自定义 ANTHROPIC_BASE_URL 或 Microsoft Foundry 端点的团队成本虚增。此版本同时对前台 subagent 强制执行五层深度上限。

Claude Code 2.1.181:Agent 节点间信任模型重写——多 Agent 流水线运营商必须审查的权限策略变化
Claude Code 2.1.181 将跨会话 Agent 信任模型从持怀疑态度改写为协作伙伴框架。Peer Agent 现在无需逐动作审查即可执行请求——但权限升级通道和权限穿透攻击仍被硬性阻断。

Claude Code 2.1.178:Tool 参数权限规则让运营商可按模型层级阻断子代理
Claude Code 2.1.178 引入 Tool(param:value) 权限语法,支持用 Agent(model:opus) 等规则阻断特定模型层级的子代理,同时新增嵌套 .claude/ 目录作用域和 auto 模式子代理预检分类器。