70% 的工程团队已在生产中运行多模型 AI——Datadog 2026 数据揭示路由基础设施的真实差距
Datadog 2026 年 AI 工程现状报告显示,超过 70% 的企业在生产环境中同时运行三个或以上的 AI 模型。这份来自千余家真实客户的遥测数据,揭示了多模型 AI 路由生产化的核心挑战与应对思路。

三年前,大多数工程团队会选定一家 AI 供应商并长期坚持。而今,"多模型组合"已成为默认选择。Datadog 发布的《2026 年 AI 工程现状》报告,基于超过一千家生产客户的 LLM 遥测数据,印证了运营商们的直觉:多模型 AI 路由在生产环境中早已不是前沿玩法,而是行业基准。
问题在于,你的基础设施是否跟上了这一节奏。
发生了什么
Datadog 对其客户群的 LLM 调用遥测数据进行了深入分析,呈现出一幅比任何基准测试都更接近真实生产的 AI 运营图景。核心数据令人印象深刻:
- 超过 70% 的企业在生产中同时使用三个或以上模型,使用六个以上模型的比例在过去一年内近乎翻倍。
- OpenAI 的市场份额从 75% 下滑至 63%——并非绝对用量下降(Datadog 客户中使用 OpenAI 的数量实际上翻了一倍多),而是 Google Gemini 和 Anthropic Claude 分别增长了 20 和 23 个百分点。
- Claude Sonnet 4.6 在发布首月内就达到了 17% 的采用率,显示出当路由基础设施到位时,团队吸收新模型的速度有多快。
- GPT-4o 虽已从 ChatGPT 界面下线,但在 2026 年 3 月的 API 调用追踪中仍占 22% 份额——这揭示了生产系统面对强制弃用时的惰性。
- 模型更替正在加速。团队快速引入新模型,但淘汰旧模型的速度却明显滞后,导致生产中存在大量重叠的模型组合,每个都带有独立的质量、延迟和成本曲线。
为什么这对 AI 工程团队至关重要
Datadog 的数据揭示了一个结构性错位:团队采纳多模型策略的速度,已经超过了构建相应治理基础设施的速度。
生产模型组合中每增加一个模型,都会带来复合性的运营负担:
- 评估负担。同样的提示词、工具调用或 agent 工作流,在不同模型上可能产生截然不同的结果。团队需要为每个运行中的模型维护评估体系,而不仅仅是最信任的那一个。
- 弃用压力。随着供应商加快发布节奏,旧版本模型被淘汰的速度也在提升。GPT-4o 在界面下线后仍占 API 调用量的 22%,预示着团队未来将反复面对供给侧的模型更迭冲击。
- 成本碎片化。不同供应商的 token 定价、缓存规则、异步任务计费方式各不相同。缺乏统一计量,多供应商路由在账单核对时将变成灾难。
- 合规分散。同时使用 OpenAI、Google 和 Anthropic 的企业团队,面对的是各自独立的服务条款、数据驻留要求和审计日志格式。没有合适的 gateway 层,整合这些信号将完全依赖人工。
报告还揭示了一个值得警惕的失效模式:agent 框架的采用率同比近乎翻倍(从 9% 增至 18%),但框架加速的是构建,而非运营。团队更快到达生产,但运营复杂度随着每个新增供应商、每个固定的框架版本而倍增。
Router/operator 视角分析
Datadog 报告明确将 gateway 路由定位为结构性解决方案:"团队越来越需要使用模块化路由机制(如 gateway 服务)来管理 LLM 请求,而不是在整个环境中直接调用各模型供应商的 API。"
对于正在搭建或评估 gateway 层的运营商,这份生产数据指向三个具体决策:
1. 按工作负载阶段路由,而非按团队偏好路由。 Datadog 所识别的领先团队,将推理视为一条流水线——轻量模型负责提取与标注,前沿模型负责综合分析。这种分层路由模式需要一个能感知请求意图并据此路由的 gateway,而不是静态的供应商别名。
2. 将模型弃用作为一等运营事件处理。 GPT-4o 界面下线后仍保持 22% API 调用量,是一个预警信号。没有弃用感知路由策略的团队,在供应商最终强制切换时将面临硬故障,而非优雅的 fallback。生产中每个模型都需要在供应商催促之前,就已在路由策略中编码好退出计划。
3. 将评估做成持续过程,而非一次性快照。 报告指出,企业"快速引入新模型,但淘汰旧模型的速度却明显滞后"——这意味着质量回归会在无声中积累。没有在线评估的路由,在规模化场景下只是凭感觉在运作。将一个新模型加入生产的门槛,应该包含持续的质量探针,而不仅仅是一张基准测试截图。
TheRouter 用户应关注和尝试的事项
如果你正在通过 TheRouter 的路由层运行多个供应商,Datadog 的数据给了你一个参照基准:超过 70% 的生产企业已处于多模型格局,但真正缩小运营差距的,是那些投资于以下方向的团队:
- 明确的路由策略,而非各团队各自为政的随机模型选择。
- 统一的供应商计量,使成本、延迟和故障率在整个模型组合中清晰可见,而不是埋藏在各供应商独立的 dashboard 里。
- fallback 链,能够优雅处理供应商限流和模型弃用——在供应商强制要求之前就已准备好。
查阅 TheRouter 文档,确认你模型组合中的每个供应商都已配置 fallback,并确保成本计量能在统一账本中汇总跨供应商的支出。然后对照供应商弃用时间表,审查你最老的固定模型版本——在下一轮模型退役浪潮来临之前。
Datadog 的报告是一个有效的行业基准。生产环境中的多模型 AI 路由已是常态。差异化的关键,在于你是在有意识地运营它,还是仅仅在被动地应对它。
相关阅读
AI 路由新闻与供应商动态 →
Claude Code 2.1.274:MCP 可靠性全面修复、Gateway Postgres 配置项与会话自愈
Claude Code 2.1.274 修复了六个在生产环境中静默失败的 MCP 问题,新增 store.connect_timeout_seconds 和 CLAUDE_CODE_GATEWAY_DRAIN_TIMEOUT_MS 两个 gateway 配置项,并让损坏的会话记录自动修复而非无限循环。

Claude Code 2.1.273:五个新网关提示头和 Bedrock、Vertex、Foundry 上的分类器切换
Claude Code 2.1.273 推出可选开启的网关提示头,向任何 LLM 代理暴露请求类型、agent 类型和上下文压缩状态,同时在 Bedrock、Vertex AI 和 Foundry 上静默切换 auto 模式分类器为本地模式。两个变更一起落地,但只有其中一个有回退路径。

DeepSeek V4 Pro 熬过了自己的死亡日期,这次反转对路由策略意味着什么
DeepSeek 在9月10日宣布 V4 Pro 将于今天 04:00 UTC 停服,结果食言了。他们以「用户需求」为由保留了 V4 Pro,价格不变。本文梳理两个模型当前的实际参数差异,以及路由团队现在需要做的决策。