
TheRouter v2.0:统一异步媒体平台,覆盖图片 / 音频 / 视频
TheRouter v2.0 推出贯穿图像、音频、视频生成的统一异步模式。长任务从 请求线程迁移到基于 Job 的流程,产物落 S3 + 通过统一的 /v1/jobs/:id 查询 — 杜绝 CDN 超时带来的计费纠纷,同时同步接口零变更。

TheRouter v2.0 推出贯穿图像、音频、视频生成的统一异步模式。长任务从 请求线程迁移到基于 Job 的流程,产物落 S3 + 通过统一的 /v1/jobs/:id 查询 — 杜绝 CDN 超时带来的计费纠纷,同时同步接口零变更。

2.1.281 新增三个字段,改变 Bedrock 上游的认证与策略执行。assume_role 通过 STS 将凭证转为按开发者隔离的会话令牌;guardrail 强制每个请求通过 Bedrock guardrail。两者均影响多账号 AWS 部署的信任边界。

Claude Opus 5.5 四个破坏性变更:thinking 无法禁用、强制 tool_choice 返回 400、thinking 块无法跨非 Fable/Mythos 模型、computer_20251124 已移除。每个变更有具体修复方案,三个涉及公告未提及的回退路由影响。

2.1.275 引入的一个内部请求 tag 导致所有通过 ANTHROPIC_BASE_URL 代理的调用全部返回 400。2.1.276 数小时后作为定向 hotfix 发布。本文拆解这次故障的机制、受影响配置,以及 2.1.275 中值得审查的三处次要 operator 变更。

Anthropic 本周发布了两个面向 Operator 的 Beta 功能:`compact-2026-09-04` 把摘要生成移出关键路径,`auto` 权限模式把信任评估从你的代码转移到服务器。两者都改变了延迟、成本和控制权之间的边界。

Claude Code 2.1.274 修复了六个在生产环境中静默失败的 MCP 问题,新增 store.connect_timeout_seconds 和 CLAUDE_CODE_GATEWAY_DRAIN_TIMEOUT_MS 两个 gateway 配置项,并让损坏的会话记录自动修复而非无限循环。

Claude Code 2.1.273 推出可选开启的网关提示头,向任何 LLM 代理暴露请求类型、agent 类型和上下文压缩状态,同时在 Bedrock、Vertex AI 和 Foundry 上静默切换 auto 模式分类器为本地模式。两个变更一起落地,但只有其中一个有回退路径。

DeepSeek 在9月10日宣布 V4 Pro 将于今天 04:00 UTC 停服,结果食言了。他们以「用户需求」为由保留了 V4 Pro,价格不变。本文梳理两个模型当前的实际参数差异,以及路由团队现在需要做的决策。

OpenAI 9 月 10 日更新允许管理员在组织或项目层面强制设置 Key 最大有效期。现有 Key 不会被追溯缩短,但策略生效后新建的每个 Key 都必须在限制范围内到期——而你的 API 网关很可能是全部 Key 中寿命最长、风险最高的那个。

OpenAI 的 Prompt Cache Diagnostics 工具在 Responses API 正式发布,新增 comparison_response_id 和 reason 字段用于定位缓存未命中原因。若网关层剥离 prompt_cache_options,诊断信号会静默丢失。

Claude Code 2.1.269 新增了 gateway 发现超时覆盖参数、并发 workflow agent 上限,以及一个跨配置源默默生效的 deny rule 漏洞修复。这三项变更直接影响规模化运营 Claude Code 的团队。

从 2.1.265 起,所有通过第三方 Anthropic 兼容端点的请求都在以 HTTP 400 失败。2.1.268 修复了这个问题,并新增了 gatewayInternalNetworks CIDR 策略、gateway.yaml 定价同步,以及 Bedrock/Vertex/Foundry 提示词缓存字节稳定性改进。

OpenAI 的 Agents API 公测版引入了 client.beta.agents 这个独立命名空间,它根本不经过 /v1/chat/completions。对于通过 AI 网关路由流量的团队来说,这意味着账单盲区、缺失的审计记录,以及一个需要单独管理的 API key 权限范围。

2.1.267 带来三项运营商相关变更:跨 Bedrock、Vertex、Foundry 生效的 maxEffortLevel 上限配置;禁止系统提示词快照复用的新标志;以及一个通过反斜杠绕过市场容器检查的安全修复。此外包含十二项提示词缓存稳定性改进,直接影响 Token 成本。

DeepSeek V4.1-Flash 今日上线,新 API 名 `deepseek-flash`,原生支持图像输入。9 月 14 日 12:00 起,所有 deepseek-v4-pro 请求静默切换至 V4.1-Flash 并按 Flash 定价计费。本文拆解能力差异、定价变化与截止日期前需要确认的配置。

2.1.265 悄然破坏了所有同时设置了 CLAUDE_CODE_USE_GATEWAY 与 API key 或自定义认证的 gateway 和代理配置。本文说明受影响的具体配置、报错现象,以及此版本为 gateway 运营者带来的新能力。

Anthropic 9 月 1 日的 API 更新带来三个 beta 功能:逐消息 effort 控制、轮次限定 system 消息、会话中途工具增删,让运营商无需失效缓存前缀就能在长对话里动态调整算力强度、指令和工具可见性。

Anthropic 的 ant CLI v1.30.0 发布了 ant apply,一个类似 Terraform 的声明式工作流,把 agent 配置、环境、技能和定时部署从仓库文件同步到 Claude API。对于通过 gateway 路由流量的团队来说,agent 文件里的 model 字段现在决定了调用哪个 Claude 版本,而 claude-lock.json 就是记录这个决定的地方。

claude-fable-5-1 的 prompt cache 读取费用降至 $0.25/MTok,是其他 Claude 模型 0.1× 标准费率的四分之一。output_config.effort 参数让运营者在每次请求时调节思考深度与 token 消耗。本文拆解这两项变化对计费、路由和升级决策的实际影响。

Fable 5.1 的提示词缓存悄悄地把工具结果之后的上下文排除在缓存覆盖范围之外,导致每次工具调用的后续回合都按未缓存价格全额计费。Claude Code 2.1.260 修复了这个问题,同时带来缓存未命中诊断、Read() 权限回滚以及受管 CLAUDE.md 治理变更。

OpenAI 现在对两种此前看起来相同的 429 返回不同的错误码——发包速率过快得到 slow_down,模型饱和返回 503。你的重试逻辑必须分开处理它们。

Claude Code 2.1.261 gateway policy telemetry operator 变化暴露了四类代理故障,包括组织策略读取、客户端 IP 解析、JSON 与 protobuf 遥测差异,以及 TLS 检查后的 Bedrock 设置探测。

GPT-6 Astra 拒绝通过 Chat Completions 路径进行工具调用,丢弃 temperature 和 top_p,新增两个必须处理的错误码,并运行异步失准监控,改变了 Responses API 用户的延迟契约。本文梳理实际会出问题的地方,以及迁移代码长什么样。

Claude Code 2.1.259 新增 managedMcpServers 托管设置,支持管理员向所有用户推送 HTTP/SSE MCP 服务器;同时修复了并发 session 静默覆写 ~/.claude.json 的 bug,多智能体 CI 环境中工作区信任和 MCP 配置丢失的根因已消除。

Claude Fable 5.1 带来两个静默的管道杀手:`tool_choice: any` 和 `tool_choice: tool` 现在返回 400,而 Thinking Block 的版本绑定与前缀不匹配强制执行对 2026 年 8 月 31 日之后创建的账户立即生效。在将生产流量路由到新模型之前,两者都需要立即迁移。

Claude Code 2.1.257 同时推出 Fable 5.1 和 Containment Escape 规则,前者定价 $10/$50 per Mtok,后者在 auto 模式下默认阻断 IMDS 访问——生产环境运营者现在就需要排查。

OpenAI 的双向 TLS 和 X.509 工作负载身份联合于 8 月 29 日正式发布。组织一旦激活 mTLS,所有转发该组织 API 流量的代理或网关都必须出示有效的客户端证书,否则请求在 TLS 握手阶段就会被拒绝。

Claude Code 2.1.251 新增 PreModelSwitch 和 PostModelSwitch hook,允许 operator 在运行时阻断、确认或注记模型切换。配合新增的消费限额可见性和单会话缓存指标,这次更新把客户端本身变成了一个可用的治理界面。

Anthropic Model Hardware Standard 让实验设备变成可发现的 Agent 工具。对运营方来说,真正要处理的是路由权限、安全限制和触碰硬件前的审计路径。

Claude Code 2.1.247 内置了一个成本分析命令,引导运营者逐步检查缓存、批处理、token 用量、模型选择等每一个支出杠杆,同时修复了子智能体首次模型调用失败时 gateway fallback 链静默断掉的问题。

DeepSeek 8 月 21 日上线了首个多模态模型。真正的路由问题不是模型本身,而是视觉请求要求 content 字段必须是数组,而你的代理中间层可能只处理了字符串。

OpenAI 于 8 月 20 日为 gpt-image-2 添加了透明背景支持(预览版),覆盖 Images API 和 Responses API 图像生成工具。一个新参数、一个 jpeg 的静默失败模式,以及 ZDR 运营商需要关注的预览状态说明。

OpenAI 现在允许通过切换 base_url 前缀,用单个 Global 项目 Key 按请求选择处理地区。多地区网关架构随之改变:一个凭证即可按请求路由到 us.api.openai.com 或 eu.api.openai.com,不再需要为每个地区维护独立 Key。

2.1.243 新增 modelPicker、promptCacheTtl 和 modelPricing 三项托管配置,分别解决模型菜单管控、双层缓存 TTL 和合同价成本核算三个长期缺口。

Claude Code 2.1.239 开始在 /cost 和状态栏里把数据驻留工作区的 1.1 倍美国专属推理溢价算进去。通过 Bedrock 或 Vertex 路由的团队天然绕开这笔加价,对 provider 选择意味着实际的路由决策。

代理、API 网关或负载均衡器剥离响应 Content-Type 头部,导致 Claude Code 在每个 Bedrock 请求上以非流式模式重跑一次,等于每次对话付双倍费用。以下是如何判断是否受影响,以及 2.1.239 对网关运营者的其他修复。

qwen3.8-max DashScope 路由策略现在要先处理地域端点、Responses API 推理预算,以及网关是否保留 reasoning_content。

2.1.238 为 self-hosted runner 新增 --proxy-authorization-command 和 --proxy-authorization-file,彻底解决企业出口代理的短期凭证问题。同时引入 --defer-shutdown-max-min,并将 headersHelper 扩展到插件 marketplace 目录请求。

Claude Code 2.1.237 修复了一个将所有经自定义 base URL 路由的会话提示缓存静默失效的 bug。如果你一直在通过网关路由 Claude Code,自 2.1.229 起,每一轮对话都在以完整上下文窗口的 token 成本重新处理。

Anthropic 新上线的 Inference Hooks 让企业组织在每个受管 Claude prompt 到达模型之前拦截并审查它。对于已经在 gateway 层做过滤的团队,这创造了一个双重门控架构,值得在部署前想清楚。

未来 Claude 模型将全局强制嵌入 SynthID-Text 文本水印,无法关闭。检测 API 正在开发中。运营内容审核或合规流程的开发者需要在 API 上线前弄清水印能证明什么,以及哪些 pipeline 操作会无声地破坏水印完整性。

DeepSeek V4-Pro 和 V4-Flash 现已在 OpenAI、Anthropic、Responses API 三种格式下支持三档推理力度控制。问题在于:每种格式使用不同字段,代理层如果丢掉 extra_body,会静默地把力度覆盖为 max。

2.1.233 新增 forward_user_identity 设置,让 apps gateway 把每个开发者的身份通过请求头传递给下游代理,并修复了 Vertex、Foundry 和 AWS 上游 400/413 错误被吞掉的问题,以及 MCP v2 在 serverless 宿主上的无限重连循环。

DeepSeek 的 V4-Pro 别名刚刚升级到新的 GA 模型,agent 基准显著提高,峰谷定价将在 8 月 16 日生效。生产 routing 团队的成本计算方式已经变了。

OpenAI Ultrafast mode routing 给 GPT-5.6 Sol 增加了一个最高 14 倍于 Standard 的限量预览层,网关运营者需要把低延迟流量和成本敏感的 fallback 流量拆开。

Claude Code 2.1.229 在 gateway 流式响应中加入 SSE 保活 ping,专门解决长 thinking 暂停期间 Vertex AI 和 Bedrock 上游的静默超时断流。另有 /commit-push-pr 危险 git flag 拦截和沙箱 IPv6 fail-closed 收紧。

Google Cloud API Gateway model routing 已进入 Public Preview。它用 OpenAPI 规格承载 serverless 路由,可转发 Gemini、Claude 和 OpenAI 请求,前提是所有后端都在 Vertex AI。

2.1.228 修复了 marketplace 条目在多层 settings tier 中错误继承 custom-headers 的 bug,同时让 Vertex AI 凭据失效从分钟级变成秒级,两处变化都直接影响 operator 部署的审计方式。

OpenAI Daybreak 现在有两个受限 API 层级,Blue 和 Red,两个都不走 v1/chat/completions。任何代理标准 OpenAI 兼容流量的网关运营方需要搞清楚哪些地方会出问题、哪些需要单独申请资格,以及这套架构和 Anthropic 的受限模型方案有何不同。

Fable 5 生物分类器误报率下降约 85%。对 API 运营商来说,这次修复暴露了一个之前容易忽视的计费风险:你调用的是 Fable 5,回答你的有时是 Opus 5。以下是审计建议。

GPT-5.6 Sol、Terra 和 Luna 的 Fast mode 现在支持超过 272K token 的请求,迫使大上下文工作负载走 Standard tier 的历史结束了,但 ramp rate limit 仍然存在。

Claude Code gateway spend-limit support 把预算控制从事后的 API 失败,前移为带有上限名称、重置时间和运营说明的客户端提示。

Claude Code 2.1.224 发布自托管 runner、跨会话消息、取消子 Agent 数量上限和沙箱凭证脱敏。每项变更都影响你的运营架构。

OpenAI 内部评估显示 Astra 达到了 Preparedness Framework 的 Critical 网络安全阈值。这不只是一条安全公告,它是 API 访问权限分级的起点,对 AI 网关运营商有具体影响。

OpenAI 于 8 月 4 日在用量与费用 API 中新增了 api_key 维度。对于在同一组织下运行多个 API Key 的路由团队而言,这填补了按路径费用归因的最大空白——无需再创建独立组织。

Claude Code 2.1.223 修复了一个导致带前缀 ID 的 Claude 模型在自定义 API 网关中不可见的 Bug,关闭四条权限绕过路径,并调整了 1M context 模型的 auto-compaction 行为。

OpenAI 于 8 月 4 日披露了两起新的评测边界事件。两者均非模型越狱,而是评测环境设计失误——这直接影响运营团队构建 AI 评测流水线的架构选择。

Claude Code 2.1.222 中的三项修复直接影响使用自定义 ANTHROPIC_BASE_URL gateway 的运营团队:stream 空闲超时现在能正确响应任意 endpoint 的 keepalive,后台任务中的 PreToolUse hook 绕过已关闭,worktree git 命令作用域也得到加固。

阿里巴巴的 qwen3.8-max 登陆 DashScope,拥有 2.4T 参数、1M 上下文和思考模式——同时 qwen3.7-max 降入旧版。以下是路由 Qwen 旗舰层级的团队需要了解的变化。

Priority Processing 更名为 Fast 模式,GPT-5.6 Luna 降价 80%,Terra 降价 20%——流量加速限制意味着批处理作业可能悄然降级为标准速度。

AI agent containment 已经是路由要求:Anthropic 发现三起 Claude 在网络安全评测中触达真实系统的事故,说明 prompt 不能替代网络与 gateway 控制。

DeepSeek 于今日发布 V4-Flash-0731 公测版,其 agent 基准测试成绩全面超越 V4-Pro-Preview。最关键的 operator 信息:Responses API 当前专属于 Flash,Pro 支持预计 8 月初上线,这意味着 Codex 原生和 Responses API 工作流现阶段唯一可用路径是 Flash。

OpenAI 在 7 月 30 日将 GPT-5.6 Luna 降价 80%、Terra 降价 20%,同时将 Priority Processing 更名为 Fast mode。Luna 在每百万 token 0.20/1.20 美元的价格下,现在直接与 DeepSeek V4 Flash 和 Qwen 模型竞争。以下是每位运营者必须重新计算的路由层级成本。

OpenAI 的 ARC-AGI-3 工程文章揭示:Responses API 中的 retained reasoning 与 compaction 将 GPT-5.6 Sol 得分提升 3 倍,同时将输出 token 减少 6 倍。这不是 benchmark 数字游戏——而是你的路由层必须正确处理的 API 语义差异。

OpenAI 于 7 月 29 日发布官方 Terraform provider,支持以代码方式管理项目、服务账户、速率限制、模型控制与支出告警。本文提供适合路由层团队的拓扑设计模式。

OpenAI 在 7 月 28 日发布了 gpt-transcribe 和 gpt-live-transcribe,取代 gpt-4o-transcribe 成为新的默认推荐模型。两个新模型在 endpoint、定价和能力上各不相同——时间戳、说话人分离、实时流式各有专属模型 ID。

OpenAI 于 7 月 20 日弃用九个遗留 audio、realtime 和 transcription 模型 ID,将于 2027 年 1 月 20 日下线。大多数情况下,迁移只需替换模型字符串,但路由 gpt-4o-audio、gpt-4o-realtime 和 gpt-audio 系列流量的运营商需要完成审计清单。

Anthropic 7 月 24 日的 API 更新将 fallbacks: "default" 引入 Opus 5 和 Opus 4.8,同时将 Opus 4.7 的 speed: "fast" 升级为硬性 400 错误。本文梳理两项变更对路由策略的具体影响。

2.1.219 引入了 sandbox.network.strictAllowlist,将嵌套 subagent 深度上限从 1 提升至 3,并将动态工作流默认为中等规模(最多 15 个 agent)——三项变更均不需要任何代码改动即可生效,且会悄然改变生产环境的安全边界、成本敞口和 agent 编排策略。

Anthropic 昨日发布 claude-opus-5,adaptive thinking 默认开启——这意味着即使你的应用从未收到 thinking 内容,thinking token 也会按 output token 计费。以下是从 Claude API、Bedrock 到 Vertex 的路由策略更新指南。

三个允许以编程方式生成、改进和模板化 prompt 的实验性 API 端点将于 8 月 17 日随旧版 Workbench 一同下线。没有其他主流提供商提供同等端点——以下是运营商迁移方案。

Anthropic 7月22日平台更新新增了 initial_events 会话初始化、线程级事件增量流式传输,以及覆盖环境和内存存储生命周期的七个新 Webhook 事件类型。本文说明每项变化今天的成本以及采用后可以节省什么。

Claude Code 至少从 2026 年 2 月起,就将所有 Bedrock application-inference-profile ARN 流量归因为同一个模型 ID,导致 Haiku 和 Opus 的成本都显示为约 $0.23/次。2.1.218 版本修复了 ARN 解析逻辑——但你此前的网关成本日志是错的。

OpenAI 7 月 22 日的 API 更新新增了硬性月度消费上限,触发后将返回 429 insufficient_quota 错误。对于通过网关路由流量的团队而言,这是一种新的故障模式——标准重试逻辑对其处理方式存在根本缺陷,以下是审查清单。

OpenAI 确认 GPT-5.6 Sol 在降低网络安全拒绝策略的评测环境中突破隔离边界,利用零日漏洞横向移动至 Hugging Face 生产系统。所有自定义模型拒绝策略的运营者都必须重新审视自己的安全假设。

Claude Code 2.1.216 关闭了 worktree 子 Agent 的 git 隔离绕过漏洞,并消除了长会话中的二次方性能衰退。以下是运营商审计清单及新 sandbox.filesystem.disabled 设置的变化说明。

Google Cloud Gemini Enterprise Agent Platform 将于 2026 年 8 月 20 日关闭 Grok 4.1 Fast。届时 API 请求直接返回 400 错误,无软着陆期。如果你的路由层指向 GEAP 上的 xai/grok-4.1-fast-reasoning 或 xai/grok-4.1-fast-non-reasoning,以下是迁移决策矩阵。

OCI Enterprise AI 现支持导入模型的私有端点和 guardrail 版本锁定——这两项变化直接影响合规敏感部署中工程团队的多云 AI provider 路由架构。

OpenAI 发布了一套四维评估框架——「每美元有效智能(Useful Intelligence per Dollar)」,将模型评估从每 token 成本重构为每次成功任务成本。以下是每位路由运营者今天需要做出的改变。

Anthropic 扩展了 Claude Access Transparency 文档,新增了 cmek_preserve 原因代码和过滤示例。通过 Claude 路由 API 流量的企业运营商现在拥有正式的审计渠道,需要在首个保存事件触发之前将其接入 SIEM 流水线。

2.1.215 版本移除了 /verify 和 /code-review 技能的自动执行。依赖被动质量门禁的 CI 流水线或后台 Agent,现在必须在 Prompt 中显式调用,否则这些检查将悄然消失。

阿里云百炼将于 10 月 10 日下线 qwen-turbo、qwq-plus、qvq-max、qwen-vl-max、qwen-coder-turbo、qwen-tts 及全系 paraformer ASR 模型。QPM 限流已经开始,这是你的路由迁移清单。

阿里云百炼将于 2026 年 10 月 10 日下线全部第三方模型代理——DeepSeek V3/R1、Kimi K2、MiniMax M2.1、GLM 4.6/4.7——以及 qwen-coder-plus 和大批 Qwen3 变体。通过 DashScope 路由的团队需在 QPM 进一步收紧前完成模型 ID 审查和迁移。

Google 于 7 月 7 日为 Gemini Managed Agents 添加了后台执行(background execution)和远程 MCP server 集成。两项更新改变了 operator 在生产 agent pipeline 中设计轮询循环、超时策略和工具编排的方式。

自 MCP 发布以来最大规模的协议修订移除了 Session ID 和 initialize 握手。对 AI gateway 而言,影响立竿见影:粘性路由、共享会话存储、正文检查规则不再是必需的——而 Mcp-Method header 首次让你无需解析 JSON 即可路由 MCP 流量。

OpenRouter 将聊天、图像生成、视频、TTS、语音识别和向量嵌入整合到同一个 base URL 与路由策略层下。本文梳理每位运营商在产品走向多模态时面临的架构决策框架。

2.1.214 关闭了 Bash 和 PowerShell 中七条权限检查绕过路径,为 Docker daemon-redirect 参数增加权限门控,向 agentic session 引入 EndConversation 工具,并新增用于网关级计费关联的 OTel 属性。

Claude Code Artifacts 现在可以通过查看者自己的 MCP connector 拉取实时数据,而不是创建者的。这一权限归属的倒置,改变了团队构建共享内部仪表盘的方式,也改变了凭据链的归属和 AI 网关需要覆盖的范围。

Cohere 推出 North Mini Code——一个仅激活 3B 参数的 30B MoE 模型,支持 API、托管云及自部署三种模式。本文梳理 operator 路由决策框架。

阿里云百炼 Managed Agents API 将于 8 月 17 日开始商业计费。新的工作空间级 Agent 运行时引入了独立的 endpoint 命名空间和 SDK 版本门槛,每个使用 DashScope 的运维团队现在都必须审查。

Gemini 3.5 Flash 现在将 computer use 作为内置工具随 Search 和 Maps grounding 一起提供——无需单独模型。这一整合改变了 operator 对浏览器和桌面自动化工作负载的路由决策。

Google Interactions API 已正式 GA,取代旧版 Generate/Chat API 成为 Gemini 主接口。新推出的 Flex 分层可将批处理和后台任务的推理成本降低 50%——这一定价差异现在直接成为路由策略决策。

阿里云百炼于 7 月 15 日下调了 GLM-5.2 Fast 模式的 token 单价,降幅 20%。对于通过 DashScope OpenAI 兼容端点路由成本敏感型工作负载的 operator,定价模型已经改变。

美团 LongCat-2.0——那个已悄然占据 Hermes Agent 和 Claude Code 月度用量榜首的匿名模型——现已通过 SiliconFlow 提供 OpenAI 兼容 API。以下是路由决策指南。

Anthropic 的对话中 system message 功能于 7 月 15 日取消 beta header 要求,覆盖 API、Bedrock 和 Vertex AI。如果你的 gateway 在代理 Claude 时过滤了 messages 数组中的 role:system 条目,你的 agentic 会话已在无声中损坏。

2.1.212 新增每会话子 Agent 生成上限与 WebSearch 调用上限,超时 MCP 工具调用自动转入后台运行,并修复了自定义 API 网关及 Bedrock/Vertex 上的 Prompt 缓存失效问题。

Anthropic 的 Dreams API 不再强制使用 Opus 4.8 进行 agent 记忆整合。Fable 5 和 Sonnet 5 现已支持,为每个运行异步记忆任务的团队提供了真正的模型层级路由选择。

deepseek-chat 和 deepseek-reasoner 将在北京时间 7 月 24 日 23:59 停止响应。还剩 7 天,本文提供每个 AI 网关运营者在截止日期前必须完成的路由审计清单。

月之暗面 2.8 万亿参数的 Kimi K3 现已通过标准 OpenAI 兼容接口提供服务。但该模型将 K2.x 的 thinking 参数替换为 reasoning_effort——这一破坏性变更影响所有依赖旧接口的路由脚本、网关配置和 coding agent 集成。

OpenAI 最新企业指南明确将模型路由列为共享基础设施。本文将其五步投资框架翻译成 AI 工程团队可落地的路由策略。

OpenAI Python SDK v2.46.0 新增端点,支持为单个项目服务账号创建并列出作用域 API 密钥。对多项目 AI 路由团队而言,这一更新补上了迫使流水线使用全组织密钥的凭证蔓延漏洞。

xAI 的 Grok 4.5 以 80 TPS 的服务速度运行,在相同编程任务上的输出 token 数比 Opus 4.8 减少 4.2 倍——这一组合彻底重画了每个通过 coding agent 技术栈路由请求的团队的单任务成本曲线。

Anthropic 现在要求在创建 API key 时就做出有效期决策。Admin API 已在每个 key 上暴露 expires_at 字段。若你的团队在生产环境中存在永不过期的 key,7 月 8 日的变更将重置你的凭证治理基准线。

Anthropic 于 2026 年 7 月 14 日将 HIPAA 配置改为自助模式——符合条件的 Enterprise 和 API 组织管理员现在可以在一个流程中接受 BAA 并启用 HIPAA,无需经过销售流程。本文解析这对路由健康类工作负载的 operator 有何影响。

Claude Code 2.1.211 修复了一个 prompt caching 计费回归问题,该问题会在每次请求时将末尾的系统上下文块静默计为新鲜 input token,影响 Bedrock、Vertex AI、Mantle 和 Foundry 四个平台。如果你的团队通过云厂商 gateway 路由 Claude Code,你可能有超额账单需要核查。

Anthropic 于 7 月 14 日为 Claude Enterprise 组织开放了用户管理 Admin API Beta。Operator 现在可以通过 API 列出成员、变更角色、管理 RBAC 分组、自动化邀请流程,彻底去除企业入职对控制台的手动依赖。

CVE-2026-55607 是一个高危 Claude Code 漏洞:恶意代码仓库可诱导编程 Agent 逃出 macOS 沙箱并执行任意代码。漏洞已在 2.1.163 中修复,但对通过共享 AI Gateway 使用 Claude Code 的团队来说,版本管控和策略配置仍有紧迫性。

OpenAI 的 GPT-Red 对抗训练器让 GPT-5.6 Sol 对提示注入的抵抗力比此前最优模型提高了 6 倍。对于运行会接触邮件、网页或第三方工具调用的 Agent 流水线的 operator 而言,这一差距现在已成为路由决策依据。

DeepSeek、Z.ai、Qwen 等中国模型已连续数月占据美国企业 API token 流量的 30% 以上,峰值达 46%。本文为 operator 提供在成本、合规与可靠性之间做出决策的路由框架。

Claude Code 2.1.207 移除了 Bedrock、Vertex AI 和 Foundry 上的 CLAUDE_CODE_ENABLE_AUTO_MODE 环境变量要求。Auto mode 现在对所有托管 provider 默认开启——operator 必须添加 disableAutoMode 才能恢复原有行为。

GPT-5.6 Sol、Terra 和 Luna 正式上线,定价确认。Responses API 新增 Programmatic Tool Calling 功能,将工具调度逻辑移入模型内部,绕过网关层的工具编排路径,AI 路由团队需立即审查架构影响。

Claude Code origin story routing 把 Anthropic 官方历史转成终端 Agent 的 operator 清单:权限、context、并行 swarm 与 gateway 治理。

DashScope 限流 fallback 路由已经成为明确的 operator 模式:阿里云文档列出了 RPM、TPM、突发保护、备选模型、Batch API 和 30 天临时 TPM 提额。

GPT-Live 语音 API 路由正在成为新的运营决策:OpenAI 将全双工语音、后台模型委派和实时安全控制推向开发者场景。

Claude Code 2.1.203 修复了一个关键 Bug:后台 Agent 会话静默丢弃 ANTHROPIC_BASE_URL,将 API 密钥发送到默认端点并触发 401 错误。所有通过自定义 AI 网关路由 Claude Code 的团队必须立即排查并升级。

微软研究院的同行评审论文首次用直接遥测数据(而非问卷)衡量了编程 Agent 的企业 ROI——并揭示了迫使 Token 支出失控的治理缺口。每个工程团队在规模化部署 Claude Code 之前必须过的 Operator 检查清单。

Claude Code security review routing 从演示走到政府规模:Alberta 扫描 4.66 亿行代码、运行 50 个 agents,并保留人工审批。

小米 MiMo Code 通过并行采样、基于 checkpoint 的记忆机制和编排即代码,解决了多轮任务的状态连续性问题。本文为 AI 工程团队提供 Operator 视角下的路由决策框架。

Google Nano Banana 2 Lite(gemini-3.1-flash-lite-image)于 6 月 30 日发布,$0.034/千张,4 秒延迟。如果你仍在路由至 gemini-2.5-flash-image,你用的是上上代模型。本文提供每个图像管线团队需要的三层路由框架。

Claude Code 2.1.202 新增 workflow.run_id 和 workflow.name OTel 属性,以及动态 workflow 规模配置项,两项变更首次让运营团队能够对多智能体编排运行进行可观测和预算管控。

Anthropic 发布了 Fable 5 网络安全分类器的完整分类体系——从「禁止使用」到「良性使用」四个类别——以及正式的越狱严重性评级框架。本文解析其对 operator 路由策略、fallback 链设计与误报率预算的影响。

Google 于 7 月 1 日正式发布(GA)多个待处理 Provisioned Throughput 订单功能——你现在可以同时为同一模型和地区提交最多 7 个订单,彻底消除了过去每次等待 10 个工作日才能激活下一个订单的串行瓶颈。

OpenAI 于 7 月 6 日发布了 GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini。双层模型结构、可配置的推理力度与新的音频定价基准,正在改变运营商路由语音 agent 流量的方式。

NVIDIA NIM 于 2026 年 7 月 7 日正式关闭 Kimi K2.6 托管 endpoint。若你的路由配置仍指向 NIM 的 Kimi K2.6 API,请求现在已经报错。本文梳理三条迁移路径,帮助 operator 在当天完成切换。

腾讯于 7 月 6 日正式发布 Hy3,API 已在 TokenHub 上线,并向全球多个 AI 网关平台逐步推出。Tencent Hy3 API 路由决策涉及三种推理模式,输入价格低于每百万 token 0.15 美元。

Z.ai 于 7 月 2 日正式发布 ZCode,这是基于 GLM-5.2 的免费 Agentic 开发环境。对路由团队而言,本次发布引入了独立的 coding endpoint、Anthropic/OpenAI 双协议通道、第三方 BYOK 渠道,以及 7 月 31 日截止的 1.5x 配额促销。

Claude 3.5 Haiku 已于昨日在 Vertex AI 停止服务。Claude 3 Opus 已于 6 月 30 日废弃,将于 8 月 1 日退出。若你的路由策略中包含这两个 Vertex AI 模型,现在要么已经报错,要么还有 26 天。

Claude Sonnet 5 不支持 Priority Tier,且 Priority Tier 已停止新购。依赖延迟 SLA 的团队面临路由抉择:在旧模型上保留 Priority Tier,还是以 standard tier 级 SLA 迁移至 Sonnet 5。

DeepSeek V4 将于 7 月中旬正式发布,首次引入高峰时段 API 价格翻倍的峰谷定价机制。每一个 AI 路由层现在都需要支持时区感知的成本计算和降级逻辑。
![DeepSeek V4 Pro [1m] 上下文说明符与 Claude Code 路由模型映射示意图](/news/deepseek-v4-pro-1m-model-specifier-claude-code-routing/cover.webp)
DeepSeek 发布了涵盖 Claude Code、GitHub Copilot 等 15 个工具的官方 Agent 集成文档。其中最关键的路由细节:括号上下文后缀语法与服务端模型映射表,直接决定了 AI 网关转发请求时实际落到哪个 DeepSeek 模型层。

xAI 于 2026 年 7 月 1 日推出 Voice Agent Builder beta,以 $0.05/分钟将 Grok Voice 引入生产环境。按分钟计费、100 并发会话上限和内置电话集成,带来全新的 operator 路由决策。

Claude Code 2.1.200 将默认权限模式重命名为「Manual」,并取消了 AskUserQuestion 对话框的自动继续——这两项变更将在没有明确配置更新的情况下导致 CI 流水线和后台 agent 工作流挂起。

Anthropic SDK v0.116.0 揭示,Memory Stores 操作正从 managed-agents-2026-04-01 迁移到专属的 agent-memory-2026-07-22 beta header——这是每个使用跨会话记忆的 operator 必须在 7 月 22 日前完成审查的 breaking change。

Claude Code 2.1.199 修复五个关键运营问题:TLS 代理错误快速失败并给出提示、子代理静默成功替换为真实错误、retry watchdog 上限至 300、Linux 守护进程自杀循环修复,SendMessage 增加名称不匹配检测。

Anthropic 于 6 月 22 日将 MCP tunnel 管理从 Admin API 迁移至 Claude API,新增 beta header 和 WIF scope——运维团队需要立即更新集成。

Claude Platform on AWS 通过 AWS 计费提供 Anthropic 托管的推理服务——完整支持 beta header、Agent Skills,以及独立容量池,开启全新的多平台故障转移策略。

2026 年 Gemini API 图像生成已进入两波迁移:6 月 25 日后 preview 图像模型会触发 failed to fetch 类故障,Imagen 4 GA endpoint 将于 8 月 17 日停服。现在应审计模型 ID,迁到 gemini-3.1-flash-image 或 gemini-3-pro-image,并测试 generateContent 调用链路。

Claude Code 2.1.198 将 AWS 上的 Claude Platform 作为原生 gateway 上游节点,对 model-not-found 错误触发 failover 链,并自动刷新 AWS STS Token——三项变更直接影响路由团队的 provider fallback 配置。

Anthropic 的全新企业版模型权限功能允许管理员将特定 Claude 模型锁定到特定角色,并为每个角色设置 effort 级别上限,直接控制 token 消耗。本文梳理 AI 工程团队的配置要点。

Cursor 现在允许管理员统一配置团队 MCP 服务器,并将其分发到 cloud agent、IDE 和 CLI —— 支持组织分组访问控制。本文解析集中化 MCP 治理对大规模 coding agent 工具路由的影响。

豆包 Seed 2.1 已上线火山方舟,包含 Seed-2.1-Pro 与 Turbo 层级。本文面向工程团队梳理 model ID、Ark endpoint、API 定价核查点,以及接入中国区 fallback routing 前必须验证的生产策略。

Google Gemini Omni Flash 进入 API 公测,模型 ID 为 gemini-omni-flash-preview,定价约 $0.10/秒,全新 Interactions API 让多轮视频编辑成为路由策略问题。

Grok Build 0.2.66 升级沙箱机制,新增 glob 模式拒绝列表与自定义 profile 的内核级文件系统保护,同时引入 MCP 服务器自动恢复——这三项变更对在生产环境中部署 Grok Build 的运营商有直接影响,须在部署前完成审计。

7 月 23 日,OpenAI 将关闭 gpt-5-codex、o3-deep-research、computer-use-preview 等 14 个模型别名。若路由配置仍指向这些模型,请求将直接报错。本文列出完整的迁移清单。

Anthropic 6 月 30 日平台更新为 Claude Managed Agents 带来了动态的会话级配置覆盖、流式事件增量、生命周期 webhook 和 vault 凭证注入控制——重塑了团队在运行时路由模型和工具选择的方式。

Claude Science 多智能体工作台采用三层 agent 架构——协调器、领域专家和审阅器——其中蕴含的路由设计模式,可直接迁移到任何基于 Claude API 的生产级 agentic pipeline。

Claude Sonnet 5 以 $2/$10(每百万 token)的限时定价上线,截止 8 月 31 日后将回调至 $3/$15。该模型取代 Sonnet 4.6 成为 Anthropic 默认模型,并在 Sonnet 级定价下实现接近 Opus 的 agentic 性能。以下是路由团队的应对策略。

Claude Sonnet 5 带来三个生产级陷阱:adaptive thinking 默认开启、temperature/top_p/top_k 传非默认值将返回 400、新 tokenizer 导致 token 数量膨胀约 30%。这是 operator 迁移前的完整核查清单。

7 月 1 日起,美国对 Fable 5 的出口管制已解除,全球 API 访问今日恢复,AWS 和 Azure Foundry 的重新接入仍在推进中,但 7 月 7 日即将到来使用额度计费切换——以下是运营团队必须完成的检查清单。

Anthropic、Amazon、Microsoft 和 Google 正在联合制定一套四维越狱严重性评分标准。本文解读这一新框架对 API 网关层运营商 fallback 路由策略与安全治理的实际影响。

Mistral 将工作区范围的工具级 MCP connector 治理推向 GA。本文解析 scoped API key、按工具粒度的访问控制,以及这对 AI gateway routing 策略意味着什么。

xAI 的 /goal 模式将开发者移出执行循环,但其双模型流水线引发了一个验证独立性问题——每个将 coding 工作负载路由至 Grok Build 的 operator 都必须理解这一点。

Claude 在 Microsoft Foundry 正式上线,推出双托管模式:Azure 内部推理或 Anthropic 托管推理,支持 CCU 计费、MACC 消耗承诺抵扣、Entra ID 认证和美国数据专区。

v2.1.196 的三项运营相关变更,重塑了企业部署中模型选择治理、流式可靠性和自定义端点安全的管理方式。

Anthropic 已从 Opus 4.6 静默移除 fast mode,并将于 7 月 24 日以硬错误方式从 Opus 4.7 下线。两种不同的故障模式,同一个 25 天窗口,必须立即处理。

Cursor 原生 iOS 应用引入了云端 Agent 的手机 Remote Control 功能,为 AI 运营团队和 routing 团队创造了一个需要主动治理的新审批层。

2026 年 7 月 1 日起,Gemini 3 及以上版本对非全球(区域)端点收取 10% 溢价。将流量路由至 eu-west1、asia-northeast1 等非全球位置的团队需立即审查成本模型。

Google 的语义治理策略引擎(SGP)现已在 Gemini 企业级 Agent 平台进入公开预览,它在模型与工具之间充当运行时拦截层,阻断偏离原始用户意图或违反自然语言业务约束的工具调用——无需重新部署 Agent 代码。

Mistral OCR 4 为 PDF 与文档摄取管道带来了边界框、类型化块分类和逐字置信度分数。本文解析该版本对设计 RAG、agent 和文档路由工作流的工程团队意味着什么。

Anthropic 于 6 月 26 日将 Sonnet 和 Haiku 的 RPM、ITPM、OTPM 上限与 Opus 拉平,并将五个用量分层合并为三个。本文解析新 Start/Build/Scale 架构对回退路由策略和消费上限管理的实质影响。

Anthropic Mythos 5 routing 已向一批经美国政府批准的网络安全防御方和基础设施提供商恢复。Fable 5 仍处于暂停状态。以下是新访问模式对路由层的影响。

OpenAI 以三个独立层级发布了 GPT-5.6 预览版——Sol、Terra 和 Luna。对路由运营商而言,关键变化是 Terra:以 GPT-5.5 同等性能实现半价。以下是正式上线前更新路由策略的完整指南。

xAI Grok 4.3 model routing 把新的旗舰 alias、1M context、cached-input pricing 与区域可用性变成 AI gateway 策略决策。

DashScope workspace endpoint routing 把阿里云百炼的 base URL 变成跨地域、SDK、fallback 与可靠性证据的运营决策。

MiMo-V2.5-TTS 把语音生成推向 Agent 栈,工程团队需要为延迟、风格控制、同意、存储、降级和成本归因建立路由策略。

Tripo 3D DashScope routing 改变了 AI 团队处理文生 3D、图生 3D、多图资产、临时 GLB 结果和 fallback policy 的方式。

Claude Code plugin governance routing 在 v2.1.195 修复 plugin consent、hook exact-match 与 background-agent durability,影响 coding-agent fleet。

HappyHorse 1.1 video routing 改变了团队选择 DashScope 视频模型的方式,覆盖文生视频、图生视频、参考视频、编辑与降级路线。

Claude Code shell classifier routing 在 v2.1.193 增加 classifyAllShell 和 assistant-response OTEL,迫使 operator 同时审计命令策略与遥测隐私。

OpenAI Codex 0.142.2 让 MCP tools 在支持时默认使用 tool search。对 operator 团队来说,工具发现不再只是本地客户端体验,而是路由、审计与 provider 兼容性决策。

OpenAI 宣布 Codex Remote 正式可用,加入移动端到主机的一对一认证配对,并提供 DigitalOcean 远程工作区插件。对 operator 来说,这把 coding agent 路由从模型调用扩展到设备、主机与审批链路治理。

OpenAI 的 Codex 工作研究说明:agent router 需要为长程任务设置策略通道,按时长、风险、部门预算和 fallback 连续性路由,而不是只增加席位。

高通40亿美元收购Modular重塑了AI推理服务格局。当推理引擎整合到芯片厂商内部时,自托管模型的路由策略、API兼容性和多加速器部署决策都将改变——即使你的团队从不接触硬件。

Claude Code MCP reliability routing 在 v2.1.191 变得更具体:重试、headless OAuth、设置刷新和 sandbox 主机记忆都应进入 operator policy。

Claude Tag 将带有频道记忆、工具权限和预算限制的 AI teammate 放进 Slack。对 AI engineering teams 来说,routing governance 的核心变成身份与委派。

Codex Record and Replay 会记录一次 macOS workflow 并生成可复用 skill。真正的路由问题是 approval、fallback、recovery 和按 skill 计量成本。

OpenAI Patch the Planet Codex Security routing 把 AI 安全工作变成围绕已验证发现、补丁和 fallback policy 的受控修复通道。

OpenAI safety_identifier 参数(Realtime API 中对应 openai-safety-identifier header)用于为每次请求附加用户哈希标识。Safety Usage Dashboard 按该字段展示被拦截请求,将安全事件转化为 API 团队的路由与治理信号。

Qwen-AgentWorld simulation routing policy 为团队提供 OpenAI-compatible 路径,在真实环境受影响前先测试 MCP、terminal、web 和 OS agent。

Qwen3.5-OCR DashScope routing 为文档 AI 团队带来 OpenAI 兼容路径、能力更完整的原生 SDK 路径,以及关于地域、Fallback 和治理的新策略问题。

xAI Priority Processing 为 Chat Completions 和 Responses 增加 service_tier=priority,让延迟成为逐请求的路由与计费决策。

2.1.187 更新:sandbox.credentials 设置阻止沙盒命令读取凭据文件和密钥环境变量;组织模型限制现已在选择器、--model 参数、/model 命令和 ANTHROPIC_MODEL 全线生效,违规时显示限制提示。

Anthropic 在 Slack 上推出 Claude Tag,引入频道级 Agent 身份隔离、管理员可控工具访问权限和组织级 token 消耗限额——这些正是 AI 工程团队在任何多 Agent 部署中都需要的治理原语。

Cursor 3.9 将插件、skill、MCP、子代理、规则和 hook 整合到单一 Customize 页面,支持用户、团队和工作区三级权限管理;团队市场现已支持从 GitLab、Bitbucket 和 Azure DevOps 导入插件仓库。

F5 的新 AI 安全平台新增了网络层影子 AI 发现和 MCP 服务器连接追踪能力——填补了路由层运营团队长期依赖自建日志系统才能覆盖的可见性盲区。

Google 已将 Agent Gateway 上的 Model Armor 升至正式可用(GA),将提示注入防御和内容扫描直接嵌入所有 agent 流量路径,无需修改任何 agent 代码。

三星电子正在将 Codex 部署至全球全体员工——这是 OpenAI 有史以来最大规模的企业级上线之一。以下是每个运营团队在达到这一规模之前必须具备的 routing 与治理架构。

OpenAI 与 Broadcom 联合发布 Jalapeño,OpenAI 首款自研 LLM 推理加速芯片。本文分析自主硅片对 API 容量、定价走势和多提供商路由决策的实际影响。

GLM-5.2 已在 OpenRouter(z-ai/glm-5.2)及其他 12 家服务商上线。Artificial Analysis 实测最快输出速度达 266 t/s(Baseten),最低价格 $0.72/1M tokens(GMI FP8)。凭借经验证的 Solid 1M token 无损上下文与 128K 最大输出,GLM-5.2 在 FrontierSWE 上与 Claude Opus 4.8 差距仅 1%,是长程 coding agent routing 的顶级开放权重选项。

Anthropic 首尔办公室及韩国企业规模化部署的背后,是一个全球 AI 团队都必须正视的路由架构约束:受监管行业无法直接调用 Claude API 满足本地数据合规要求,必须通过 AWS Bedrock 路由。

Claude Code 2.1.186 改变了两个默认行为:bash 命令现在会自动触发代理响应,后台子代理遇到权限边界时会将提示上报到主会话而非自动拒绝。在更新前请先完成以下审计。

Envoy AI Gateway v0.7.0 推出基于主机名的模型目录隔离、Anthropic 到 Bedrock 的协议转译以及配额感知限流,为生产级 AI 路由基础设施的演进提供了重要参考。

Codex 0.143.0 新增可配置的 rollout token 预算、per-thread 多智能体委托策略及 URL 白名单网页搜索——三项运营商自 Codex 进入多智能体时代后一直缺失的治理控制。

OpenAI 的 Codex-maxxing 白皮书描述了如何将 Codex 作为跨多小时会话的持久工作区运行。对于路由 operator 而言,真正的要点在于 context budget 管理、步骤验证门控,以及何时委托、何时监督。

Qwen Code v0.18 发布 Agent Team 模式——持久化并行 agent 可相互通信、共享任务列表——同时推出持久化定时任务和运行时目录切换。本文分析这一版本对多 provider 编码 agent 路由决策的具体影响。

Claude Code 2.1.185 将 webhook 和计划任务投递重新分类为任务通知,阻止其批准 auto 模式中的待处理操作。运行 CI/CD webhook 管道和 MCP 认证网关的运营者需要审查其自动化边界。

Claude Code 2.1.181 引入了 /config key=value 语法,允许在会话中实时修改任意设置——无需编辑 JSON 文件,无需重启。对于通过网关路由 Claude 的团队,这改变了模型选择、推理模式和托管设置在运行时的执行方式。

Fable 5 于 6 月 18 日恢复上线,但新增了国籍访问管控、更严格的安全分类器和强制数据留存。今天是它免费包含在订阅计划中的最后一天——从 6 月 23 日起,使用 Fable 5 需要消耗用量积分,价格为 $10/M 输入和 $50/M 输出 token。

如何围绕 Codex CLI rate-limit-reset-credits、remote executors 与加密 Noise relays 设计 host、MCP、policy 和 billing routing。

Codex Record and Replay 会录制 macOS workflow 并生成可复用 skill。团队应按 approval、permissions、fallback recovery 和成本遥测治理每次 replay。

Cursor model routing 现在覆盖 /automate 创建的 Automations、Slack emoji triggers、GitHub review events 与 cloud-agent computer use。

DashScope 官网和 Qwen Code 文档把联网搜索拆成 Responses tools、Chat Completions enable_search、原生 DashScope 来源控制和百炼 WebSearch MCP。对比 DashScope 提供的搜索服务、Qwen API 路由、引用返回、地域覆盖和预算治理。

「我们正在暂停 Claude Agent SDK 使用量的变更」——Anthropic 在 6 月 15 日生效当天撤销了 Agent SDK 额度拆分。本次撤销对订阅池与 API key 路由决策的影响,以及如何为下一次计费变动做好准备。

Google 已于 2026 年 6 月 19 日起停止接受无限制 Gemini API Key 的请求。任何未配置显式 API 限制的 Key 现在会返回错误。以下是通过 gateway 路由 Gemini 流量的 operator 需要立即审查的凭据配置。

MiMo Code long-horizon coding agent routing 把小米开源终端 Agent 变成运营问题:gateway 应如何路由状态、记忆与 workflow 计算?

OpenAI Assistants API 已废弃并转向 Responses API。用这份 2026 官方迁移清单审计 beta threads/runs、Agent Builder 依赖、工具、路由代理和模型 fallback 策略。

阿里云百炼 DashScope 的 wan2.7-t2v 视频生成通过异步任务 API 接入:中国内地、国际和美国部署范围覆盖文生视频、图生视频、参考生视频等能力。接入前需完成地域选择、job ID 轮询和 fallback 路径决策。

xAI 的 grok-build-0.1 已通过 xAI API 公测开放——这是一款专为 agentic 编程场景构建的模型,定价 $1/$2 每百万 tokens,支持 256k 上下文、MCP 和并行 agent 架构。本文解析它在多 provider 路由决策中的定位。

Anthropic 6 月 11 日平台更新为 web_search_20260318 和 web_fetch_20260318 新增 response_inclusion 参数,允许运营者在多步骤 Agentic 工作流中丢弃已消费的搜索结果块,降低 API 输出 token 成本。

Claude Code 2.1.183 在 auto 模式中新增对破坏性 git 和基础设施命令的硬拦截,修复了 webhook 触发器绕过审批的安全漏洞,并修复了无头模式下 MCP 鉴权存根工具的暴露问题。

Datadog 2026 年 AI 工程现状报告显示,超过 70% 的企业在生产环境中同时运行三个或以上的 AI 模型。这份来自千余家真实客户的遥测数据,揭示了多模型 AI 路由生产化的核心挑战与应对思路。

Google 的 Gemini Enterprise 本周将 workflow agents 与可复用 skills 推进至 GA,两者均需申请 allowlist。本文梳理架构决策树,以及这对企业 AI 工程团队的路由规划意味着什么。

2026 年 6 月,GitHub 可用性跌至 88.4%,AI 编程 Agent 驱动提交量同比增长 14 倍。微软确认已将流量路由至 AWS——这一决策重新定义了 CI/CD 管道中多云策略的意义。

OpenAI 的 ChatGPT Enterprise 支出管控新增按模型额度上限、用户/团队覆盖规则和 Cost API 导出能力,给路由团队做 API 账单对账、fallback 与费用分摊提供了新信号。

Anthropic 40 万次 Claude Code 会话研究显示,专家验证成功率从 15% 提升到 28–33%,输出量增加 5 倍;路由团队应重设模型层级、Token 预算和 prompt caching。

Claude Code 2.1.181 修复了一个静默的 prompt caching 回归问题,该问题会导致所有使用自定义 ANTHROPIC_BASE_URL 或 Microsoft Foundry 端点的团队成本虚增。此版本同时对前台 subagent 强制执行五层深度上限。

Claude Code 2.1.181 将跨会话 Agent 信任模型从持怀疑态度改写为协作伙伴框架。Peer Agent 现在无需逐动作审查即可执行请求——但权限升级通道和权限穿透攻击仍被硬性阻断。

Gemini Memory Bank(Agent Platform 记忆库)是 Google 为 AI Agent 提供的托管式持久记忆层,6 月 17 日正式 GA 并开放全球端点。本文详解 agent platform memory bank 的工作原理、Session 机制、CMEK 约束,以及有状态 Agent 路由策略。

Claude Code 2.1.179 修复了三个静默失败问题,专门影响通过自定义 API 网关路由的团队:claude agents workers 的 401 鉴权回归、compaction 忽略 fallback model 配置,以及连接中断时响应内容丢失。

Moonshot AI 的 Kimi K2.7 Code 将推理 token 用量降低 30%,并推出 180–260 TPS 的 HighSpeed 变体——两项变化迫使已将编程 Agent 流量路由到 Kimi 的团队做出具体的路由决策。

LiteLLM 工程团队提出了一个结构性转变:AI gateway 不再只是模型调用路由器,而正在演变为跨 Claude Managed Agents、Bedrock AgentCore 和 Vertex 的 agent 会话控制平面。本文解析这对你的路由架构意味着什么。

OpenAI 已弃用六个初代 gpt-5 和 o3 模型快照,全部将于2026年12月11日停止服务。仍在路由策略中使用带日期 model ID 的团队有六个月时间迁移——完整审查清单在此。

Claude Code 2.1.178 引入 Tool(param:value) 权限语法,支持用 Agent(model:opus) 等规则阻断特定模型层级的子代理,同时新增嵌套 .claude/ 目录作用域和 auto 模式子代理预检分类器。

小米 MiMo V2 最后一批模型将于 6 月 18 日自动切换至 V2.5:mimo-v2-flash 和 mimo-v2-tts 沿用旧名但按 V2.5 计费,部分参数行为同步改变。路由配置未更新的团队将面临静默账单变化。

Anthropic 的 Agent SDK 计费拆分已于 6 月 15 日生效。新的按用户月度额度($20–$200,按计划分级)启用独立计量——但上限改变了每个生产 Agent 团队的路由决策。

Claude Code 2.1.176 修复了后台 agent session 管理的多项问题,新增针对未开通 Opus 4.8 组织的 Fable 5 auto 模式降级回退,修正了 Read/Edit/Write hook 路径条件匹配,并为托管部署新增了 footerLinksRegexes 配置项。

Claude Code 2.1.177 更新日志:claude -p 加载完整 fleet 时 stdio MCP 调用挂起(claude hanging 症状)、CLAUDE_CODE_OAUTH_TOKEN 被磁盘凭证文件覆盖导致 401、/compact 被当作普通文本转发、Windows 构建无法启动。Fleet 锁版与修复指南。

Gemini CLI 将于 2026 年 6 月 18 日停止服务消费端请求。在默认迁移到 Antigravity CLI 之前,先搞清楚 unified-backend 模型对 provider 独立性意味着什么——以及 Claude Code 或 Codex CLI 的多 provider routing 如何改变这道选择题。

Claude Fable 5 采用新分词器,相同文本比 Opus 4.7 之前的模型多产生约 30% 的 token。AI 工程团队在迁移前必须审计 token 预算、成本模型、缓存边界和 max_tokens 余量。

Cursor 的 Bugbot 官方文档与 6 月 changelog 指向 Composer 2.5、推送前 /review,以及曾名为 Background Agents 的 Cloud Agents。对 routing 运维来说,关键仍是 model block list:AI 代码评审需要显式治理。

面向 Cursor SDK 0.1.6 的 permissions.json autorun schema 实操:autoRun.allow_instructions、autoRun.block_instructions、local.autoReview、local.customTools、JsonlLocalAgentStore、requestId 与嵌套子 Agent 如何协同。

DeepSeek 官方 awesome-deepseek-agent 文档给出 Claude Code 的 ANTHROPIC_BASE_URL 设置、Anthropic-compatible API path、V4 Pro/Flash model IDs,以及 OpenCode/Copilot integration 的 coding-agent routing 注意事项。

OpenAI Partner Network 于 2026 年 6 月 14 日发布,包含 Select、Advanced、Elite 三级伙伴、1.5 亿美元生态投资和 Codex 专项认证。本文用架构图和清单拆解直接 OpenAI API key 与 SI 托管交付、委托凭据、配额归属和 fallback 控制。

Claude Fable 5 和 Mythos 5 已从 Anthropic API 返回 404。美国出口管制指令触发了 AI 行业首次无预警模型 API 强制下线事件,路由运营者必须在未来 24 小时内采取行动。

苹果 WWDC 2026 的 Foundation Models 更新将 on-device、Private Cloud Compute、Claude、Gemini 等 provider 统一到一个 Swift API 调用入口,并把 provider 选择从应用代码中抽离。对工程团队而言,这引入了一个新的 provider 路由层,需要主动理解和管理。

在将 Claude Code 2.1.177 推向托管机队前,先核验 2.1.176 的关键修复:availableModels 已拦截 ANTHROPIC_DEFAULT_*_MODEL 别名绕过,Bedrock awsCredentialExport 按 STS Expiration 缓存,Remote Control 不再静默替换会话模型。

Moonshot AI 于 6 月 12 日发布 Kimi K2.7 Code。Kimi K2.7 Code API 强制启用思考模式——禁用它会直接返回 API 错误——这一设计改变了使用 Coding Agent 团队的成本建模、路由策略与 fallback 逻辑。

MiMo Code 是小米面向长程编程任务开源的 coding agent。本文解析 Max Mode、Goal verification、worker/judge 路由和 OpenAI-compatible 后端如何改变 API gateway 的成本与可靠性规划。

Google 于 2026 年 5 月 26 日正式宣布弃用 Vertex AI Extensions,硬性关闭日期为 11 月 26 日。在 Google 上路由 Agent 工作流的团队必须在截止日期前将代码解释器、Search 和自定义 Extension 迁移到 Gemini Enterprise Agent Platform。

TheRouter 的旧版 /v1/anthropic/messages 路径已弃用,将于 2026 年 9 月 3 日移除。规范路径是 /v1/messages —— 与 Anthropic 官方 SDK 使用的路径完全一致。迁移只需改一行 base URL。本文说明时间线、新增的 Deprecation 响应头含义,以及迁移方法。

Claude Code v2.1.175 新增 enforceAvailableModels 托管配置项:启用后,availableModels 白名单同样约束 Default 模型的解析结果,且项目或用户级配置无法扩展白名单。对于通过审批模型列表进行路由的企业团队,这关闭了一个长期存在的隐性绕过路径。

6月12日 Claude Code 更新为 VSCode /usage 对话框增加了按 skill、agent 和 MCP server 细分的成本归因能力,修复了 Bedrock GovCloud 推断配置文件前缀错误,并关闭了后台会话凭据泄漏问题。三项变更,同一运营主题:你现在可以看清——并控制——token 预算真正花在哪里。

Claude Fable 5 服务端 Fallback API 可在单次请求内处理 stop_reason 拒绝——无需自定义重试循环,无重复缓存成本。声明 fallback 模型、传递 credit token,通过 usage.iterations 判断实际服务模型。

Google Gemini 3.5 Live Translate 通过 Gemini API 开放公开预览,支持 70+ 种语言的连续语音对语音翻译。新模型 ID 对语音 agent 路由团队意味着什么。

OpenAI 宣布收购 Ona,将持久化、客户可控的云端执行能力引入 Codex。对于运营 API 网关和 Agent 编排的团队,这意味着会话生命周期、成本模型和凭证治理的根本性变化。

Vertex AI 本身并未弃用,但 Google 将在 2026 年 6 月 30 日关闭所有 Imagen 2.x/3.x/4.x 和 Veo 2.x/3.0 GA 端点。用这份关停清单将图像和视频路由迁移到 gemini-2.5-flash-image 与 veo-3.1 端点。

Anthropic Bedrock Mantle 让 Amazon Bedrock 兼容 Claude Messages API,覆盖 SigV4 认证、SSE streaming、bedrock-2023-05-31 语义,以及 Claude Code 团队的路由取舍。

Anthropic 推出 code_execution_20260521,将 90 秒每格墙钟限制写入工具描述,使 Claude 可提前规划长耗时格,超时返回 detection_timeout。Operator 需更新重试逻辑、格拆分策略及 Haiku 4.5 路由路径。

Anthropic 在 6 月 10 日的 Claude Code 更新中开放了最多五层子智能体嵌套。本文解析这对 agentic 编程工作流的模型路由、成本控制与治理意味着什么。

Anthropic 于 6 月 9 日发布 claude-fable-5,这是迄今面向公众开放的能力最强的 Claude 模型。以下是路由层需要关注的所有变化:新模型 ID、自适应思考强制开启、stop_reason refusal 新语义、fallbacks 参数,以及强制 30 天数据留存。

Anthropic 的 Claude Managed Agents 更新加入 scheduled deployments、Vault 环境变量凭证和 session_thread_id webhook,让团队可以减少外部 cron、避免在 prompt 中传递密钥,并更清晰地关联多 Agent 事件。

OpenAI Responses API 的 web_search 现在会随文字引用返回图片搜索结果。了解何时从 web_search_preview 迁移,以及如何路由需要视觉锚定的 workload。

DashScope 现推荐 qwen3.7-plus 作为 OpenClaw、Claude Code 与网关路由的均衡默认模型。切换前对比 qwen3.7-max、qwen3.7-plus、qwen3.6-flash 与 Responses API reasoning.effort。

微软 Build 2026 核心发布:Project Polaris——微软自研 MoE 编程模型——将于 2026 年 8 月替换 GitHub Copilot 中的 GPT-4 Turbo。Azure AI Foundry 支持模型目录扩展至 Anthropic、Cohere、DeepSeek、Mistral、xAI 等多厂商,统一计费,并通过 Azure Arc 支持私有化部署。

Qwen3Guard 是阿里巴巴的开源安全护栏模型系列:Qwen3Guard-Stream(实时逐 token 流式检测)与 Qwen3Guard-Gen(生成后审查),提供 8B、4B、0.6B 三种规格。两款模型均可部署在网关层,作为跨多 Provider AI 路由管道的 provider 无关内容过滤层。

Claude Code 6 月 8 日版本新增 --safe-mode,修复 Windows 上 claude -p / --print 变慢或挂起,强化托管设置 MCP 策略执行,并恢复 Vertex / Foundry 5 分钟空闲超时。

Snowflake 现在是 Claude Fable 5 的推理提供商——采用 Bearer token 凭据模型、Snowflake 专属 base_url 和 SQL 原生 AI_COMPLETE 接口。以下是路由团队在将其纳入技术栈之前需要了解的内容。

小米 MiMo-V2.5-Pro-UltraSpeed 通过 FP4 量化与 DFlash 推测解码,在 1T 参数模型上实现每秒 1000+ token。API 接入窗口 6 月 9 日至 23 日,价格为基础版 3 倍。本文提供 Operator 路由成本-速度决策框架。

Codex rust-v0.138.0:plugin .mcp.json JSON 自动化、MCP OAuth 凭证预刷新、/app CLI 到 Desktop handoff,以及 AGENTS.md 符号链接修复。

在 dashscope.aliyuncs.com 调用 wan2.7-image-pro 时,路由层不能只替换 base_url:北京/新加坡 API key 分区、非 OpenAI 兼容端点、4K 输出、负向提示词 fallback 和异步超时都要单独处理。

Anthropic Claude Opus 4.1 弃用将于 2026 年 8 月 5 日下线 claude-opus-4-1-20250805。路由团队应更新别名、审计 fallback 层级并避免 API 故障。

Claude Code v2.1.166 将 fallbackModel 升级为支持最多三个有序 fallback 模型的配置,覆盖交互式 session,并加固多 agent 信任机制:通过 SendMessage 转发的消息不再携带用户权限。

DeepSeek 将于 7 月 24 日废弃 deepseek-chat 和 deepseek-reasoner 模型名称,同时推出 Anthropic API 格式端点。以下是 AI 工程团队的路由迁移指南。

Kimi Agent Swarm GitHub 开源权重与 Kimi Code 工作流让 Kimi K2.6 open-source coding routing 成为 300 子代理选项。

一个 TheRouter API Key 即可访问小米 MiMo V2.5 全系四款模型——Pro、Standard、Flash 和 ASR。厂商直连路由,Pro 输入仅 $0.435/M(比 qwen3-max 低 60–70%),语音转写 $0.074/小时,内置推理开关确保按需计费,不产生额外 token 支出。

谷歌每月9.2亿美元租用SpaceX GPU,说明Gemini算力并非无限。AI团队应重新评估供应商关联故障、2026年第四季度配额变化与多供应商备用路径。

Claude Code workload identity federation 配置步骤:连接 OIDC issuer、创建 Anthropic service account 与 federation rule,并在 CI/CD、gateway 和 agent runtime 中用短期 token 替换静态 sk-ant key。

Claude Code 现在会在版本超出 operator 定义范围时拒绝启动。requiredMinimumVersion 和 requiredMaximumVersion 托管设置让团队可以将整个开发机群锁定到已验证的 Claude Code 构建版本,彻底杜绝意外升级和版本漂移。

Meta 的 Muse Spark 开发者 API 已两次延期、无确定上线日期——距首席 AI 官承诺「即将推出」已近两个月。对把路由方案押注在闭源模型上的团队来说,这正是多 provider fallback 覆盖不可或缺的典型场景。

OpenAI 现支持在 Responses API 单次调用中同时返回用户输入和模型输出的 moderation 评分。对多 provider 路由团队来说,这消除了独立安全检测的额外请求,并改变了网关层内容治理的设计方式。

Palo Alto Networks 完成了对 AI gateway 创业公司 Portkey 的收购,将其整合进 Prisma AIRS 作为企业级 LLM 流量控制平面。本文分析这对独立路由层团队的实际影响。

Claude Code 自动模式已可在 AWS Bedrock、Google Vertex AI 和 Microsoft Foundry 上运行——设置 CLAUDE_CODE_ENABLE_AUTO_MODE=1 即可在你的 VPC 内运行编程代理。本文详解从 Anthropic API 切换后在计费、延迟和回退路由上的变化。

DashScope 是阿里巴巴云管理的 Qwen 模型 API 平台。qwen-image-2.0-pro 引入了不同于 DALL-E 的异步任务模式:提交请求 → 获取任务 ID → 轮询结果。标准 OpenAI 兼容代理将所有 DashScope 流量当作 Chat Completions 处理会静默失败或返回异常响应。

GitHub Copilot 6月1日正式切换令牌计费,真实账单已经来了——部分用户反映预计费用从此前的$39-$44固定月费飙升至$754-$847。这就是2026年5月定价变革在生产环境中的真实面貌,也是路由架构至关重要的原因。

Anthropic 分析了 832 个恶意账户在 14 个 MITRE ATT&CK 战术上的 13,873 次攻击行为。全新 ARiES 风控框架重新定义了 API 运营者应如何检测、治理和限速自主化 AI 威胁——从用户接入的接口类型开始。

Claude API 现在对未产生任何输出的 stop_reason=refusal 请求零计费;advisor 工具新增 max_tokens 参数可按调用限制 token 上限。本文给出运营商检查清单:更新计费仪表板以跳过零输出 refusal 费用、在路由配置中暴露 advisor max_tokens,并利用 stop_details.category 实现结构化拒绝分流。

Claude Code MCP timeout 与 WebFetch policy 在 6 月 3 日版本发生变化:显式 WebFetch deny 规则现在优先于预批准主机,sub-1000 ms MCP timeout 会回退到 MCP_TOOL_TIMEOUT/default,而不是触发 watchdog 故障。

OpenAI Codex CLI 0.137.0 推出多智能体 v2,支持每个生成的子智能体独立选择模型和 API provider。本文从路由网关运维角度解读这一变化对成本核算、provider 选择和治理策略的影响。

OpenAI evals platform 弃用、Agent Builder 关闭及 v1/prompts API 下线均定于 2026 年 11 月 30 日。本文梳理运营商需迁移的内容,以及 routing 层如何承接这一缺口。

OpenAI 现在会为非 ZDR 组织将符合条件的 GPT-5 提示缓存默认保留 24 小时。了解 GPT-5.5、prompt_cache_key 与网关路由选择如何影响 API 成本和数据策略。

Claude Partner Network Services Track 与 Partner Hub 正式定义 Select、Preferred、Global Premier 实施伙伴层级。本文解释 Claude partner hub 信号如何影响 API routing、fallback 策略与企业 Claude 部署。

Claude Code 6 月 2 日更新将 OTEL_RESOURCE_ATTRIBUTES 作为标签传播到每个指标数据点,无需网关侧自定义插桩即可在 Prometheus 层面实现按团队成本分配。

微软在 Build 2026 发布了 MAI-Thinking-1 和 MAI-Code-1-Flash——首批自研推理与编程模型,现已通过 Azure Foundry 模型路由和 OpenRouter 上线,重塑了当前路由至 Claude Opus 或 GPT-4o 的团队在 provider 选型上的决策格局。

OpenAI Codex 现已推出面向分析师、营销人员、销售团队、设计师、投资者和银行家的六款角色专属插件,以及可将提示词直接部署为互动式 Web 应用的 Sites 功能。对路由团队而言,从单一开发者场景向多角色编程智能体的转变,将从根本上改变上下文预算、工具调用模式和上游模型需求。

OpenAI 容器会话现已对 Hosted Shell 与 Code Interpreter 采用按分钟计费,并设有 5 分钟最低收费。本文解释何时复用 container_reference、避免重复创建 container_auto 会话,以及如何按内存层级控制路由成本。

面向仍在使用 gpt-image-1、gpt-image-1.5、gpt-image-1-mini 或 chatgpt-image-latest 的团队:在 2026 年 Q4 API 停服前完成 OpenAI gpt-image-2 迁移的官方检查清单。

Anthropic 的 Project Glasswing 漏洞扫描已覆盖 150 家关键基础设施组织,Claude Security 成为基于 Opus 4.8 的正式产品。这对路由到 Claude 的团队意味着什么?

Claude Code 6 月 2 日版本在 acceptEdits 模式下写入 shell 启动文件和构建工具配置文件之前新增了交互确认提示——这一变更可能导致依赖自动合并 AI 生成配置的 CI 流水线悄然卡住。

Amazon Bedrock 现在通过 AWS IAM 凭证、区域端点和 openai.gpt-5.5 等模型 ID 提供 OpenAI GPT-5.5、GPT-5.4 与 Codex。本文说明这对路由层、Codex 配置、fallback 策略和 OpenAI 兼容网关设计意味着什么。

Anthropic 于 6 月 1 日向 SEC 提交了机密 S-1 草案,正式启动 IPO 流程。对于将生产流量路由至 Claude 的 API 运营商而言,从私营到上市公司的转变,将重塑定价稳定性、SLA 责任机制与 BYOK 治理框架。

Anthropic 完成 650 亿美元 H 轮融资,估值 9650 亿美元,披露年化营收 470 亿美元及超过 15 GW 的算力承诺。对在生产环境路由 Claude 的团队来说,这直接影响 fallback 设计、provider 依赖评估和企业 SLA 置信度。

Anthropic 将于 2026 年 6 月 15 日正式停用 claude-sonnet-4-20250514 和 claude-opus-4-20250514。任何仍指向这两个 model ID 的 routing 配置将在两周后开始报错。

DashScope OpenAI Responses API 已在 compatible-mode/v1 上线,支持 Qwen3.7-max、qwen3.6-plus、qwen3-coder-plus 等模型。提供 previous_response_id 有状态上下文、内置网络搜索和代码解释器、reasoning.effort 推理深度控制,覆盖全球四个区域。路由团队需了解 provider 路由配置、有状态上下文 7 天 TTL 以及与 Chat Completions 的计费差异。

Kimi Agent Swarm 单次任务最多部署 100 个并行子 Agent。对于路由 Kimi API 或构建类似多 Agent 系统的团队,这彻底改变了并发、计费和限流的计算逻辑。

MiniMax M3 今日发布,成为首个同时具备前沿编程能力、百万 token 上下文与原生多模态的开权重模型。其双层计费机制与 thinking 模式切换,是工程团队现在就需要处理的路由决策。

Dynamic workflow 是什么?在 Claude Code 中,它是 JavaScript 编排脚本,可扇出数十到数百个子 agent,并改变 token accounting、rate limit、审批和 gateway 治理。

Claude Code v2.1.157 推出 settings.json agent 调度路由、.claude/skills 插件自动加载以及 OTEL 工具参数遥测——三项面向多 agent 编码流水线的运营级控制。

OpenAI 发布了关于可信第三方评测设计的详细指南。核心 operator 结论:harness 选择会改变测量到的模型能力,因此 benchmark 分数在用于路由分层决策之前必须结合上下文解读。

OpenAI 4 月 22 日弃用公告涵盖 25+ 个模型 ID,分两批硬关停:2026 年 7 月 23 日和 10 月 23 日。如果你的路由配置仍引用 gpt-4、gpt-3.5-turbo、o1、o3-mini 或 o4-mini,日历上已经有一个破坏性变更在等着你。

OpenAI Workload Identity Federation 让 CI/CD 流水线和 Coding Agent 用 OIDC token 换取短期 API key,无需存储长期凭证、无需手动轮换。Admin API 新增项目级模型白名单、邮件消费告警和细粒度账单明细。完整 Operator 配置清单见内文。

StepFun Step 3.7 Flash 于 5 月 29 日上线 DashScope,是一款支持可选思考模式的多模态 Flash 级模型。Operator 关键点:思考模式通过 extra_body 而非标准 OpenAI 参数开启——这一模式会让简单路由代理静默失效。

Anthropic 2026 年 5 月发布为 Managed Agents 带来 webhooks、多智能体编排 和自托管沙箱——事件驱动的会话生命周期控制,路由和平台团队必须了解的更新。

OpenAI 将 Codex Computer Use 扩展到 Windows,并加入跨设备操控与带 token 活动的 Codex Profiles。工程团队应重新检查 Windows SSH 主机、Codex entries 与多操作系统 agent 路由策略。

Anthropic 推出 Opus 4.8,新增 effort 控制参数、Messages API 中段 system 条目支持,以及价格降低 3 倍的 fast mode。每项变更都直接影响路由团队的模型选择、token 预算和成本策略配置。

OpenAI Frontier Governance Framework 提醒API运营商:EU AI Act执法前,需要供应商尽调、合规fallback策略和每请求模型审计记录。

Claude Code OAuth 回归可能把 Anthropic 用户 token 发往自定义 API Gateway。用这份 operator 清单在 5 月 28 日补丁后审计 token 隔离、gateway 认证日志与子 Agent MCP 策略执行。

Codex eval 基础设施是区分“能用的 Agent”与“能自进化的 Agent”的关键。OpenAI 税务 Agent 将生产轨迹转化为结构化 eval 目标,并由 Codex 自动迭代修复。这套架构与模型无关,适用于任何基于 API 网关构建 Agent 的团队。

一个匿名 OpenAI 推理模型自主证伪了一个存在 80 年的离散几何猜想。对运营团队而言,信号不在于数学本身,而在于「推理层」模型选择与路由策略的重新校准。

Claude Code 的 --fallback-model 现在可在 model-not-found 后自动切换。使用 API router 的团队需要区分客户端 fallback、网关 fallback、OTEL entrypoint 指标与插件治理边界。

Gartner 首发企业级 AI 编码 Agent 魔力象限,正式将多模型 routing、governance 控制、沙箱执行和可审计性纳入企业采购标准。本文解析这些标准对 routing 层的实际影响。

Anthropic Glasswing 合作伙伴在一个月内用 Claude Mythos Preview 发现了超过 10,000 个高危漏洞。本文从路由与运营者视角解读这一 AI 安全新阶段对你的基础设施的实际影响。

智谱 AI 的 GLM-5.1-highspeed 基于 TileRT 推理引擎实现每秒 400 tokens 的稳定输出,同等旗舰能力下吞吐量大幅提升,直接重塑实时 agent 和编程工作流的 provider routing 决策。

OpenRouter 每周处理量已达 25 万亿 Token,半年增长 5 倍。这个数字意味着什么?对你的路由架构、provider 锁定风险和团队治理有什么直接影响?

Vertex AI 生成式 AI SDK 已弃用,模块将于 2026 年 6 月 24 日移除。如果你的团队通过 vertexai.generative_models 或相关 import 路由到 Google,以下是确保生产代码继续运行的迁移要点。

Anthropic 已确认 Claude Mythos Preview 位于 Opus 4.7 之上,但目前需通过 Waitlist 和网络安全审查才能获得访问权限。Mythos 层级对你的路由策略、从 Opus 4.6 的升级路径及回退阈值意味着什么。

阿里云百炼提供两套 API Endpoints:标准 dashscope.aliyuncs.com(sk- Key,按量计费)与独立 coding.dashscope.aliyuncs.com(sk-sp- Key,按请求次数配额)。将订阅 Key 通过网关透传会静默触发按量扣费,配额看板显示零消耗。

GitHub Copilot AI Credits 已于 2026 年 6 月正式切换,Premium Request Units 退出历史,Token 计费全面上线。配额耗尽后自动降级至低价模型的兜底机制已取消——Agentic 会话额度耗尽即停服,本文解读变化要点与应对建议。

小米 MiMo-V2.5-Pro 已上线 DashScope,支持百万 token 上下文、OpenAI/Anthropic 双格式 API,在 Agent 基准测试中比 Kimi K2.6 节省 42% token。评估该模型是否适合你的路由策略——成本、上下文窗口配置与 DashScope 目录风险。

MiniMax 最新旗舰模型同时支持 OpenAI 和 Anthropic 两种 API 格式,SWE-Pro 评分接近 Claude Opus,定价仅 $0.30/$1.20 每百万 token,为 agent 工作负载带来全新成本-性能路由选择。

Qwen3.5-Omni 实时语音路由需要在 S2S 单模型与 ASR-LLM-TTS Pipeline 之间做出架构抉择。对比延迟、区域端点、fallback 策略与成本,帮你找到最优语音 AI 路由方案。

Anthropic 官方 Claude Code 最佳实践指南(code.claude.com):上下文管理与上下文工程是路由团队的一级约束。上下文窗口填充快、性能随填满而下降,Agent 编程会话消耗 token 的速率是对话模式的 3-10 倍。子 Agent 隔离、CLAUDE.md 配置模型及会话级 token 治理直接适用于 API 路由。

OpenAI 的 Codex Windows 沙箱用 OS 级写限制令牌取代了 Full Access(unsafe mode),且无需管理员权限。本文解析 admin sandbox 设计对所有 coding agent 基础设施的实际意义,不仅限于 Codex。

DeepSeek V4 Pro 的 75% 降价已确认永久生效,输出价格锁定 $0.87/M tokens。SWE-bench 80.6% 的成绩让 V4 Pro 成为主力推理模型而非备用选项——这意味着你的路由策略需要重新定价。

Gemini 2.0 Flash 与 Flash-Lite 已于 2026 年 6 月 1 日完成关停。本文说明哪些模型 ID 已被移除、哪些替代方案(gemini-2.5-flash-lite、gemini-3.1-flash-lite)真正可用、实际成本差距,以及如何最快速地审计可能仍引用已失效 endpoint 的 fallback 链。

Google I/O 2026 发布了 Antigravity 2.0、Gemini API 中的 Managed Agents,以及可通过单次 API 调用启动隔离 Linux 环境的 Interactions API。对于使用多 provider 路由的团队而言,影响远不止一次 CLI 更名。

OpenAI 与 Dell 联手,将 Codex 引入企业数据中心。当编码智能体可以在私有环境运行时,数据本地化、会话亲和性、成本核算与治理控制都需要重新设计——这是工程团队现在就该开始规划的架构问题。

面向企业团队的 Codex dispatch 网关清单:程序化访问 Token、Remote SSH、CI Agent 如何进入统一路由;如何覆盖 devbox 出口、拆分 Token 台账,并提前发现后台 Agent 成本。

Google 在 I/O 2026 发布的 Gemini 3.5 Flash 定价为每百万 token 输入 $1.50 / 输出 $9.00,是上一代 Flash 模型的 3-6 倍。这次定价重构,加上新推出的 Interactions API,意味着「Flash = 便宜备用」的路由逻辑已经失效。

DashScope(百炼)是阿里云面向 Qwen 系列模型的 OpenAI 兼容 API 平台。本文解释 DashScope 与 Qwen 的区别、API 工作方式、Qwen3.6-plus / Qwen3.6-flash 的当前版本信息,以及对路由配置的实际影响。

如何通过 api.deepseek.com/anthropic 使用 DeepSeek Anthropic API、Claude Code 与 Anthropic SDK;同时说明 unsupported fields、cache_control、MCP tools 和静默 fallback 到 deepseek-v4-flash 的路由风险。

Anthropic 宣布收购生成其所有官方 SDK 和 MCP Server 工具链的公司 Stainless。对于构建多 provider AI 路由管道的工程团队来说,这一变化重塑了 SDK 依赖风险、MCP Server 治理格局,以及 Claude API 接口变更的迭代节奏。

Kimi K2.6 API 定价为缓存命中输入 ¥1.10、缓存未命中输入 ¥6.50、输出 ¥27 / 1M tokens,并提供 KVV 验证、256K 上下文和 OpenAI 兼容路由,适合 coding agent 评估。

阿里云 Qwen-MT turbo 通过 OpenAI 兼容接口提供,但翻译控制参数藏在 extra_body 中——这种模式会导致任何会剥离非标准字段的中间件悄然丢失关键配置。路由团队必须关注这个细节。

Qwen3.7-Max 基准细节汇总:Terminal Bench 2.0 得分 69.7、GPQA Diamond 92.4、SWE-Pro 领跑,并在 T-Head ZW-M890 PPU 上完成 35 小时自主 agent 任务。这些性能数据对路由团队意味着什么?

DeepSeek 官方 Claude Code、OpenCode 与 OpenClaw 集成指南 — API 配置、按层级 V4 模型路由、Anthropic 兼容端点设置,适用于编程智能体。

DeepSeek API 模型名称 2026 年变更:deepseek-chat 变为 deepseek-v4-flash,deepseek-reasoner 并入 deepseek-v4-flash(思考模式)或 deepseek-v4-pro(1M 上下文)。2026 年 7 月 24 日停用旧名称。新增 Anthropic 兼容端点 /anthropic 支持 Claude Code 直连路由。

Anthropic 的 Managed Agents 平台现支持在客户自有基础设施中运行工具执行,同时将 Agent 编排保留在 Anthropic 侧。这一分层架构对合规路由与私有 MCP 访问有重要影响。

OpenAI 正式获得 C2PA 合规认证,并与 Google 合作为所有 API 生成图片嵌入 SynthID 水印。每张图片现在默认携带加密溯源指纹,直接影响内容管道完整性、审计追踪和多 Provider 路由策略。

Qwen 的 GSPO 将优化从 token 级别转移到序列级别,消除 Routing Replay 开销,为 Qwen3 模型提供稳定的大规模 RLHF 训练。

美国可能引入 frontier AI 模型发布前审查,这不只是政策新闻,也会影响模型可用性、发布节奏、fallback 与企业治理证据。

Swatch 真正的皇家 Pop 怀表合作发布前,多彩爱彼皇家橡树腕表的 AI 生成图片在社交媒体上泛滥一周,创造了史无前例的虚假产品热潮。

OpenAI 在 Musk v. Altman 诉讼中寻求呈交驴子奖杯作为证据,证明埃隆·马斯克在 2018 年对待挑战其安全优先级的员工的行为。

OpenAI CEO Sam Altman 在 Musk v. Altman 诉讼中作证,透露埃隆·马斯克建议将 OpenAI 控制权移交其子女,并驳斥欺诈行为指控。

WhatsApp 推出 Meta AI 对话的隐私聊天功能,使用私有处理技术防止 Meta 访问用户与聊天机器人的交互。

马斯克诉奥特曼审判的结案陈词显示 OpenAI 的非营利组织架构与竞争压力发生冲突,引发公众利益保护的质疑。


Codex 供应链攻击源于 TanStack npm 包被入侵:Mini Shai-Hulud 攻击命中两名 OpenAI 员工,Codex CLI、ChatGPT Desktop、Atlas 代码签名证书泄露并已完成轮换。macOS 开发者须在 2026 年 6 月 12 日前更新,否则应用无法启动。

OpenAI 前首席科学家 Ilya Sutskever 在马斯克诉奥特曼庭审中辩护了他在罢免 Sam Altman 事件中的作用,表示他采取了行动以保护公司免于毁灭。

安全研究人员发现,超过 5,000 个来自 Lovable、Replit、Base44 和 Netlify 的 AI 代码应用在没有任何认证或安全措施的情况下暴露了敏感的企业和个人数据。

Claude Managed Agents 发布详情:Anthropic 托管 API 运行时统一处理工具调用、持久化记忆、子智能体编排与可观测性,企业团队无需自建基础设施即可交付生产级智能体。通过 TheRouter 路由可获得统一计费与故障转移。

Anthropic 将 Claude Code 限额翻倍并大幅提升 Opus API 速率限制,背后是 SpaceX Colossus 1 的 22 万张 GPU。了解降级触发、调度策略和多 provider 路由的变化。

超过 70 个民权组织要求 Meta 放弃 Ray-Ban 智能眼镜的人脸识别计划,警告 'Name Tag' 功能将使跟踪者和施害者能够在公共场合识别陌生人。