
OpenAI Prompt Cache Diagnostics 正式发布:网关层不能随意丢弃的字段
OpenAI 的 Prompt Cache Diagnostics 工具在 Responses API 正式发布,新增 comparison_response_id 和 reason 字段用于定位缓存未命中原因。若网关层剥离 prompt_cache_options,诊断信号会静默丢失。
追踪会影响生产级 AI 编码工作流的路由事件:供应商故障、模型下线、fallback 行为、价格变化与 OpenAI 兼容 API 迁移。
RSS 订阅
OpenAI 的 Prompt Cache Diagnostics 工具在 Responses API 正式发布,新增 comparison_response_id 和 reason 字段用于定位缓存未命中原因。若网关层剥离 prompt_cache_options,诊断信号会静默丢失。

OpenAI 的 Agents API 公测版引入了 client.beta.agents 这个独立命名空间,它根本不经过 /v1/chat/completions。对于通过 AI 网关路由流量的团队来说,这意味着账单盲区、缺失的审计记录,以及一个需要单独管理的 API key 权限范围。

claude-fable-5-1 的 prompt cache 读取费用降至 $0.25/MTok,是其他 Claude 模型 0.1× 标准费率的四分之一。output_config.effort 参数让运营者在每次请求时调节思考深度与 token 消耗。本文拆解这两项变化对计费、路由和升级决策的实际影响。

Anthropic Model Hardware Standard 让实验设备变成可发现的 Agent 工具。对运营方来说,真正要处理的是路由权限、安全限制和触碰硬件前的审计路径。

OpenAI 于 8 月 20 日为 gpt-image-2 添加了透明背景支持(预览版),覆盖 Images API 和 Responses API 图像生成工具。一个新参数、一个 jpeg 的静默失败模式,以及 ZDR 运营商需要关注的预览状态说明。

OpenAI 现在允许通过切换 base_url 前缀,用单个 Global 项目 Key 按请求选择处理地区。多地区网关架构随之改变:一个凭证即可按请求路由到 us.api.openai.com 或 eu.api.openai.com,不再需要为每个地区维护独立 Key。

qwen3.8-max DashScope 路由策略现在要先处理地域端点、Responses API 推理预算,以及网关是否保留 reasoning_content。

Anthropic 新上线的 Inference Hooks 让企业组织在每个受管 Claude prompt 到达模型之前拦截并审查它。对于已经在 gateway 层做过滤的团队,这创造了一个双重门控架构,值得在部署前想清楚。

DeepSeek V4-Pro 和 V4-Flash 现已在 OpenAI、Anthropic、Responses API 三种格式下支持三档推理力度控制。问题在于:每种格式使用不同字段,代理层如果丢掉 extra_body,会静默地把力度覆盖为 max。

OpenAI Daybreak 现在有两个受限 API 层级,Blue 和 Red,两个都不走 v1/chat/completions。任何代理标准 OpenAI 兼容流量的网关运营方需要搞清楚哪些地方会出问题、哪些需要单独申请资格,以及这套架构和 Anthropic 的受限模型方案有何不同。

Fable 5 生物分类器误报率下降约 85%。对 API 运营商来说,这次修复暴露了一个之前容易忽视的计费风险:你调用的是 Fable 5,回答你的有时是 Opus 5。以下是审计建议。

GPT-5.6 Sol、Terra 和 Luna 的 Fast mode 现在支持超过 272K token 的请求,迫使大上下文工作负载走 Standard tier 的历史结束了,但 ramp rate limit 仍然存在。

OpenAI 于 8 月 4 日在用量与费用 API 中新增了 api_key 维度。对于在同一组织下运行多个 API Key 的路由团队而言,这填补了按路径费用归因的最大空白——无需再创建独立组织。

阿里巴巴的 qwen3.8-max 登陆 DashScope,拥有 2.4T 参数、1M 上下文和思考模式——同时 qwen3.7-max 降入旧版。以下是路由 Qwen 旗舰层级的团队需要了解的变化。

Priority Processing 更名为 Fast 模式,GPT-5.6 Luna 降价 80%,Terra 降价 20%——流量加速限制意味着批处理作业可能悄然降级为标准速度。

OpenAI 于 7 月 29 日发布官方 Terraform provider,支持以代码方式管理项目、服务账户、速率限制、模型控制与支出告警。本文提供适合路由层团队的拓扑设计模式。

OpenAI 在 7 月 28 日发布了 gpt-transcribe 和 gpt-live-transcribe,取代 gpt-4o-transcribe 成为新的默认推荐模型。两个新模型在 endpoint、定价和能力上各不相同——时间戳、说话人分离、实时流式各有专属模型 ID。

Anthropic 7 月 24 日的 API 更新将 fallbacks: "default" 引入 Opus 5 和 Opus 4.8,同时将 Opus 4.7 的 speed: "fast" 升级为硬性 400 错误。本文梳理两项变更对路由策略的具体影响。

OpenAI 7 月 22 日的 API 更新新增了硬性月度消费上限,触发后将返回 429 insufficient_quota 错误。对于通过网关路由流量的团队而言,这是一种新的故障模式——标准重试逻辑对其处理方式存在根本缺陷,以下是审查清单。

OpenAI 发布了一套四维评估框架——「每美元有效智能(Useful Intelligence per Dollar)」,将模型评估从每 token 成本重构为每次成功任务成本。以下是每位路由运营者今天需要做出的改变。

自 MCP 发布以来最大规模的协议修订移除了 Session ID 和 initialize 握手。对 AI gateway 而言,影响立竿见影:粘性路由、共享会话存储、正文检查规则不再是必需的——而 Mcp-Method header 首次让你无需解析 JSON 即可路由 MCP 流量。

OpenRouter 将聊天、图像生成、视频、TTS、语音识别和向量嵌入整合到同一个 base URL 与路由策略层下。本文梳理每位运营商在产品走向多模态时面临的架构决策框架。

阿里云百炼 Managed Agents API 将于 8 月 17 日开始商业计费。新的工作空间级 Agent 运行时引入了独立的 endpoint 命名空间和 SDK 版本门槛,每个使用 DashScope 的运维团队现在都必须审查。

阿里云百炼于 7 月 15 日下调了 GLM-5.2 Fast 模式的 token 单价,降幅 20%。对于通过 DashScope OpenAI 兼容端点路由成本敏感型工作负载的 operator,定价模型已经改变。

2.1.212 新增每会话子 Agent 生成上限与 WebSearch 调用上限,超时 MCP 工具调用自动转入后台运行,并修复了自定义 API 网关及 Bedrock/Vertex 上的 Prompt 缓存失效问题。

deepseek-chat 和 deepseek-reasoner 将在北京时间 7 月 24 日 23:59 停止响应。还剩 7 天,本文提供每个 AI 网关运营者在截止日期前必须完成的路由审计清单。

OpenAI 最新企业指南明确将模型路由列为共享基础设施。本文将其五步投资框架翻译成 AI 工程团队可落地的路由策略。

OpenAI Python SDK v2.46.0 新增端点,支持为单个项目服务账号创建并列出作用域 API 密钥。对多项目 AI 路由团队而言,这一更新补上了迫使流水线使用全组织密钥的凭证蔓延漏洞。

OpenAI 的 GPT-Red 对抗训练器让 GPT-5.6 Sol 对提示注入的抵抗力比此前最优模型提高了 6 倍。对于运行会接触邮件、网页或第三方工具调用的 Agent 流水线的 operator 而言,这一差距现在已成为路由决策依据。

DeepSeek、Z.ai、Qwen 等中国模型已连续数月占据美国企业 API token 流量的 30% 以上,峰值达 46%。本文为 operator 提供在成本、合规与可靠性之间做出决策的路由框架。

GPT-5.6 Sol、Terra 和 Luna 正式上线,定价确认。Responses API 新增 Programmatic Tool Calling 功能,将工具调度逻辑移入模型内部,绕过网关层的工具编排路径,AI 路由团队需立即审查架构影响。

Claude Code origin story routing 把 Anthropic 官方历史转成终端 Agent 的 operator 清单:权限、context、并行 swarm 与 gateway 治理。

DashScope 限流 fallback 路由已经成为明确的 operator 模式:阿里云文档列出了 RPM、TPM、突发保护、备选模型、Batch API 和 30 天临时 TPM 提额。

GPT-Live 语音 API 路由正在成为新的运营决策:OpenAI 将全双工语音、后台模型委派和实时安全控制推向开发者场景。

Claude Code security review routing 从演示走到政府规模:Alberta 扫描 4.66 亿行代码、运行 50 个 agents,并保留人工审批。

小米 MiMo Code 通过并行采样、基于 checkpoint 的记忆机制和编排即代码,解决了多轮任务的状态连续性问题。本文为 AI 工程团队提供 Operator 视角下的路由决策框架。

Google Nano Banana 2 Lite(gemini-3.1-flash-lite-image)于 6 月 30 日发布,$0.034/千张,4 秒延迟。如果你仍在路由至 gemini-2.5-flash-image,你用的是上上代模型。本文提供每个图像管线团队需要的三层路由框架。

Anthropic 发布了 Fable 5 网络安全分类器的完整分类体系——从「禁止使用」到「良性使用」四个类别——以及正式的越狱严重性评级框架。本文解析其对 operator 路由策略、fallback 链设计与误报率预算的影响。

Google 于 7 月 1 日正式发布(GA)多个待处理 Provisioned Throughput 订单功能——你现在可以同时为同一模型和地区提交最多 7 个订单,彻底消除了过去每次等待 10 个工作日才能激活下一个订单的串行瓶颈。

OpenAI 于 7 月 6 日发布了 GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini。双层模型结构、可配置的推理力度与新的音频定价基准,正在改变运营商路由语音 agent 流量的方式。

NVIDIA NIM 于 2026 年 7 月 7 日正式关闭 Kimi K2.6 托管 endpoint。若你的路由配置仍指向 NIM 的 Kimi K2.6 API,请求现在已经报错。本文梳理三条迁移路径,帮助 operator 在当天完成切换。

腾讯于 7 月 6 日正式发布 Hy3,API 已在 TokenHub 上线,并向全球多个 AI 网关平台逐步推出。Tencent Hy3 API 路由决策涉及三种推理模式,输入价格低于每百万 token 0.15 美元。

Z.ai 于 7 月 2 日正式发布 ZCode,这是基于 GLM-5.2 的免费 Agentic 开发环境。对路由团队而言,本次发布引入了独立的 coding endpoint、Anthropic/OpenAI 双协议通道、第三方 BYOK 渠道,以及 7 月 31 日截止的 1.5x 配额促销。

Claude 3.5 Haiku 已于昨日在 Vertex AI 停止服务。Claude 3 Opus 已于 6 月 30 日废弃,将于 8 月 1 日退出。若你的路由策略中包含这两个 Vertex AI 模型,现在要么已经报错,要么还有 26 天。

Claude Sonnet 5 不支持 Priority Tier,且 Priority Tier 已停止新购。依赖延迟 SLA 的团队面临路由抉择:在旧模型上保留 Priority Tier,还是以 standard tier 级 SLA 迁移至 Sonnet 5。

DeepSeek V4 将于 7 月中旬正式发布,首次引入高峰时段 API 价格翻倍的峰谷定价机制。每一个 AI 路由层现在都需要支持时区感知的成本计算和降级逻辑。

Claude Platform on AWS 通过 AWS 计费提供 Anthropic 托管的推理服务——完整支持 beta header、Agent Skills,以及独立容量池,开启全新的多平台故障转移策略。

2026 年 Gemini API 图像生成已进入两波迁移:6 月 25 日后 preview 图像模型会触发 failed to fetch 类故障,Imagen 4 GA endpoint 将于 8 月 17 日停服。现在应审计模型 ID,迁到 gemini-3.1-flash-image 或 gemini-3-pro-image,并测试 generateContent 调用链路。

7 月 23 日,OpenAI 将关闭 gpt-5-codex、o3-deep-research、computer-use-preview 等 14 个模型别名。若路由配置仍指向这些模型,请求将直接报错。本文列出完整的迁移清单。

Anthropic 6 月 30 日平台更新为 Claude Managed Agents 带来了动态的会话级配置覆盖、流式事件增量、生命周期 webhook 和 vault 凭证注入控制——重塑了团队在运行时路由模型和工具选择的方式。

Claude Science 多智能体工作台采用三层 agent 架构——协调器、领域专家和审阅器——其中蕴含的路由设计模式,可直接迁移到任何基于 Claude API 的生产级 agentic pipeline。

Claude Sonnet 5 以 $2/$10(每百万 token)的限时定价上线,截止 8 月 31 日后将回调至 $3/$15。该模型取代 Sonnet 4.6 成为 Anthropic 默认模型,并在 Sonnet 级定价下实现接近 Opus 的 agentic 性能。以下是路由团队的应对策略。

Claude Sonnet 5 带来三个生产级陷阱:adaptive thinking 默认开启、temperature/top_p/top_k 传非默认值将返回 400、新 tokenizer 导致 token 数量膨胀约 30%。这是 operator 迁移前的完整核查清单。

7 月 1 日起,美国对 Fable 5 的出口管制已解除,全球 API 访问今日恢复,AWS 和 Azure Foundry 的重新接入仍在推进中,但 7 月 7 日即将到来使用额度计费切换——以下是运营团队必须完成的检查清单。

Anthropic、Amazon、Microsoft 和 Google 正在联合制定一套四维越狱严重性评分标准。本文解读这一新框架对 API 网关层运营商 fallback 路由策略与安全治理的实际影响。

xAI 的 /goal 模式将开发者移出执行循环,但其双模型流水线引发了一个验证独立性问题——每个将 coding 工作负载路由至 Grok Build 的 operator 都必须理解这一点。

Claude 在 Microsoft Foundry 正式上线,推出双托管模式:Azure 内部推理或 Anthropic 托管推理,支持 CCU 计费、MACC 消耗承诺抵扣、Entra ID 认证和美国数据专区。

v2.1.196 的三项运营相关变更,重塑了企业部署中模型选择治理、流式可靠性和自定义端点安全的管理方式。

Anthropic 已从 Opus 4.6 静默移除 fast mode,并将于 7 月 24 日以硬错误方式从 Opus 4.7 下线。两种不同的故障模式,同一个 25 天窗口,必须立即处理。

Cursor 原生 iOS 应用引入了云端 Agent 的手机 Remote Control 功能,为 AI 运营团队和 routing 团队创造了一个需要主动治理的新审批层。

2026 年 7 月 1 日起,Gemini 3 及以上版本对非全球(区域)端点收取 10% 溢价。将流量路由至 eu-west1、asia-northeast1 等非全球位置的团队需立即审查成本模型。

Google 的语义治理策略引擎(SGP)现已在 Gemini 企业级 Agent 平台进入公开预览,它在模型与工具之间充当运行时拦截层,阻断偏离原始用户意图或违反自然语言业务约束的工具调用——无需重新部署 Agent 代码。

Anthropic 于 6 月 26 日将 Sonnet 和 Haiku 的 RPM、ITPM、OTPM 上限与 Opus 拉平,并将五个用量分层合并为三个。本文解析新 Start/Build/Scale 架构对回退路由策略和消费上限管理的实质影响。

Anthropic Mythos 5 routing 已向一批经美国政府批准的网络安全防御方和基础设施提供商恢复。Fable 5 仍处于暂停状态。以下是新访问模式对路由层的影响。

OpenAI 以三个独立层级发布了 GPT-5.6 预览版——Sol、Terra 和 Luna。对路由运营商而言,关键变化是 Terra:以 GPT-5.5 同等性能实现半价。以下是正式上线前更新路由策略的完整指南。

MiMo-V2.5-TTS 把语音生成推向 Agent 栈,工程团队需要为延迟、风格控制、同意、存储、降级和成本归因建立路由策略。

Tripo 3D DashScope routing 改变了 AI 团队处理文生 3D、图生 3D、多图资产、临时 GLB 结果和 fallback policy 的方式。

HappyHorse 1.1 video routing 改变了团队选择 DashScope 视频模型的方式,覆盖文生视频、图生视频、参考视频、编辑与降级路线。

OpenAI 的 Codex 工作研究说明:agent router 需要为长程任务设置策略通道,按时长、风险、部门预算和 fallback 连续性路由,而不是只增加席位。

OpenAI Patch the Planet Codex Security routing 把 AI 安全工作变成围绕已验证发现、补丁和 fallback policy 的受控修复通道。

Qwen-AgentWorld simulation routing policy 为团队提供 OpenAI-compatible 路径,在真实环境受影响前先测试 MCP、terminal、web 和 OS agent。

Qwen3.5-OCR DashScope routing 为文档 AI 团队带来 OpenAI 兼容路径、能力更完整的原生 SDK 路径,以及关于地域、Fallback 和治理的新策略问题。

Cursor 3.9 将插件、skill、MCP、子代理、规则和 hook 整合到单一 Customize 页面,支持用户、团队和工作区三级权限管理;团队市场现已支持从 GitLab、Bitbucket 和 Azure DevOps 导入插件仓库。

Google 已将 Agent Gateway 上的 Model Armor 升至正式可用(GA),将提示注入防御和内容扫描直接嵌入所有 agent 流量路径,无需修改任何 agent 代码。

三星电子正在将 Codex 部署至全球全体员工——这是 OpenAI 有史以来最大规模的企业级上线之一。以下是每个运营团队在达到这一规模之前必须具备的 routing 与治理架构。

OpenAI 与 Broadcom 联合发布 Jalapeño,OpenAI 首款自研 LLM 推理加速芯片。本文分析自主硅片对 API 容量、定价走势和多提供商路由决策的实际影响。

Codex 0.143.0 新增可配置的 rollout token 预算、per-thread 多智能体委托策略及 URL 白名单网页搜索——三项运营商自 Codex 进入多智能体时代后一直缺失的治理控制。

OpenAI 的 Codex-maxxing 白皮书描述了如何将 Codex 作为跨多小时会话的持久工作区运行。对于路由 operator 而言,真正的要点在于 context budget 管理、步骤验证门控,以及何时委托、何时监督。

Fable 5 于 6 月 18 日恢复上线,但新增了国籍访问管控、更严格的安全分类器和强制数据留存。今天是它免费包含在订阅计划中的最后一天——从 6 月 23 日起,使用 Fable 5 需要消耗用量积分,价格为 $10/M 输入和 $50/M 输出 token。

如何围绕 Codex CLI rate-limit-reset-credits、remote executors 与加密 Noise relays 设计 host、MCP、policy 和 billing routing。

Codex Record and Replay 会录制 macOS workflow 并生成可复用 skill。团队应按 approval、permissions、fallback recovery 和成本遥测治理每次 replay。

Cursor model routing 现在覆盖 /automate 创建的 Automations、Slack emoji triggers、GitHub review events 与 cloud-agent computer use。

DashScope 官网和 Qwen Code 文档把联网搜索拆成 Responses tools、Chat Completions enable_search、原生 DashScope 来源控制和百炼 WebSearch MCP。对比 DashScope 提供的搜索服务、Qwen API 路由、引用返回、地域覆盖和预算治理。

「我们正在暂停 Claude Agent SDK 使用量的变更」——Anthropic 在 6 月 15 日生效当天撤销了 Agent SDK 额度拆分。本次撤销对订阅池与 API key 路由决策的影响,以及如何为下一次计费变动做好准备。

Google 已于 2026 年 6 月 19 日起停止接受无限制 Gemini API Key 的请求。任何未配置显式 API 限制的 Key 现在会返回错误。以下是通过 gateway 路由 Gemini 流量的 operator 需要立即审查的凭据配置。

MiMo Code long-horizon coding agent routing 把小米开源终端 Agent 变成运营问题:gateway 应如何路由状态、记忆与 workflow 计算?

OpenAI Assistants API 已废弃并转向 Responses API。用这份 2026 官方迁移清单审计 beta threads/runs、Agent Builder 依赖、工具、路由代理和模型 fallback 策略。

阿里云百炼 DashScope 的 wan2.7-t2v 视频生成通过异步任务 API 接入:中国内地、国际和美国部署范围覆盖文生视频、图生视频、参考生视频等能力。接入前需完成地域选择、job ID 轮询和 fallback 路径决策。

xAI 的 grok-build-0.1 已通过 xAI API 公测开放——这是一款专为 agentic 编程场景构建的模型,定价 $1/$2 每百万 tokens,支持 256k 上下文、MCP 和并行 agent 架构。本文解析它在多 provider 路由决策中的定位。

Google 的 Gemini Enterprise 本周将 workflow agents 与可复用 skills 推进至 GA,两者均需申请 allowlist。本文梳理架构决策树,以及这对企业 AI 工程团队的路由规划意味着什么。

OpenAI 的 ChatGPT Enterprise 支出管控新增按模型额度上限、用户/团队覆盖规则和 Cost API 导出能力,给路由团队做 API 账单对账、fallback 与费用分摊提供了新信号。

Gemini Memory Bank(Agent Platform 记忆库)是 Google 为 AI Agent 提供的托管式持久记忆层,6 月 17 日正式 GA 并开放全球端点。本文详解 agent platform memory bank 的工作原理、Session 机制、CMEK 约束,以及有状态 Agent 路由策略。

Claude Code 2.1.179 修复了三个静默失败问题,专门影响通过自定义 API 网关路由的团队:claude agents workers 的 401 鉴权回归、compaction 忽略 fallback model 配置,以及连接中断时响应内容丢失。

Moonshot AI 的 Kimi K2.7 Code 将推理 token 用量降低 30%,并推出 180–260 TPS 的 HighSpeed 变体——两项变化迫使已将编程 Agent 流量路由到 Kimi 的团队做出具体的路由决策。

LiteLLM 工程团队提出了一个结构性转变:AI gateway 不再只是模型调用路由器,而正在演变为跨 Claude Managed Agents、Bedrock AgentCore 和 Vertex 的 agent 会话控制平面。本文解析这对你的路由架构意味着什么。

OpenAI 已弃用六个初代 gpt-5 和 o3 模型快照,全部将于2026年12月11日停止服务。仍在路由策略中使用带日期 model ID 的团队有六个月时间迁移——完整审查清单在此。

小米 MiMo V2 最后一批模型将于 6 月 18 日自动切换至 V2.5:mimo-v2-flash 和 mimo-v2-tts 沿用旧名但按 V2.5 计费,部分参数行为同步改变。路由配置未更新的团队将面临静默账单变化。

Anthropic 的 Agent SDK 计费拆分已于 6 月 15 日生效。新的按用户月度额度($20–$200,按计划分级)启用独立计量——但上限改变了每个生产 Agent 团队的路由决策。

Gemini CLI 将于 2026 年 6 月 18 日停止服务消费端请求。在默认迁移到 Antigravity CLI 之前,先搞清楚 unified-backend 模型对 provider 独立性意味着什么——以及 Claude Code 或 Codex CLI 的多 provider routing 如何改变这道选择题。

Cursor 的 Bugbot 官方文档与 6 月 changelog 指向 Composer 2.5、推送前 /review,以及曾名为 Background Agents 的 Cloud Agents。对 routing 运维来说,关键仍是 model block list:AI 代码评审需要显式治理。

面向 Cursor SDK 0.1.6 的 permissions.json autorun schema 实操:autoRun.allow_instructions、autoRun.block_instructions、local.autoReview、local.customTools、JsonlLocalAgentStore、requestId 与嵌套子 Agent 如何协同。

DeepSeek 官方 awesome-deepseek-agent 文档给出 Claude Code 的 ANTHROPIC_BASE_URL 设置、Anthropic-compatible API path、V4 Pro/Flash model IDs,以及 OpenCode/Copilot integration 的 coding-agent routing 注意事项。

OpenAI Partner Network 于 2026 年 6 月 14 日发布,包含 Select、Advanced、Elite 三级伙伴、1.5 亿美元生态投资和 Codex 专项认证。本文用架构图和清单拆解直接 OpenAI API key 与 SI 托管交付、委托凭据、配额归属和 fallback 控制。

Claude Fable 5 和 Mythos 5 已从 Anthropic API 返回 404。美国出口管制指令触发了 AI 行业首次无预警模型 API 强制下线事件,路由运营者必须在未来 24 小时内采取行动。

苹果 WWDC 2026 的 Foundation Models 更新将 on-device、Private Cloud Compute、Claude、Gemini 等 provider 统一到一个 Swift API 调用入口,并把 provider 选择从应用代码中抽离。对工程团队而言,这引入了一个新的 provider 路由层,需要主动理解和管理。

MiMo Code 是小米面向长程编程任务开源的 coding agent。本文解析 Max Mode、Goal verification、worker/judge 路由和 OpenAI-compatible 后端如何改变 API gateway 的成本与可靠性规划。

6月12日 Claude Code 更新为 VSCode /usage 对话框增加了按 skill、agent 和 MCP server 细分的成本归因能力,修复了 Bedrock GovCloud 推断配置文件前缀错误,并关闭了后台会话凭据泄漏问题。三项变更,同一运营主题:你现在可以看清——并控制——token 预算真正花在哪里。

Claude Fable 5 服务端 Fallback API 可在单次请求内处理 stop_reason 拒绝——无需自定义重试循环,无重复缓存成本。声明 fallback 模型、传递 credit token,通过 usage.iterations 判断实际服务模型。

Vertex AI 本身并未弃用,但 Google 将在 2026 年 6 月 30 日关闭所有 Imagen 2.x/3.x/4.x 和 Veo 2.x/3.0 GA 端点。用这份关停清单将图像和视频路由迁移到 gemini-2.5-flash-image 与 veo-3.1 端点。

Anthropic Bedrock Mantle 让 Amazon Bedrock 兼容 Claude Messages API,覆盖 SigV4 认证、SSE streaming、bedrock-2023-05-31 语义,以及 Claude Code 团队的路由取舍。

Anthropic 在 6 月 10 日的 Claude Code 更新中开放了最多五层子智能体嵌套。本文解析这对 agentic 编程工作流的模型路由、成本控制与治理意味着什么。

Anthropic 于 6 月 9 日发布 claude-fable-5,这是迄今面向公众开放的能力最强的 Claude 模型。以下是路由层需要关注的所有变化:新模型 ID、自适应思考强制开启、stop_reason refusal 新语义、fallbacks 参数,以及强制 30 天数据留存。

OpenAI Responses API 的 web_search 现在会随文字引用返回图片搜索结果。了解何时从 web_search_preview 迁移,以及如何路由需要视觉锚定的 workload。

DashScope 现推荐 qwen3.7-plus 作为 OpenClaw、Claude Code 与网关路由的均衡默认模型。切换前对比 qwen3.7-max、qwen3.7-plus、qwen3.6-flash 与 Responses API reasoning.effort。

微软 Build 2026 核心发布:Project Polaris——微软自研 MoE 编程模型——将于 2026 年 8 月替换 GitHub Copilot 中的 GPT-4 Turbo。Azure AI Foundry 支持模型目录扩展至 Anthropic、Cohere、DeepSeek、Mistral、xAI 等多厂商,统一计费,并通过 Azure Arc 支持私有化部署。

Qwen3Guard 是阿里巴巴的开源安全护栏模型系列:Qwen3Guard-Stream(实时逐 token 流式检测)与 Qwen3Guard-Gen(生成后审查),提供 8B、4B、0.6B 三种规格。两款模型均可部署在网关层,作为跨多 Provider AI 路由管道的 provider 无关内容过滤层。

Snowflake 现在是 Claude Fable 5 的推理提供商——采用 Bearer token 凭据模型、Snowflake 专属 base_url 和 SQL 原生 AI_COMPLETE 接口。以下是路由团队在将其纳入技术栈之前需要了解的内容。

小米 MiMo-V2.5-Pro-UltraSpeed 通过 FP4 量化与 DFlash 推测解码,在 1T 参数模型上实现每秒 1000+ token。API 接入窗口 6 月 9 日至 23 日,价格为基础版 3 倍。本文提供 Operator 路由成本-速度决策框架。

在 dashscope.aliyuncs.com 调用 wan2.7-image-pro 时,路由层不能只替换 base_url:北京/新加坡 API key 分区、非 OpenAI 兼容端点、4K 输出、负向提示词 fallback 和异步超时都要单独处理。

Anthropic Claude Opus 4.1 弃用将于 2026 年 8 月 5 日下线 claude-opus-4-1-20250805。路由团队应更新别名、审计 fallback 层级并避免 API 故障。

Kimi Agent Swarm GitHub 开源权重与 Kimi Code 工作流让 Kimi K2.6 open-source coding routing 成为 300 子代理选项。

谷歌每月9.2亿美元租用SpaceX GPU,说明Gemini算力并非无限。AI团队应重新评估供应商关联故障、2026年第四季度配额变化与多供应商备用路径。

Claude Code workload identity federation 配置步骤:连接 OIDC issuer、创建 Anthropic service account 与 federation rule,并在 CI/CD、gateway 和 agent runtime 中用短期 token 替换静态 sk-ant key。

OpenAI 现支持在 Responses API 单次调用中同时返回用户输入和模型输出的 moderation 评分。对多 provider 路由团队来说,这消除了独立安全检测的额外请求,并改变了网关层内容治理的设计方式。

Palo Alto Networks 完成了对 AI gateway 创业公司 Portkey 的收购,将其整合进 Prisma AIRS 作为企业级 LLM 流量控制平面。本文分析这对独立路由层团队的实际影响。

DashScope 是阿里巴巴云管理的 Qwen 模型 API 平台。qwen-image-2.0-pro 引入了不同于 DALL-E 的异步任务模式:提交请求 → 获取任务 ID → 轮询结果。标准 OpenAI 兼容代理将所有 DashScope 流量当作 Chat Completions 处理会静默失败或返回异常响应。

GitHub Copilot 6月1日正式切换令牌计费,真实账单已经来了——部分用户反映预计费用从此前的$39-$44固定月费飙升至$754-$847。这就是2026年5月定价变革在生产环境中的真实面貌,也是路由架构至关重要的原因。

Claude API 现在对未产生任何输出的 stop_reason=refusal 请求零计费;advisor 工具新增 max_tokens 参数可按调用限制 token 上限。本文给出运营商检查清单:更新计费仪表板以跳过零输出 refusal 费用、在路由配置中暴露 advisor max_tokens,并利用 stop_details.category 实现结构化拒绝分流。

Claude Code MCP timeout 与 WebFetch policy 在 6 月 3 日版本发生变化:显式 WebFetch deny 规则现在优先于预批准主机,sub-1000 ms MCP timeout 会回退到 MCP_TOOL_TIMEOUT/default,而不是触发 watchdog 故障。

OpenAI Codex CLI 0.137.0 推出多智能体 v2,支持每个生成的子智能体独立选择模型和 API provider。本文从路由网关运维角度解读这一变化对成本核算、provider 选择和治理策略的影响。

OpenAI evals platform 弃用、Agent Builder 关闭及 v1/prompts API 下线均定于 2026 年 11 月 30 日。本文梳理运营商需迁移的内容,以及 routing 层如何承接这一缺口。

OpenAI 现在会为非 ZDR 组织将符合条件的 GPT-5 提示缓存默认保留 24 小时。了解 GPT-5.5、prompt_cache_key 与网关路由选择如何影响 API 成本和数据策略。

Claude Partner Network Services Track 与 Partner Hub 正式定义 Select、Preferred、Global Premier 实施伙伴层级。本文解释 Claude partner hub 信号如何影响 API routing、fallback 策略与企业 Claude 部署。

微软在 Build 2026 发布了 MAI-Thinking-1 和 MAI-Code-1-Flash——首批自研推理与编程模型,现已通过 Azure Foundry 模型路由和 OpenRouter 上线,重塑了当前路由至 Claude Opus 或 GPT-4o 的团队在 provider 选型上的决策格局。

OpenAI Codex 现已推出面向分析师、营销人员、销售团队、设计师、投资者和银行家的六款角色专属插件,以及可将提示词直接部署为互动式 Web 应用的 Sites 功能。对路由团队而言,从单一开发者场景向多角色编程智能体的转变,将从根本上改变上下文预算、工具调用模式和上游模型需求。

OpenAI 容器会话现已对 Hosted Shell 与 Code Interpreter 采用按分钟计费,并设有 5 分钟最低收费。本文解释何时复用 container_reference、避免重复创建 container_auto 会话,以及如何按内存层级控制路由成本。

面向仍在使用 gpt-image-1、gpt-image-1.5、gpt-image-1-mini 或 chatgpt-image-latest 的团队:在 2026 年 Q4 API 停服前完成 OpenAI gpt-image-2 迁移的官方检查清单。

Anthropic 的 Project Glasswing 漏洞扫描已覆盖 150 家关键基础设施组织,Claude Security 成为基于 Opus 4.8 的正式产品。这对路由到 Claude 的团队意味着什么?

Amazon Bedrock 现在通过 AWS IAM 凭证、区域端点和 openai.gpt-5.5 等模型 ID 提供 OpenAI GPT-5.5、GPT-5.4 与 Codex。本文说明这对路由层、Codex 配置、fallback 策略和 OpenAI 兼容网关设计意味着什么。

Anthropic 于 6 月 1 日向 SEC 提交了机密 S-1 草案,正式启动 IPO 流程。对于将生产流量路由至 Claude 的 API 运营商而言,从私营到上市公司的转变,将重塑定价稳定性、SLA 责任机制与 BYOK 治理框架。

Anthropic 完成 650 亿美元 H 轮融资,估值 9650 亿美元,披露年化营收 470 亿美元及超过 15 GW 的算力承诺。对在生产环境路由 Claude 的团队来说,这直接影响 fallback 设计、provider 依赖评估和企业 SLA 置信度。

Anthropic 将于 2026 年 6 月 15 日正式停用 claude-sonnet-4-20250514 和 claude-opus-4-20250514。任何仍指向这两个 model ID 的 routing 配置将在两周后开始报错。

DashScope OpenAI Responses API 已在 compatible-mode/v1 上线,支持 Qwen3.7-max、qwen3.6-plus、qwen3-coder-plus 等模型。提供 previous_response_id 有状态上下文、内置网络搜索和代码解释器、reasoning.effort 推理深度控制,覆盖全球四个区域。路由团队需了解 provider 路由配置、有状态上下文 7 天 TTL 以及与 Chat Completions 的计费差异。

Kimi Agent Swarm 单次任务最多部署 100 个并行子 Agent。对于路由 Kimi API 或构建类似多 Agent 系统的团队,这彻底改变了并发、计费和限流的计算逻辑。

MiniMax M3 今日发布,成为首个同时具备前沿编程能力、百万 token 上下文与原生多模态的开权重模型。其双层计费机制与 thinking 模式切换,是工程团队现在就需要处理的路由决策。

Dynamic workflow 是什么?在 Claude Code 中,它是 JavaScript 编排脚本,可扇出数十到数百个子 agent,并改变 token accounting、rate limit、审批和 gateway 治理。

Claude Code v2.1.157 推出 settings.json agent 调度路由、.claude/skills 插件自动加载以及 OTEL 工具参数遥测——三项面向多 agent 编码流水线的运营级控制。

OpenAI 发布了关于可信第三方评测设计的详细指南。核心 operator 结论:harness 选择会改变测量到的模型能力,因此 benchmark 分数在用于路由分层决策之前必须结合上下文解读。

OpenAI 4 月 22 日弃用公告涵盖 25+ 个模型 ID,分两批硬关停:2026 年 7 月 23 日和 10 月 23 日。如果你的路由配置仍引用 gpt-4、gpt-3.5-turbo、o1、o3-mini 或 o4-mini,日历上已经有一个破坏性变更在等着你。

OpenAI Workload Identity Federation 让 CI/CD 流水线和 Coding Agent 用 OIDC token 换取短期 API key,无需存储长期凭证、无需手动轮换。Admin API 新增项目级模型白名单、邮件消费告警和细粒度账单明细。完整 Operator 配置清单见内文。

StepFun Step 3.7 Flash 于 5 月 29 日上线 DashScope,是一款支持可选思考模式的多模态 Flash 级模型。Operator 关键点:思考模式通过 extra_body 而非标准 OpenAI 参数开启——这一模式会让简单路由代理静默失效。

OpenAI 将 Codex Computer Use 扩展到 Windows,并加入跨设备操控与带 token 活动的 Codex Profiles。工程团队应重新检查 Windows SSH 主机、Codex entries 与多操作系统 agent 路由策略。

Anthropic 推出 Opus 4.8,新增 effort 控制参数、Messages API 中段 system 条目支持,以及价格降低 3 倍的 fast mode。每项变更都直接影响路由团队的模型选择、token 预算和成本策略配置。

OpenAI Frontier Governance Framework 提醒API运营商:EU AI Act执法前,需要供应商尽调、合规fallback策略和每请求模型审计记录。

一个匿名 OpenAI 推理模型自主证伪了一个存在 80 年的离散几何猜想。对运营团队而言,信号不在于数学本身,而在于「推理层」模型选择与路由策略的重新校准。

Gartner 首发企业级 AI 编码 Agent 魔力象限,正式将多模型 routing、governance 控制、沙箱执行和可审计性纳入企业采购标准。本文解析这些标准对 routing 层的实际影响。

Anthropic Glasswing 合作伙伴在一个月内用 Claude Mythos Preview 发现了超过 10,000 个高危漏洞。本文从路由与运营者视角解读这一 AI 安全新阶段对你的基础设施的实际影响。

OpenRouter 每周处理量已达 25 万亿 Token,半年增长 5 倍。这个数字意味着什么?对你的路由架构、provider 锁定风险和团队治理有什么直接影响?

Vertex AI 生成式 AI SDK 已弃用,模块将于 2026 年 6 月 24 日移除。如果你的团队通过 vertexai.generative_models 或相关 import 路由到 Google,以下是确保生产代码继续运行的迁移要点。

Anthropic 已确认 Claude Mythos Preview 位于 Opus 4.7 之上,但目前需通过 Waitlist 和网络安全审查才能获得访问权限。Mythos 层级对你的路由策略、从 Opus 4.6 的升级路径及回退阈值意味着什么。

阿里云百炼提供两套 API Endpoints:标准 dashscope.aliyuncs.com(sk- Key,按量计费)与独立 coding.dashscope.aliyuncs.com(sk-sp- Key,按请求次数配额)。将订阅 Key 通过网关透传会静默触发按量扣费,配额看板显示零消耗。

小米 MiMo-V2.5-Pro 已上线 DashScope,支持百万 token 上下文、OpenAI/Anthropic 双格式 API,在 Agent 基准测试中比 Kimi K2.6 节省 42% token。评估该模型是否适合你的路由策略——成本、上下文窗口配置与 DashScope 目录风险。

Qwen3.5-Omni 实时语音路由需要在 S2S 单模型与 ASR-LLM-TTS Pipeline 之间做出架构抉择。对比延迟、区域端点、fallback 策略与成本,帮你找到最优语音 AI 路由方案。

DeepSeek V4 Pro 的 75% 降价已确认永久生效,输出价格锁定 $0.87/M tokens。SWE-bench 80.6% 的成绩让 V4 Pro 成为主力推理模型而非备用选项——这意味着你的路由策略需要重新定价。

Gemini 2.0 Flash 与 Flash-Lite 已于 2026 年 6 月 1 日完成关停。本文说明哪些模型 ID 已被移除、哪些替代方案(gemini-2.5-flash-lite、gemini-3.1-flash-lite)真正可用、实际成本差距,以及如何最快速地审计可能仍引用已失效 endpoint 的 fallback 链。

Google I/O 2026 发布了 Antigravity 2.0、Gemini API 中的 Managed Agents,以及可通过单次 API 调用启动隔离 Linux 环境的 Interactions API。对于使用多 provider 路由的团队而言,影响远不止一次 CLI 更名。

OpenAI 与 Dell 联手,将 Codex 引入企业数据中心。当编码智能体可以在私有环境运行时,数据本地化、会话亲和性、成本核算与治理控制都需要重新设计——这是工程团队现在就该开始规划的架构问题。

面向企业团队的 Codex dispatch 网关清单:程序化访问 Token、Remote SSH、CI Agent 如何进入统一路由;如何覆盖 devbox 出口、拆分 Token 台账,并提前发现后台 Agent 成本。

Google 在 I/O 2026 发布的 Gemini 3.5 Flash 定价为每百万 token 输入 $1.50 / 输出 $9.00,是上一代 Flash 模型的 3-6 倍。这次定价重构,加上新推出的 Interactions API,意味着「Flash = 便宜备用」的路由逻辑已经失效。

DashScope(百炼)是阿里云面向 Qwen 系列模型的 OpenAI 兼容 API 平台。本文解释 DashScope 与 Qwen 的区别、API 工作方式、Qwen3.6-plus / Qwen3.6-flash 的当前版本信息,以及对路由配置的实际影响。

如何通过 api.deepseek.com/anthropic 使用 DeepSeek Anthropic API、Claude Code 与 Anthropic SDK;同时说明 unsupported fields、cache_control、MCP tools 和静默 fallback 到 deepseek-v4-flash 的路由风险。

阿里云 Qwen-MT turbo 通过 OpenAI 兼容接口提供,但翻译控制参数藏在 extra_body 中——这种模式会导致任何会剥离非标准字段的中间件悄然丢失关键配置。路由团队必须关注这个细节。

DeepSeek 官方 Claude Code、OpenCode 与 OpenClaw 集成指南 — API 配置、按层级 V4 模型路由、Anthropic 兼容端点设置,适用于编程智能体。

DeepSeek API 模型名称 2026 年变更:deepseek-chat 变为 deepseek-v4-flash,deepseek-reasoner 并入 deepseek-v4-flash(思考模式)或 deepseek-v4-pro(1M 上下文)。2026 年 7 月 24 日停用旧名称。新增 Anthropic 兼容端点 /anthropic 支持 Claude Code 直连路由。

美国可能引入 frontier AI 模型发布前审查,这不只是政策新闻,也会影响模型可用性、发布节奏、fallback 与企业治理证据。

Anthropic 将 Claude Code 限额翻倍并大幅提升 Opus API 速率限制,背后是 SpaceX Colossus 1 的 22 万张 GPU。了解降级触发、调度策略和多 provider 路由的变化。