保持更新

AI 路由新闻与供应商动态

模型下线、供应商价格调整、API 迁移与 AI 基础设施动态 — TheRouter 精选整理,助你提前优化路由决策。

RSS 订阅
TheRouter v2.0 统一异步媒体平台发布图
精选

TheRouter v2.0:统一异步媒体平台,覆盖图片 / 音频 / 视频

TheRouter v2.0 推出贯穿图像、音频、视频生成的统一异步模式。长任务从 请求线程迁移到基于 Job 的流程,产物落 S3 + 通过统一的 /v1/jobs/:id 查询 — 杜绝 CDN 超时带来的计费纠纷,同时同步接口零变更。

来源 TheRouter

2026 年 9 月

编辑风格插图,展示分叉的 API 路由路径,其中标有 agents sessions 的分支偏离主网关,背景为低饱和深色调

OpenAI Agents API 公测:网关运营商需要正视的新绕道路径

OpenAI 的 Agents API 公测版引入了 client.beta.agents 这个独立命名空间,它根本不经过 /v1/chat/completions。对于通过 AI 网关路由流量的团队来说,这意味着账单盲区、缺失的审计记录,以及一个需要单独管理的 API key 权限范围。

来源 OpenAI
示意图:agent YAML 文件经过 ant apply 流向 claude-lock.json 锁文件,带有 CI 流水线箭头

ant apply 把 Claude Agent 纳入 GitOps:Gateway 运营者需要跟踪什么

Anthropic 的 ant CLI v1.30.0 发布了 ant apply,一个类似 Terraform 的声明式工作流,把 agent 配置、环境、技能和定时部署从仓库文件同步到 Claude API。对于通过 gateway 路由流量的团队来说,agent 文件里的 model 字段现在决定了调用哪个 Claude 版本,而 claude-lock.json 就是记录这个决定的地方。

来源 Anthropic Platform

2026 年 8 月

2026 年 7 月

展示 AI 模型成本与速度梯度的分层路由架构抽象插图

GPT-5.6 Luna 降价 80%:重置路由层级决策的定价级联

OpenAI 在 7 月 30 日将 GPT-5.6 Luna 降价 80%、Terra 降价 20%,同时将 Priority Processing 更名为 Fast mode。Luna 在每百万 token 0.20/1.20 美元的价格下,现在直接与 DeepSeek V4 Flash 和 Qwen 模型竞争。以下是每位运营者必须重新计算的路由层级成本。

来源 OpenAI
编辑风格图示:三个运维治理控制项——网络策略、subagent 深度、工作流规模——作为独立配置门控,呈现于简洁的路由架构示意图中

Claude Code 2.1.219:运维团队在部署前必须审查的三项治理变更

2.1.219 引入了 sandbox.network.strictAllowlist,将嵌套 subagent 深度上限从 1 提升至 3,并将动态工作流默认为中等规模(最多 15 个 agent)——三项变更均不需要任何代码改动即可生效,且会悄然改变生产环境的安全边界、成本敞口和 agent 编排策略。

来源 Anthropic Claude Code

2026 年 6 月

编辑风格图形,展示将大型代码工程注入单个 1M token 上下文窗口的过程,带有 routing 分支指示符

GLM-5.2 OpenRouter 接入指南:TPS 基准、定价对比与 Coding Agent Routing 配置

GLM-5.2 已在 OpenRouter(z-ai/glm-5.2)及其他 12 家服务商上线。Artificial Analysis 实测最快输出速度达 266 t/s(Baseten),最低价格 $0.72/1M tokens(GMI FP8)。凭借经验证的 Solid 1M token 无损上下文与 128K 最大输出,GLM-5.2 在 FrontierSWE 上与 Claude Opus 4.8 差距仅 1%,是长程 coding agent routing 的顶级开放权重选项。

来源 Zhipu AI / BigModel
路由图示:左侧为模型调用,右侧为多 runtime 的 agent 会话,通过统一的 gateway 控制平面连接

AI Gateway 正在升维:从模型路由到 Agent 会话路由

LiteLLM 工程团队提出了一个结构性转变:AI gateway 不再只是模型调用路由器,而正在演变为跨 Claude Managed Agents、Bedrock AgentCore 和 Vertex 的 agent 会话控制平面。本文解析这对你的路由架构意味着什么。

来源 LiteLLM Engineering
企业 API 路由架构示意图,对比直接 OpenAI API 路径与 SI 托管合作伙伴网络交付路径,叠加三级架构概览

OpenAI Partner Network:企业 API 路由架构图

OpenAI Partner Network 于 2026 年 6 月 14 日发布,包含 Select、Advanced、Elite 三级伙伴、1.5 亿美元生态投资和 Codex 专项认证。本文用架构图和清单拆解直接 OpenAI API key 与 SI 托管交付、委托凭据、配额归属和 fallback 控制。

来源 OpenAI
编辑风格示意图,展示 Claude Code 用量归因流按 skill、agent 和 MCP 维度分支,经由 routing 层流出

Claude Code 在 VSCode 中按 Skill、Agent、MCP Server 细分用量成本——企业运维团队需要了解的三项变化

6月12日 Claude Code 更新为 VSCode /usage 对话框增加了按 skill、agent 和 MCP server 细分的成本归因能力,修复了 Bedrock GovCloud 推断配置文件前缀错误,并关闭了后台会话凭据泄漏问题。三项变更,同一运营主题:你现在可以看清——并控制——token 预算真正花在哪里。

来源 Anthropic (Claude Code Releases)
抽象路由图,展示 Qwen 图像生成端点与网关层之间的异步媒体任务流

DashScope 如何运作:Qwen-Image-2.0 API、异步任务与图像路由解析

DashScope 是阿里巴巴云管理的 Qwen 模型 API 平台。qwen-image-2.0-pro 引入了不同于 DALL-E 的异步任务模式:提交请求 → 获取任务 ID → 轮询结果。标准 OpenAI 兼容代理将所有 DashScope 流量当作 Chat Completions 处理会静默失败或返回异常响应。

来源 Qwen Blog
图表显示不同分词器和使用模式下,AI模型标价与实际计费成本之间的差距

2026年AI成本上涨:GitHub Copilot账单冲击印证路由的价值

GitHub Copilot 6月1日正式切换令牌计费,真实账单已经来了——部分用户反映预计费用从此前的$39-$44固定月费飙升至$754-$847。这就是2026年5月定价变革在生产环境中的真实面貌,也是路由架构至关重要的原因。

来源 FairMind / OpenRouter 数据
抽象编辑风格插图,展示一个路由分叉点,多条标注路径从单一起点向外延伸

Codex 扩展至所有角色:六款角色插件、Sites 功能与 500 万周活跃用户对 AI 路由架构的意义

OpenAI Codex 现已推出面向分析师、营销人员、销售团队、设计师、投资者和银行家的六款角色专属插件,以及可将提示词直接部署为互动式 Web 应用的 Sites 功能。对路由团队而言,从单一开发者场景向多角色编程智能体的转变,将从根本上改变上下文预算、工具调用模式和上游模型需求。

来源 OpenAI
“抽象编辑风格插图,展示两条路径汇聚的路由分叉,代表 OpenAI Responses API 与 DashScope Qwen 端点之间的 API 兼容性”

DashScope OpenAI Responses API — compatible-mode/v1 现已支持 Qwen 有状态上下文和内置工具

DashScope OpenAI Responses API 已在 compatible-mode/v1 上线,支持 Qwen3.7-max、qwen3.6-plus、qwen3-coder-plus 等模型。提供 previous_response_id 有状态上下文、内置网络搜索和代码解释器、reasoning.effort 推理深度控制,覆盖全球四个区域。路由团队需了解 provider 路由配置、有状态上下文 7 天 TTL 以及与 Chat Completions 的计费差异。

来源 “阿里云百炼”

2026 年 5 月

抽象编辑风格图示,展示跨并行编程 Agent 会话的上下文窗口预算消耗,包含路由检查点和成本信号

Claude Code 最佳实践:上下文管理与上下文工程——Anthropic 官方指南

Anthropic 官方 Claude Code 最佳实践指南(code.claude.com):上下文管理与上下文工程是路由团队的一级约束。上下文窗口填充快、性能随填满而下降,Agent 编程会话消耗 token 的速率是对话模式的 3-10 倍。子 Agent 隔离、CLAUDE.md 配置模型及会话级 token 治理直接适用于 API 路由。

来源 Anthropic / Claude Code Docs

2026 年 4 月

帮助与联系