
DeepSeek V4 Pro 熬过了自己的死亡日期,这次反转对路由策略意味着什么
DeepSeek 在9月10日宣布 V4 Pro 将于今天 04:00 UTC 停服,结果食言了。他们以「用户需求」为由保留了 V4 Pro,价格不变。本文梳理两个模型当前的实际参数差异,以及路由团队现在需要做的决策。

DeepSeek 在9月10日宣布 V4 Pro 将于今天 04:00 UTC 停服,结果食言了。他们以「用户需求」为由保留了 V4 Pro,价格不变。本文梳理两个模型当前的实际参数差异,以及路由团队现在需要做的决策。

DeepSeek V4.1-Flash 今日上线,新 API 名 `deepseek-flash`,原生支持图像输入。9 月 14 日 12:00 起,所有 deepseek-v4-pro 请求静默切换至 V4.1-Flash 并按 Flash 定价计费。本文拆解能力差异、定价变化与截止日期前需要确认的配置。

DeepSeek 的 V4-Pro 别名刚刚升级到新的 GA 模型,agent 基准显著提高,峰谷定价将在 8 月 16 日生效。生产 routing 团队的成本计算方式已经变了。

OpenAI Ultrafast mode routing 给 GPT-5.6 Sol 增加了一个最高 14 倍于 Standard 的限量预览层,网关运营者需要把低延迟流量和成本敏感的 fallback 流量拆开。

Google Cloud API Gateway model routing 已进入 Public Preview。它用 OpenAPI 规格承载 serverless 路由,可转发 Gemini、Claude 和 OpenAI 请求,前提是所有后端都在 Vertex AI。

Anthropic 7 月 24 日的 API 更新将 fallbacks: "default" 引入 Opus 5 和 Opus 4.8,同时将 Opus 4.7 的 speed: "fast" 升级为硬性 400 错误。本文梳理两项变更对路由策略的具体影响。

Anthropic 昨日发布 claude-opus-5,adaptive thinking 默认开启——这意味着即使你的应用从未收到 thinking 内容,thinking token 也会按 output token 计费。以下是从 Claude API、Bedrock 到 Vertex 的路由策略更新指南。

Cohere 推出 North Mini Code——一个仅激活 3B 参数的 30B MoE 模型,支持 API、托管云及自部署三种模式。本文梳理 operator 路由决策框架。

Anthropic 的 Dreams API 不再强制使用 Opus 4.8 进行 agent 记忆整合。Fable 5 和 Sonnet 5 现已支持,为每个运行异步记忆任务的团队提供了真正的模型层级路由选择。

xAI Grok 4.3 model routing 把新的旗舰 alias、1M context、cached-input pricing 与区域可用性变成 AI gateway 策略决策。

GLM-5.2 已在 OpenRouter(z-ai/glm-5.2)及其他 12 家服务商上线。Artificial Analysis 实测最快输出速度达 266 t/s(Baseten),最低价格 $0.72/1M tokens(GMI FP8)。凭借经验证的 Solid 1M token 无损上下文与 128K 最大输出,GLM-5.2 在 FrontierSWE 上与 Claude Opus 4.8 差距仅 1%,是长程 coding agent routing 的顶级开放权重选项。

Datadog 2026 年 AI 工程现状报告显示,超过 70% 的企业在生产环境中同时运行三个或以上的 AI 模型。这份来自千余家真实客户的遥测数据,揭示了多模型 AI 路由生产化的核心挑战与应对思路。

Moonshot AI 于 6 月 12 日发布 Kimi K2.7 Code。Kimi K2.7 Code API 强制启用思考模式——禁用它会直接返回 API 错误——这一设计改变了使用 Coding Agent 团队的成本建模、路由策略与 fallback 逻辑。

Claude Code v2.1.175 新增 enforceAvailableModels 托管配置项:启用后,availableModels 白名单同样约束 Default 模型的解析结果,且项目或用户级配置无法扩展白名单。对于通过审批模型列表进行路由的企业团队,这关闭了一个长期存在的隐性绕过路径。

Anthropic 推出 code_execution_20260521,将 90 秒每格墙钟限制写入工具描述,使 Claude 可提前规划长耗时格,超时返回 detection_timeout。Operator 需更新重试逻辑、格拆分策略及 Haiku 4.5 路由路径。

Claude Code v2.1.166 将 fallbackModel 升级为支持最多三个有序 fallback 模型的配置,覆盖交互式 session,并加固多 agent 信任机制:通过 SendMessage 转发的消息不再携带用户权限。

智谱 AI 的 GLM-5.1-highspeed 基于 TileRT 推理引擎实现每秒 400 tokens 的稳定输出,同等旗舰能力下吞吐量大幅提升,直接重塑实时 agent 和编程工作流的 provider routing 决策。

MiniMax 最新旗舰模型同时支持 OpenAI 和 Anthropic 两种 API 格式,SWE-Pro 评分接近 Claude Opus,定价仅 $0.30/$1.20 每百万 token,为 agent 工作负载带来全新成本-性能路由选择。

Kimi K2.6 API 定价为缓存命中输入 ¥1.10、缓存未命中输入 ¥6.50、输出 ¥27 / 1M tokens,并提供 KVV 验证、256K 上下文和 OpenAI 兼容路由,适合 coding agent 评估。