
OpenAI API 密钥创建治理:服务账号专属模式如何堵上影子路由的漏洞
OpenAI 于 9 月 15 日推出组织级 API 密钥创建管控功能,管理员现在可以限制哪类密钥可以被创建——仅限服务账号、仅限项目密钥,或完全禁止创建。这是 OpenAI 首个从结构上阻止团队成员创建绕过网关路由策略的个人密钥的管控机制。

OpenAI 于 9 月 15 日推出组织级 API 密钥创建管控功能,管理员现在可以限制哪类密钥可以被创建——仅限服务账号、仅限项目密钥,或完全禁止创建。这是 OpenAI 首个从结构上阻止团队成员创建绕过网关路由策略的个人密钥的管控机制。

OpenAI 9 月 10 日更新允许管理员在组织或项目层面强制设置 Key 最大有效期。现有 Key 不会被追溯缩短,但策略生效后新建的每个 Key 都必须在限制范围内到期——而你的 API 网关很可能是全部 Key 中寿命最长、风险最高的那个。

OpenAI 的 Agents API 公测版引入了 client.beta.agents 这个独立命名空间,它根本不经过 /v1/chat/completions。对于通过 AI 网关路由流量的团队来说,这意味着账单盲区、缺失的审计记录,以及一个需要单独管理的 API key 权限范围。

Claude Code 2.1.239 开始在 /cost 和状态栏里把数据驻留工作区的 1.1 倍美国专属推理溢价算进去。通过 Bedrock 或 Vertex 路由的团队天然绕开这笔加价,对 provider 选择意味着实际的路由决策。

代理、API 网关或负载均衡器剥离响应 Content-Type 头部,导致 Claude Code 在每个 Bedrock 请求上以非流式模式重跑一次,等于每次对话付双倍费用。以下是如何判断是否受影响,以及 2.1.239 对网关运营者的其他修复。

Fable 5 生物分类器误报率下降约 85%。对 API 运营商来说,这次修复暴露了一个之前容易忽视的计费风险:你调用的是 Fable 5,回答你的有时是 Opus 5。以下是审计建议。

Claude Code gateway spend-limit support 把预算控制从事后的 API 失败,前移为带有上限名称、重置时间和运营说明的客户端提示。

OpenAI 于 8 月 4 日在用量与费用 API 中新增了 api_key 维度。对于在同一组织下运行多个 API Key 的路由团队而言,这填补了按路径费用归因的最大空白——无需再创建独立组织。

OpenAI 于 7 月 29 日发布官方 Terraform provider,支持以代码方式管理项目、服务账户、速率限制、模型控制与支出告警。本文提供适合路由层团队的拓扑设计模式。

Anthropic 7 月 24 日的 API 更新将 fallbacks: "default" 引入 Opus 5 和 Opus 4.8,同时将 Opus 4.7 的 speed: "fast" 升级为硬性 400 错误。本文梳理两项变更对路由策略的具体影响。

Claude Code 至少从 2026 年 2 月起,就将所有 Bedrock application-inference-profile ARN 流量归因为同一个模型 ID,导致 Haiku 和 Opus 的成本都显示为约 $0.23/次。2.1.218 版本修复了 ARN 解析逻辑——但你此前的网关成本日志是错的。

OpenAI 7 月 22 日的 API 更新新增了硬性月度消费上限,触发后将返回 429 insufficient_quota 错误。对于通过网关路由流量的团队而言,这是一种新的故障模式——标准重试逻辑对其处理方式存在根本缺陷,以下是审查清单。

OpenAI 发布了一套四维评估框架——「每美元有效智能(Useful Intelligence per Dollar)」,将模型评估从每 token 成本重构为每次成功任务成本。以下是每位路由运营者今天需要做出的改变。

阿里云百炼 Managed Agents API 将于 8 月 17 日开始商业计费。新的工作空间级 Agent 运行时引入了独立的 endpoint 命名空间和 SDK 版本门槛,每个使用 DashScope 的运维团队现在都必须审查。

OpenAI Python SDK v2.46.0 新增端点,支持为单个项目服务账号创建并列出作用域 API 密钥。对多项目 AI 路由团队而言,这一更新补上了迫使流水线使用全组织密钥的凭证蔓延漏洞。

Anthropic 现在要求在创建 API key 时就做出有效期决策。Admin API 已在每个 key 上暴露 expires_at 字段。若你的团队在生产环境中存在永不过期的 key,7 月 8 日的变更将重置你的凭证治理基准线。

Claude Code 2.1.211 修复了一个 prompt caching 计费回归问题,该问题会在每次请求时将末尾的系统上下文块静默计为新鲜 input token,影响 Bedrock、Vertex AI、Mantle 和 Foundry 四个平台。如果你的团队通过云厂商 gateway 路由 Claude Code,你可能有超额账单需要核查。

Google 于 7 月 1 日正式发布(GA)多个待处理 Provisioned Throughput 订单功能——你现在可以同时为同一模型和地区提交最多 7 个订单,彻底消除了过去每次等待 10 个工作日才能激活下一个订单的串行瓶颈。

Anthropic 的全新企业版模型权限功能允许管理员将特定 Claude 模型锁定到特定角色,并为每个角色设置 effort 级别上限,直接控制 token 消耗。本文梳理 AI 工程团队的配置要点。

Anthropic 6 月 30 日平台更新为 Claude Managed Agents 带来了动态的会话级配置覆盖、流式事件增量、生命周期 webhook 和 vault 凭证注入控制——重塑了团队在运行时路由模型和工具选择的方式。

Claude 在 Microsoft Foundry 正式上线,推出双托管模式:Azure 内部推理或 Anthropic 托管推理,支持 CCU 计费、MACC 消耗承诺抵扣、Entra ID 认证和美国数据专区。

Anthropic 已从 Opus 4.6 静默移除 fast mode,并将于 7 月 24 日以硬错误方式从 Opus 4.7 下线。两种不同的故障模式,同一个 25 天窗口,必须立即处理。

Anthropic 于 6 月 26 日将 Sonnet 和 Haiku 的 RPM、ITPM、OTPM 上限与 Opus 拉平,并将五个用量分层合并为三个。本文解析新 Start/Build/Scale 架构对回退路由策略和消费上限管理的实质影响。

Anthropic 首尔办公室及韩国企业规模化部署的背后,是一个全球 AI 团队都必须正视的路由架构约束:受监管行业无法直接调用 Claude API 满足本地数据合规要求,必须通过 AWS Bedrock 路由。

Codex 0.143.0 新增可配置的 rollout token 预算、per-thread 多智能体委托策略及 URL 白名单网页搜索——三项运营商自 Codex 进入多智能体时代后一直缺失的治理控制。

「我们正在暂停 Claude Agent SDK 使用量的变更」——Anthropic 在 6 月 15 日生效当天撤销了 Agent SDK 额度拆分。本次撤销对订阅池与 API key 路由决策的影响,以及如何为下一次计费变动做好准备。

OpenAI 的 ChatGPT Enterprise 支出管控新增按模型额度上限、用户/团队覆盖规则和 Cost API 导出能力,给路由团队做 API 账单对账、fallback 与费用分摊提供了新信号。

Anthropic 的 Agent SDK 计费拆分已于 6 月 15 日生效。新的按用户月度额度($20–$200,按计划分级)启用独立计量——但上限改变了每个生产 Agent 团队的路由决策。

Claude API 现在对未产生任何输出的 stop_reason=refusal 请求零计费;advisor 工具新增 max_tokens 参数可按调用限制 token 上限。本文给出运营商检查清单:更新计费仪表板以跳过零输出 refusal 费用、在路由配置中暴露 advisor max_tokens,并利用 stop_details.category 实现结构化拒绝分流。

Claude Code 6 月 2 日更新将 OTEL_RESOURCE_ATTRIBUTES 作为标签传播到每个指标数据点,无需网关侧自定义插桩即可在 Prometheus 层面实现按团队成本分配。

OpenAI 容器会话现已对 Hosted Shell 与 Code Interpreter 采用按分钟计费,并设有 5 分钟最低收费。本文解释何时复用 container_reference、避免重复创建 container_auto 会话,以及如何按内存层级控制路由成本。

OpenAI Workload Identity Federation 让 CI/CD 流水线和 Coding Agent 用 OIDC token 换取短期 API key,无需存储长期凭证、无需手动轮换。Admin API 新增项目级模型白名单、邮件消费告警和细粒度账单明细。完整 Operator 配置清单见内文。

OpenRouter 每周处理量已达 25 万亿 Token,半年增长 5 倍。这个数字意味着什么?对你的路由架构、provider 锁定风险和团队治理有什么直接影响?

阿里云百炼提供两套 API Endpoints:标准 dashscope.aliyuncs.com(sk- Key,按量计费)与独立 coding.dashscope.aliyuncs.com(sk-sp- Key,按请求次数配额)。将订阅 Key 通过网关透传会静默触发按量扣费,配额看板显示零消耗。

GitHub Copilot AI Credits 已于 2026 年 6 月正式切换,Premium Request Units 退出历史,Token 计费全面上线。配额耗尽后自动降级至低价模型的兜底机制已取消——Agentic 会话额度耗尽即停服,本文解读变化要点与应对建议。