Claude Haiku 在 Vertex AI 下线:Haiku 已停服,Opus 倒计时 26 天——立即审计你的 Partner Model 路由
Claude 3.5 Haiku 已于昨日在 Vertex AI 停止服务。Claude 3 Opus 已于 6 月 30 日废弃,将于 8 月 1 日退出。若你的路由策略中包含这两个 Vertex AI 模型,现在要么已经报错,要么还有 26 天。
归档条目:由 AI 根据所引信源辅助生成,发布时未经逐篇审阅。责任编辑:Joe Werner。

Vertex AI 昨日悄然关闭了一扇门,还有另一扇将在 26 天后关上。Claude 3.5 Haiku 于 2026 年 7 月 5 日到达 shutdown 节点——调用该 model ID 的请求现在已经返回错误。Claude 3 Opus 于 6 月 30 日进入废弃状态,将于 8 月 1 日正式退出。如果你的路由配置仍然指向这两个模型,决定早已替你做好了。
真正的运营挑战不只是"改一个 model ID"。Vertex AI 的 partner model 废弃周期与直连 Anthropic API 的废弃周期走在不同的时钟上——同时接入两条路径的团队,很可能在一条链路完成迁移后,忽视了另一条链路仍在倒计时。
发生了什么
Google 的 Vertex AI(现已更名为 Gemini Enterprise Agent Platform)以 managed API 形式托管 Anthropic Claude 模型,采用独立于 api.anthropic.com 的废弃时间表。
当前 Vertex AI 上的状态如下:
- Claude 3.5 Haiku — 2026 年 1 月 5 日废弃,2026 年 7 月 5 日停服。当前对该 model ID 的请求均会返回错误。
- Claude 3 Opus — 2026 年 6 月 30 日废弃,停服日期:2026 年 8 月 1 日。还剩 26 天。
- Claude Sonnet 5 — 可用,最早退休时间不早于 2026 年 12 月 24 日。
- Claude Fable 5 — 可用,最早退休时间不早于 2027 年 6 月 8 日。
对比参考:在直连 Anthropic API 上,Claude Haiku 3.5 早在 2026 年 2 月 19 日就已退役——比 Vertex AI 停服时间早了将近五个月。只看 Anthropic 文档看到"已退役"的团队,可能误以为 Vertex AI 同步下线。实际并非如此。
为什么这对工程团队很重要
双轨废弃是运营陷阱。 Anthropic 和 Google 各自发布独立的废弃时间表。在 api.anthropic.com 上退役的模型,可能仍在 Vertex AI 上存活,反之亦然。如果你的监控、fallback 逻辑或硬编码 model ID 只跟踪一个 provider 的文档,你就会漏掉另一条轨道。
对于通过 Vertex AI 接入 Claude 的团队——使用 Google Cloud 凭证、VPC Service Controls 或 provisioned throughput——这带来了直接的风险敞口:
- Haiku(已停服):任何指向 Vertex AI 上
claude-3-5-haiku@20241022的工作负载,现在都在返回 HTTP 错误。如果没有 fallback 也没有 model 级别 4xx 监控告警,这种失败可能沉默数小时。 - Opus(26 天):Vertex AI 上的 Claude 3 Opus 将于 8 月 1 日退出。直连 API 上的 Opus 已于 6 月 15 日随 Claude 4 一起退役。完成直连 API 迁移的团队,可能留了 Vertex 侧的 Opus 路由没有处理。
这还涉及计费问题:为 Vertex AI partner model 购买的 provisioned throughput 不会自动迁移到新模型,废弃模型的预留槽位可能在官方 shutdown 日期之前就停止计费。
Router/Operator 视角
8 月 1 日之前,每个路由团队必须做出三个决策:
1. 盘查 Vertex AI 上的 model ID。 拉取当前生效的路由配置,筛查所有指向 Vertex AI endpoint 且包含 claude-3-5-haiku*、claude-3-opus* 或其他 claude-3-* 标识符的条目。不要用"流量为零"来证明某条路由未被使用——低频 fallback 路由最容易被遗漏。
2. 梳理 Vertex-to-Anthropic ID 映射。 Vertex AI 上的 model ID 格式为 claude-sonnet-5@*、claude-fable-5@* 等;直连 Anthropic API 使用 claude-sonnet-5、claude-fable-5。如果你的路由层做了跨 provider 的 ID 归一化,务必确认映射是最新的。曾经指向 Haiku 或 Opus 的别名现在需要指向 Sonnet 5 或 Fable 5。
3. 配置 provider-aware fallback。 某个 provider 下线一个模型,不代表该模型在其他地方也消失了。如果你因合规要求(VPC Service Controls、数据驻留)只能走 Vertex AI,而目标模型已不可用,fallback 应路由到另一个 Vertex AI 上存活的 Claude 模型——而不是直连 Anthropic API(后者可能不满足同样的合规约束)。
需要持续关注的点
- Vertex AI 上的 Claude 3 Opus 于 8 月 1 日退出。 这是最近的截止日期。
- Vertex AI partner model 页面(
cloud.google.com/vertex-ai/generative-ai/docs/partner-models/use-claude)目前只列出 Claude Sonnet 5 和 Claude Fable 5 两个可用模型。以此页面作为当前存活模型的权威依据。 - Provisioned throughput 用户:联系你的 Google Cloud 账号经理,确认废弃模型的预留吞吐量容量的处理方式。
- 在 AWS Bedrock 上,Claude 3 Opus 遵循又一套独立的时间表——请单独核查 Bedrock 的 partner model 废弃文档。
如果你通过多个 provider 路由 Claude 工作负载,现在是建立定期检查机制的时候了:对比当前路由表与各 provider 实时模型目录,找出已不存在的 model ID。路由到一个不再存在的 model ID 不会优雅地降级——它会立即报错。
相关阅读
AI 路由新闻与供应商动态 →
Fable 5.1 的缓存读取降价和 effort 参数,每个 gateway 运营者都得重新算一遍账
claude-fable-5-1 的 prompt cache 读取费用降至 $0.25/MTok,是其他 Claude 模型 0.1× 标准费率的四分之一。output_config.effort 参数让运营者在每次请求时调节思考深度与 token 消耗。本文拆解这两项变化对计费、路由和升级决策的实际影响。

deepseek-chat 将于 7 月 24 日停用:本周每个 AI 网关运营者必须完成的路由审计清单
deepseek-chat 和 deepseek-reasoner 将在北京时间 7 月 24 日 23:59 停止响应。还剩 7 天,本文提供每个 AI 网关运营者在截止日期前必须完成的路由审计清单。

Anthropic Bedrock Mantle:AWS 上的 Claude Messages API 路由
Anthropic Bedrock Mantle 让 Amazon Bedrock 兼容 Claude Messages API,覆盖 SigV4 认证、SSE streaming、bedrock-2023-05-31 语义,以及 Claude Code 团队的路由取舍。