
GLM-5.2 Fast 模式在百炼降价 20%:阿里的这步棋如何改变你的路由成本模型
阿里云百炼于 7 月 15 日下调了 GLM-5.2 Fast 模式的 token 单价,降幅 20%。对于通过 DashScope OpenAI 兼容端点路由成本敏感型工作负载的 operator,定价模型已经改变。

阿里云百炼于 7 月 15 日下调了 GLM-5.2 Fast 模式的 token 单价,降幅 20%。对于通过 DashScope OpenAI 兼容端点路由成本敏感型工作负载的 operator,定价模型已经改变。

xAI Priority Processing 为 Chat Completions 和 Responses 增加 service_tier=priority,让延迟成为逐请求的路由与计费决策。

Anthropic 6 月 11 日平台更新为 web_search_20260318 和 web_fetch_20260318 新增 response_inclusion 参数,允许运营者在多步骤 Agentic 工作流中丢弃已消费的搜索结果块,降低 API 输出 token 成本。

GitHub Copilot AI Credits 已于 2026 年 6 月正式切换,Premium Request Units 退出历史,Token 计费全面上线。配额耗尽后自动降级至低价模型的兜底机制已取消——Agentic 会话额度耗尽即停服,本文解读变化要点与应对建议。

Anthropic 官方 Claude Code 最佳实践指南(code.claude.com):上下文管理与上下文工程是路由团队的一级约束。上下文窗口填充快、性能随填满而下降,Agent 编程会话消耗 token 的速率是对话模式的 3-10 倍。子 Agent 隔离、CLAUDE.md 配置模型及会话级 token 治理直接适用于 API 路由。

DeepSeek V4 Pro 的 75% 降价已确认永久生效,输出价格锁定 $0.87/M tokens。SWE-bench 80.6% 的成绩让 V4 Pro 成为主力推理模型而非备用选项——这意味着你的路由策略需要重新定价。