← 全部文章

LLM API 费用治理:跨供应商的支出限额、预算告警与用量管控指南

一份实操指南,覆盖 OpenAI、Anthropic、DashScope、DeepSeek 四大平台的费用上限、预算告警和用量管控配置方法——速率限制无法替代的计费控制面。

· TheRouter

为什么速率限制不等于费用治理

速率限制(RPM、TPM、RPS)控制的是 吞吐量,用来防止流量突增冲垮基础设施。但它不会限制你的月度账单金额。

一个以 50% 速率限制运行、7×24 小时不间断的服务,仍然可能产生五位数的账单。我们见过不少团队吃过这个亏:应用全月都在速率限制之内运行,但没人设置过费用上限,最终账单是预期的 3 倍。

费用治理是计费控制面:支出上限、预算告警、用量看板和项目级隔离。目前主流 LLM API 供应商都提供了某种形式的费用治理能力,但功能成熟度、执行行为和细粒度差异显著。

本指南覆盖各供应商的现有能力,以及上生产前如何配置。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

OpenAI:硬性费用上限与预算告警

OpenAI 的费用治理在主流供应商中最为成熟,支持 组织级 和 项目级 两层管控。

费用告警

费用告警是通知类控制。当累计支出超过设定阈值时发送邮件通知,但 API 流量不受影响。可以设置多级告警阈值(如预算的 50%、75%、90%)实现预警。

硬性费用上限

硬性费用上限是强制执行类控制。当累计支出达到上限时,所有受影响的 API 请求返回 429 错误,错误码为 organization_spend_limit_exceeded 或 project_spend_limit_exceeded。

关键行为:

  • 组织级上限 覆盖所有项目。触发后整个组织的 API 流量全部阻断。
  • 项目级上限 仅影响该项目。其他项目正常运行。
  • 执行不是瞬时的。 上限生效传播期间,平台可能处理少量额外用量,实际支出可能略超配置值。
  • 按月重置。 也可以随时调高或移除上限,立即恢复流量。

配置方法

  1. 进入 Organization limits。
  2. 在 Spend 区域点击 Edit spend limit。
  3. 输入 Monthly spend limit。
  4. 开启 Enforce a hard limit 使其成为强制上限。
  5. 保存。

项目级上限在 Project settings → Limits → Spend 下同样操作。

用量分级

OpenAI 还根据使用分级为每个组织分配 批准的月度用量上限(Free 到 Tier 5),这与你自行配置的费用上限是独立的:

分级达标条件用量上限
Free允许地区$100/月
Tier 1已付 $5$100/月
Tier 2已付 $50$500/月
Tier 3已付 $100$1,000/月
Tier 4已付 $250$5,000/月
Tier 5已付 $1,000$200,000/月

如需超出分级上限,可通过平台申请提额。

来源: OpenAI Spend Limits 文档,检索于 2026-08-06。

Anthropic:工作空间级计费上限

Anthropic 的费用治理以 组织级月度费用上限 为核心。

费用上限

费用上限在 Settings → Billing 中设置,定义组织 API 用量的月度最高费用。达到上限后,API 请求返回速率限制错误,直至下一个计费周期或上限被调高。

关键特征:

  • 组织级执行。 费用上限覆盖组织下所有 API key 和工作空间。
  • 标准计划无项目级粒度(截至 2026 年 8 月)。企业客户可协商工作空间级管控。
  • 企业版功能 包括审计日志、Compliance API、数据保留控制以及更细粒度的团队级费用管控。

企业费用管控

Claude Enterprise 客户可获得以下额外治理能力:

  • 通过 Admin API 实现 按用户和团队的费用跟踪。
  • 工作负载身份联合 用于认证治理——控制哪些服务可以使用哪些 API key。
  • 与安全平台集成的 审计日志(如 CrowdStrike Falcon)。
  • 带费用看板和用量分析的 管理控制台。

配置方法

  1. 登录 Anthropic Console。
  2. 进入 Settings → Billing。
  3. 设置月度费用上限。
  4. 按需配置告警阈值。

来源: Anthropic Rate Limits 文档,检索于 2026-08-06;Claude Enterprise 功能,检索于 2026-08-06。

DashScope(阿里云):配额管理与费用告警

DashScope 的做法有所不同:速率限制是主要的吞吐量控制手段,费用治理通过阿里云的计费基础设施来实现。

速率限制作为第一道防线

DashScope 的速率限制在 阿里云账号级别 执行,聚合账号下所有 RAM 用户、工作空间和 API key 的用量。每个模型有独立的 RPM/TPM 限制。与 OpenAI 不同,DashScope 没有自助配置的"硬性费用上限"(即达到金额后返回 429)。

费用管控手段

DashScope 提供以下费用管理机制:

  • 费用上限与费用告警: 在控制台的账单卡片上配置费用告警,设置月度阈值。达到阈值时收到通知。
  • 免费额度耗尽自动停止: 对于有免费额度的模型,启用"免费额度用完后停止调用"功能,防止自动转为付费用量。
  • 用量监控: 在 监控页面 查看每个模型的 token 用量(数据每小时更新)。
  • 临时速率限制提升: 如默认限制不够用,可在控制台申请临时提升模型的 TPM 配额,立即生效,有效期 30 天。

配置方法

  1. 登录 百炼控制台。
  2. 进入 账单 卡片。
  3. 配置 费用告警 及月度阈值。
  4. 对有免费额度的模型启用自动停止功能。
  5. 如需临时提升速率限制,前往 提升速率限制 页面按模型提交申请。

来源: DashScope 速率限制文档,检索于 2026-08-06。

DeepSeek:余额监控与速率分级

DeepSeek 的费用治理在四家供应商中最为简化,没有类似 OpenAI 的自助硬性费用上限或预算告警系统。

现有能力

  • 预付余额模式。 DeepSeek 采用预充值体系,API 调用从余额中扣减,余额耗尽后调用失败——相当于天然的硬性上限。
  • 速率限制分级。 DeepSeek 有分级的速率限制,间接约束吞吐量和费用。高用量用户可申请提升限额。
  • 非高峰折扣。 DeepSeek 在非高峰时段提供折扣定价,可作为费用优化手段,但不属于治理范畴。
  • 用量看板。 平台控制台提供基本的用量统计。

配置方法

  1. 在 DeepSeek 平台 充值余额。
  2. 通过看板监控余额和用量。
  3. 如需更高速率限制,联系 DeepSeek 支持团队。

来源: DeepSeek 定价文档,检索于 2026-08-06。

跨供应商对比矩阵

能力OpenAIAnthropicDashScopeDeepSeek
硬性费用上限支持(组织+项目)支持(组织级)不支持(仅告警)不支持(余额=隐式上限)
预算告警支持(多级阈值)支持支持不支持
项目级隔离支持仅企业版按工作空间不支持
执行行为429 错误码速率限制错误不适用余额为零时失败
粒度组织+项目组织账号级账号级
自助配置支持(控制台)支持(控制台)支持(控制台)仅充值
用量看板支持(实时)支持支持(延迟约 1 小时)基本
审计日志通过 API仅企业版阿里云日志不支持

决策矩阵:哪种治理需求选哪家

选 OpenAI 适合需要最细粒度费用管控的场景:项目级硬性上限、多级告警、RBAC 控制的限额管理。429 响应中的特定错误码(organization_spend_limit_exceeded 与 project_spend_limit_exceeded)便于编写程序化响应逻辑。

选 Anthropic 适合需要企业级治理的场景:审计日志、Compliance API、工作负载身份联合——但标准计划只有组织级上限,没有项目级隔离。

选 DashScope 适合主要在中国运营或需要 Qwen 模型的场景。费用治理依赖阿里云的计费基础设施,功能完善但运作方式与 API 原生的费用上限不同。临时速率限制提升功能是其独有特色,适合突发工作负载。

选 DeepSeek 适合追求最简模式的场景:预付余额、按量付费、不会出现意外账单。代价是治理工具极少——没有告警、没有项目隔离、没有程序化费用管控。

通过路由层实现集中费用可视化

当你同时使用多个供应商时(大多数生产部署都是如此),各供应商独立的治理机制会造成可视化盲区。你需要查看四个看板、对账四个计费周期,还得祈祷没人忘记给新项目设上限。

我们构建 TheRouter 来解决这个问题。我们的路由层将 OpenAI 兼容 请求路由到配置的供应商,并提供已实现的统一计费面板。这意味着:

  • 一个看板 展示所有供应商的费用。
  • 路由规则 可以结合预算因素——例如,当主要供应商接近预算上限时自动回退到更便宜的供应商。
  • 通过供应商回退配置,某个供应商的费用上限 429 可以自动路由到另一个供应商,而不是直接让请求失败。

这并不能取代各供应商的独立治理——你仍然应该在每个供应商处配置费用上限。但它提供了单一供应商无法提供的跨供应商可视化层。

上线前检查清单:配置费用治理

在任何 LLM API 集成上线前,按此清单逐项检查:

  1. 盘点所有 API key 和项目。 清楚现有 key 数量、归属和使用应用。
  2. 在 OpenAI 设置硬性费用上限。 用项目级上限实现团队隔离,用组织级上限作为兜底。
  3. 配置 Anthropic 费用上限。 在 Settings → Billing 中设置组织月度上限。
  4. 启用 DashScope 费用告警。 配置阈值通知和免费额度自动停止。
  5. 为 DeepSeek 充值可控余额。 单次充值不要超过一个月的预期用量。
  6. 在硬性上限前设告警。 在 50%、75%、90% 设置告警,留出反应时间。
  7. 记录升级路径。 生产环境触发费用上限时,谁来提额?审批流程是什么?
  8. 测试失败模式。 在预发布环境刻意触发费用上限 429,验证应用的优雅处理——重试逻辑、用户提示、回退路由。
  9. 定期复查。 用量模式随增长变化,至少每季度调整一次上限。

常见问题

能否按 API key 设置费用上限?

OpenAI 支持项目级上限(每个项目可以有自己的 API key)。Anthropic、DashScope 和 DeepSeek 不提供 key 级粒度——上限在组织或账号级别。

硬性上限在请求进行中触发会怎样?

在 OpenAI,请求返回带有特定错误码的 429 状态。正在进行的流式响应可能会完成(执行不是瞬时的),但新请求会失败。Anthropic 行为类似。DeepSeek 在预付余额耗尽时调用失败。

费用上限多久重置一次?

OpenAI 和 Anthropic 的上限按月度计费周期重置。你也可以随时手动调高或移除上限。DashScope 费用告警按月。DeepSeek 在充值后重置。

应该用费用上限还是速率限制来管控成本?

两者都用。速率限制控制突发吞吐量(防止失控循环在几分钟内耗光全部预算)。费用上限控制一个计费周期内的累计成本。它们应对不同的故障模式,应一起配置。

路由层能实现跨供应商的费用上限吗?

像 TheRouter 这样的路由层可以汇聚费用可视化并基于剩余预算做路由决策。但硬性执行仍然在各供应商的 API 层。路由层增加的是在硬性上限触发前重新分配流量的智能。


所有定价和功能细节均已根据 2026 年 8 月的官方文档核实。供应商服务内容会变化——在配置生产环境治理前,请在各供应商控制台确认当前能力。

帮助与联系