← 全部文章

OpenAI Ultrafast(Cerebras):GPT-5.6 Sol 14 倍加速——服务层级路由指南

OpenAI 的 Ultrafast 模式在 Cerebras 硬件上运行 GPT-5.6 Sol,输出速度可达每秒 750 token,是标准处理速度的 14 倍。我们拆解了 OpenAI 服务层级的工作原理,Ultrafast 对 API 路由决策的影响,以及运维团队该如何提前准备。

· TheRouter

2026 年 8 月 13 日,OpenAI 预览了 Ultrafast 服务层级,它在 Cerebras 硬件上运行 GPT-5.6 Sol,输出速度最高可达每秒 750 token,大约是标准模式的 14 倍。模型本身没有变,变的是推理跑在什么芯片上,延迟表现因此完全不同。

对于 API 运维团队来说,Ultrafast 改变了路由的算法。此前如果想在同一个模型上同时获得前沿智能和低延迟,只能选 Fast 模式(标准速度的 2.5 倍,价格翻倍)。Ultrafast 把速度上限推到了一个新量级,让 Fast 模式仍然太慢的场景有了真正可行的方案。

这篇指南整理了目前已经公开的 Ultrafast 信息,说明它在 OpenAI 现有服务层级体系(Standard / Fast / Batch / Flex)中的位置,并给出运维团队在扩大可用范围之前可以做的准备工作。

OpenAI 兼容指供应商提供一个 chat-completions 接口,其请求与响应结构与 OpenAI API 契约足够接近——只需替换三个值(API key、base URL、模型名),原来的 OpenAI SDK 调用即可直接工作。最小实践面是POST /v1/chat/completions 带 messages、model, 并返回 OpenAI 形式的流式响应。

信息来源。OpenAI, Previewing Ultrafast(2026-08-19)、Cerebras, Accelerating GPT-5.6 Sol Ultrafast(2026-08-19)、OpenAI API 定价(2026-08-19)、Fast Mode Guide(2026-08-19)、MLQ 报道(2026-08-19)。

三分钟上手

Ultrafast 目前处于受限预览阶段,还不能像 Fast 模式那样通过 API 自行开通。你现在能做的事有三件。

  1. 登记排队,地址在 openai.com/form/ultrafast/。
  2. 先用 Fast 模式跑 GPT-5.6 Sol 请求,方法是在请求里设置 service_tier: "fast"。这是当前所有 API 用户都能用的最低延迟选项。
  3. 把路由逻辑写成可切换的结构,从 Fast 切到 Ultrafast 只需要改一个参数值,不需要重写集成代码。

Ultrafast 正式开放后,预期的接入方式会沿用现有的 service_tier 参数模式。根据 OpenAI 目前的层级架构,请求大概长这样。

from openai import OpenAI

client = OpenAI()

# Fast 模式,现在就能用
response = client.responses.create(
    model="gpt-5.6-sol",
    input="分析这份事故日志,找出根本原因。",
    service_tier="fast",
)

# Ultrafast,拿到权限后启用
# response = client.responses.create(
#     model="gpt-5.6-sol",
#     input="分析这份事故日志,找出根本原因。",
#     service_tier="ultrafast",  # 预期参数值
# )

service_tier: "ultrafast" 这个参数值尚未被官方公开确认。上面的示例沿用了 "fast" 和 "flex" 的命名模式。拿到账户权限后请查看 OpenAI 服务层级文档 获取确认值。

OpenAI 服务层级全景

OpenAI 现在为同一个模型提供了多种处理模式,分别在延迟、成本和可用性保证之间做不同的取舍。理解这些层级是做路由决策的基础。

层级相对标准速度定价(Sol,每 1M token)可用性适合场景
Standard1x(基线)$5.00 输入 / $30.00 输出正式版,所有账户通用生产流量
Batch异步(最多 24 小时)$2.50 / $15.00(5 折)正式版离线处理,ETL
Flex不确定,可能排队$2.50 / $15.00(5 折)正式版成本敏感,能容忍波动
Fast最高 2.5x$10.00 / $60.00(2 倍标准)正式版面向用户,延迟关键
Ultrafast最高 14x(~750 tok/s)未公布受限预览实时 Agent 循环,事故响应

定价来自 OpenAI API 定价页,检索于 2026 年 8 月 19 日。Ultrafast 的定价尚未披露。

service_tier 在 API 中的工作方式

每个发往 Responses API 或 Chat Completions API 的请求都可以带一个 service_tier 参数。

  • "auto" 或省略,走 Standard
  • "fast"(或旧值 "priority"),走 Fast 模式
  • "flex",走 Flex 处理
  • "default" 出现在响应里时,说明 Fast 模式因为流量爬升限制被降级到了 Standard

响应对象里有一个 service_tier 字段,告诉你实际用了哪个层级。这对监控很重要,如果你请求了 "fast" 但响应是 "default",说明触发了流量爬升限制,这次请求按 Standard 速度和 Standard 价格处理。

import OpenAI from "openai";

const openai = new OpenAI();

const response = await openai.responses.create({
  model: "gpt-5.6-sol",
  input: "总结这份季度报告。",
  service_tier: "fast",
});

// 检查实际用了哪个层级
console.log(`Processed by: ${response.service_tier}`);
// "priority" = 使用了 Fast 模式
// "default" = 被降级到了 Standard

你也可以在 OpenAI 控制台的 Settings > General > Project Service Tier 里设置项目级别的默认层级,这样该项目的所有请求都会默认走指定层级,不需要逐个请求配置。

Ultrafast 的核心差异

硬件端:Cerebras 晶圆级引擎

Standard 和 Fast 模式在 GPU 集群上运行 GPT-5.6 Sol。Ultrafast 在 Cerebras Wafer-Scale Engine 芯片上运行同一个模型,推理架构从根本上不同。

GPU 推理大模型时的瓶颈在于显存带宽,模型权重在每次生成 token 时都要在片上内存和片外存储之间来回搬运。Cerebras 在每片晶圆级芯片上集成了 44 GB SRAM,权重始终留在片上,消除了这种数据搬运开销。token 通过跨晶圆流水线直接流过模型各层,不存在 GPU 推理中反复搬权重的带宽瓶颈。

结果就是 GPT-5.6 Sol 在 Ultrafast 上每秒最多能生成 750 个输出 token,Standard 模式大约是 50 到 55 tok/s。

速度数据放在上下文里看

OpenAI 和 Cerebras 公布了以下速度对比。

模型 / 模式输出 token/秒来源
GPT-5.6 Sol Ultrafast最高 750OpenAI
GPT-5.6 Sol Standard~50–55(由 14x 倍数推算)推算
Claude Fable 5~140(由 5x 对比推算)Cerebras
Claude Opus 4.8 Fast~150(由 5x 对比推算)Cerebras

OpenAI 没有公布 750 tok/s 数据背后的 prompt 长度、输出长度、并发数、预热条件和首 token 延迟。"14 倍"说的是输出生成吞吐量,不一定等于包含首 token 延迟在内的总请求延迟。目前还没有独立第三方基准测试。

Cerebras 还用 GPT-5.6 Sol Ultrafast 跑了 Humanity's Last Exam(HLE) 基准测试,2,500 道博士级难度的题目。Ultrafast 跑完全部题目用了 11 小时 11 分钟。Claude Fable 5 在相近准确率下需要 78 小时 27 分钟。相当于在真实任务上 7 倍的时钟加速。

什么情况下 Ultrafast 有意义

不是每种工作负载都需要 750 tok/s。速度溢价(定价待定)意味着 Ultrafast 用在批量分类或隔夜 ETL 上是浪费。真正的甜蜜点在于以下场景。

**延迟直接在人与系统的交互路径上。**故障还在继续时需要实时分析日志和调用链;复杂客服问题不能让用户干等;电商场景里用户犹豫几秒就可能离开。

**Agent 循环迭代速度超过人类切换上下文的速度。**以前需要隔夜跑批的研究流程可以变成当天的交互式工作。模型执行多步计划的 agentic 编程场景里,等模型回复本身就是瓶颈。

**存在时间竞争压力。**金融信号分析中分钟级别的差异就会产生后果。安全事件响应中,从检测到遏制的时间直接决定损失大小。

什么时候该留在 Standard 或 Fast

场景推荐层级原因
后台文档处理Batch 或 Flex成本比速度重要
通用聊天应用Standard50+ tok/s 对对话体验足够
有延迟 SLA 的面向用户产品Fast2.5 倍标准速度,定价已知
实时 Agent 循环、事故响应Ultrafast(开放后)速度直接影响结果质量
高吞吐量分类/提取Luna + StandardLuna $0.20/$1.20 per 1M,比 Sol 便宜 25 倍

常见问题与解决

由于 Ultrafast 还在受限预览,大多数团队现阶段用的是 Fast 模式。以下是常见问题。

流量爬升限制导致降级

你请求了 service_tier: "fast",但响应里返回的是 service_tier: "default"。

这说明你的流量超过了 1M TPM 且在 15 分钟内增幅超过 50%,Fast 模式把部分请求降级到了 Standard 速度和 Standard 定价。

解决办法如下。

  • 切换模型或层级时逐步增加流量
  • 用功能开关(feature flag)在数小时内平滑迁移,不要瞬间切满
  • ETL 或批处理任务不要走 Fast 模式,用 Batch 层级

模型不支持 Fast 模式

对某些模型使用 service_tier: "fast" 时返回 InvalidRequestError。

Fast 模式支持 GPT-5.6 Sol / Terra / Luna、GPT-5.5、GPT-5.4 和更早的 GPT-4 系列模型。微调模型和 embedding 不支持。完整列表请查看定价页。

响应里 priority 和 fast 混淆

你发了 service_tier: "fast",但响应里是 service_tier: "priority"。

这是正常行为。对 GPT-5.6 和更早的模型,不管你发的是 "priority" 还是 "fast",响应都返回 "priority"。两个值走的是同一条处理路径。

生产检查清单

在把 Ultrafast(或 Fast 模式)接入生产环境之前,检查以下事项。

  • 监控响应中的 service_tier 字段,日志记录的应该是响应值而非请求参数,这样才能跟踪实际层级使用情况
  • 设置分层级的成本告警,Fast 模式价格是 Standard 的 2 倍,Ultrafast 定价待定但预计更高
  • 实现优雅降级,如果 Ultrafast/Fast 不可用或触发限速,自动降级到 Standard 而不是让请求失败
  • 把延迟敏感流量和批量流量分开,交互式请求走 Fast/Ultrafast,批量任务走 Batch/Flex
  • 测试流量爬升行为,逐步增加 Fast 模式流量,避免触发 50%/15 分钟的爬升限制
  • 确认数据合规,Fast 模式兼容 data residency、ZDR 和 BAA;拿到 Ultrafast 权限后再确认兼容性
  • 按层级分别跟踪指标,TTFT、总延迟和成本要按层级分开统计,才能判断溢价是否值得

TheRouter 集成说明

TheRouter 将 OpenAI 兼容的请求路由到已配置的提供商。GPT-5.6 Sol 可以通过 TheRouter 的 OpenAI 提供商集成 使用,service_tier 参数会被透传给 OpenAI API。

通过 TheRouter 路由 GPT-5.6 Sol 请求时,有以下几点需要了解。

  • Standard、Fast、Batch、Flex 四个层级的 service_tier 参数都会被转发给 OpenAI。在请求里设置好,TheRouter 会保留它。
  • Ultrafast 开放后,service_tier 值会以同样的方式透传。预计不需要修改 TheRouter 配置。
  • 你也可以配置模型降级回退,当 GPT-5.6 Sol 请求失败时降级到 Terra 或其他提供商。service_tier 参数仅在 OpenAI 路径上生效,降级到的提供商会使用它们自己的处理模式。

关于如何通过 TheRouter 路由 GPT-5.6 模型的更多信息,请参阅 OpenAI 提供商页面 和 GPT-5.6 Sol 模型页面。

已知信息与待确认信息

已知待确认
Ultrafast 在 Cerebras WSE 上运行 GPT-5.6 SolUltrafast 定价(每 token 溢价多少)
最高 750 输出 tok/s,14 倍标准速度确切的 service_tier 参数值
2026 年 8 月 13 日起受限预览正式版发布时间
与现有 OpenAI API 格式兼容支持的区域和数据驻留
早期客户包括 Jane Street、Podium、Basis、RogoUltrafast 专属的速率限制
Cerebras 合作覆盖 750 MW 算力至 2028 年是否会扩展到 Terra/Luna
不损失模型质量首 token 延迟的具体测量数据

OpenAI 公布 Ultrafast 定价、确认 API 参数值、扩大可用范围后,本文将同步更新。

FAQ

Ultrafast 是新模型吗?

不是。Ultrafast 运行的是与 Standard 和 Fast 模式完全相同的 GPT-5.6 Sol 模型。区别在于推理硬件是 Cerebras 晶圆级引擎而非 GPU,吞吐量因此大幅提升。

我现在能用 Ultrafast 吗?

只有受限预览组的用户可以。你可以登记等待通知。在此之前,Fast 模式(service_tier: "fast")是所有 API 用户能用的最低延迟选项。

Ultrafast 和 Fast 模式比起来怎么样?

Fast 模式速度是标准的 2.5 倍,价格是 2 倍。Ultrafast 速度最高达标准的 14 倍。Ultrafast 的价格溢价尚未公布。

Ultrafast 会支持 GPT-5.6 的其他模型(Terra、Luna)吗?

OpenAI 目前只宣布了 GPT-5.6 Sol 的 Ultrafast 模式。关于 Terra 和 Luna 是否会支持,暂时没有任何信息。

Ultrafast 会影响模型质量吗?

OpenAI 和 Cerebras 都表示不会影响质量。Cerebras 用 GPT-5.6 Sol Ultrafast 跑了 Humanity's Last Exam 基准测试,报告的准确率与标准处理相当,时钟加速倍数是 Claude Fable 5 的 7 倍。

这和 OpenAI-Cerebras 合作关系有什么关联?

OpenAI 在 2026 年 1 月宣布与 Cerebras 的合作,覆盖 750 MW 推理算力,交付期到 2028 年,并有到 2030 年再追加 1.25 GW 的选项。Ultrafast 是建立在这套基础设施上的最新产品。

本文涉及的模型

帮助与联系