← Все статьи

OpenAI Ultrafast (Cerebras): GPT-5.6 Sol в 14 раз быстрее — руководство по выбору service tier для API-маршрутизации

Режим Ultrafast от OpenAI запускает GPT-5.6 Sol на оборудовании Cerebras со скоростью до 750 выходных токенов в секунду — в 14 раз быстрее стандартной обработки. Разбираем устройство service tier, влияние Ultrafast на решения по API-маршрутизации и подготовку инфраструктуры к новому уровню задержки.

· TheRouter

13 августа 2026 года OpenAI представила Ultrafast — новый service tier, в котором GPT-5.6 Sol работает на оборудовании Cerebras со скоростью до 750 выходных токенов в секунду, примерно в 14 раз быстрее стандартной обработки. Модель та же самая. Отличается кремний, на котором выполняется inference, и, как следствие, профиль задержки.

Для операторов API Ultrafast меняет логику маршрутизации. До сих пор единственным способом получить frontier-уровень интеллекта и низкую задержку от одной модели был Fast mode (2,5× по сравнению со Standard, двойная цена). Ultrafast поднимает потолок скорости на порядок — появляются сценарии, где даже Fast mode был недостаточно быстр.

В этом руководстве собрана вся опубликованная информация об Ultrafast, показано его место в системе service tier OpenAI (Standard, Fast, Batch, Flex) и даны рекомендации по подготовке инфраструктуры к расширению доступа.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Источники: OpenAI — Previewing Ultrafast, получено 2026-08-19; Cerebras — Accelerating GPT-5.6 Sol Ultrafast, получено 2026-08-19; OpenAI API Pricing, получено 2026-08-19; OpenAI — Fast Mode Guide, получено 2026-08-19; MLQ — OpenAI previews GPT-5.6 Sol Ultrafast, получено 2026-08-19.

Начало работы за 3 минуты

Ultrafast пока доступен только в ограниченном превью. Самостоятельно подключить его через API, как Fast mode, сейчас нельзя. Вот что можно сделать прямо сейчас:

  1. Подать заявку на доступ: openai.com/form/ultrafast/.
  2. Использовать Fast mode для запросов GPT-5.6 Sol, указав service_tier: "fast". Это лучший по задержке вариант, доступный всем пользователям API.
  3. Организовать routing-логику так, чтобы переключение с Fast на Ultrafast потребовало изменения одного значения параметра, а не переписывания интеграции.

Когда Ultrafast станет общедоступным, подключение, по всей видимости, будет следовать существующей схеме параметра service_tier:

from openai import OpenAI

client = OpenAI()

# Fast mode — доступен уже сейчас
response = client.responses.create(
    model="gpt-5.6-sol",
    input="Проанализируйте этот лог инцидента и определите причину.",
    service_tier="fast",
)

# Ultrafast — после получения доступа
# response = client.responses.create(
#     model="gpt-5.6-sol",
#     input="Проанализируйте этот лог инцидента и определите причину.",
#     service_tier="ultrafast",  # ожидаемое значение
# )

Примечание: Значение service_tier: "ultrafast" официально не подтверждено. Пример выше следует паттерну "fast" и "flex". При получении доступа сверьтесь с документацией OpenAI по service tier.

Обзор service tier OpenAI

OpenAI теперь предлагает несколько режимов обработки для одной модели, каждый из которых по-разному балансирует задержку, стоимость и гарантии доступности. Понимание этих tier — основа routing-решений.

TierСкорость vs StandardЦена (Sol, за 1M токенов)ДоступностьПодходит для
Standard1× (базовая)$5.00 вход / $30.00 выходGA, все аккаунтыОбщий production-трафик
BatchАсинхронный (до 24 ч)$2.50 / $15.00 (50% скидка)GAОфлайн-обработка, ETL
FlexПеременная, возможна очередь$2.50 / $15.00 (50% скидка)GAЧувствительные к цене задачи
FastДо 2,5×$10.00 / $60.00 (2× Standard)GAКлиентские приложения, критичная задержка
UltrafastДо 14× (~750 tok/s)Не опубликованаОграниченное превьюRealtime agent-циклы, incident response

Цены из OpenAI API Pricing, получено 19 августа 2026 г. Стоимость Ultrafast не раскрыта.

Как работает service_tier в API

Каждый запрос к Responses API или Chat Completions API принимает параметр service_tier:

  • "auto" или пропущен — маршрутизация на Standard
  • "fast" (или устаревшее "priority") — маршрутизация на Fast mode
  • "flex" — маршрутизация на Flex
  • "default" в ответе — Fast mode был понижен до Standard из-за ramp rate limit

Ответ содержит поле service_tier, подтверждающее, какой tier фактически обработал запрос. Это важно для мониторинга: если вы запросили "fast", а в ответе "default", сработал ramp rate limiter, и запрос обработан на скорости и по цене Standard.

import OpenAI from "openai";

const openai = new OpenAI();

const response = await openai.responses.create({
  model: "gpt-5.6-sol",
  input: "Резюмируйте этот квартальный отчёт.",
  service_tier: "fast",
});

// Какой tier фактически обработал запрос
console.log(`Processed by: ${response.service_tier}`);
// "priority" = использован Fast mode
// "default" = понижен до Standard

Можно также задать tier по умолчанию на уровне проекта в панели OpenAI: Settings > General > Project Service Tier.

Чем Ultrafast отличается

Оборудование: Cerebras Wafer-Scale Engine

Standard и Fast mode запускают GPT-5.6 Sol на GPU-кластерах. Ultrafast работает на чипах Cerebras Wafer-Scale Engine с принципиально другой архитектурой inference.

GPU-inference больших моделей упирается в пропускную способность памяти: веса модели при каждой генерации токена перемещаются между on-chip и off-chip хранилищем. Cerebras размещает 44 ГБ SRAM на каждом чипе размером с пластину (wafer), веса остаются on-chip, и пересылка данных, ограничивающая GPU, устраняется. Токены проходят через слои модели по pipeline-каналам между пластинами без задержек на перенос весов.

Результат: GPT-5.6 Sol генерирует до 750 выходных токенов в секунду на Ultrafast по сравнению с ~50–55 tok/s на Standard.

Заявленные скорости в контексте

OpenAI и Cerebras приводят следующие сравнения:

Модель / режимВыходных tok/sИсточник
GPT-5.6 Sol UltrafastДо 750OpenAI
GPT-5.6 Sol Standard~50–55 (из кратности 14×)Расчёт
Claude Fable 5~140 (из кратности 5×)Cerebras
Claude Opus 4.8 Fast~150 (из кратности 5×)Cerebras

Оговорки: OpenAI не опубликовала размер промпта, длину выхода, параллелизм, условия прогрева и TTFT, при которых получена цифра 750 tok/s. «14×» описывает пропускную способность генерации, а не полную задержку запроса, включая TTFT. Независимые бенчмарки пока не публиковались.

Cerebras также протестировала GPT-5.6 Sol Ultrafast на Humanity's Last Exam (HLE) — 2 500 вопросов PhD-уровня. Ultrafast прошёл весь бенчмарк за 11 часов 11 минут; Claude Fable 5 потребовалось 78 часов 27 минут при сопоставимой точности — 7-кратное ускорение по wall-clock time.

Когда Ultrafast оправдан

Не каждая задача требует 750 tok/s. Ценовая премия (размер пока неизвестен) делает Ultrafast избыточным для пакетной классификации или ночных ETL-пайплайнов. Подходящие сценарии:

Задержка на критическом пути взаимодействия с пользователем:

  • Incident response — анализ логов и трейсов, пока сбой продолжается
  • Голосовые/чат-системы поддержки — решение сложных вопросов без пауз в разговоре
  • E-commerce — ответы на вопросы о товаре до того, как покупатель потеряет интерес

Agent-циклы итерируются быстрее, чем человек переключает контекст:

  • Исследовательские потоки, ранее требовавшие ночных batch-прогонов, становятся интерактивными
  • Agentic coding, где ожидание ответа модели — главный bottleneck

Конкуренция во времени:

  • Анализ финансовых сигналов, когда минуты имеют значение
  • Реагирование на инциденты безопасности, где время от обнаружения до сдерживания определяет потери

Когда оставаться на Standard или Fast

СценарийРекомендуемый tierПричина
Фоновая обработка документовBatch или FlexСтоимость важнее скорости
Обычное чат-приложениеStandard50+ tok/s достаточно для диалога
Продукт с SLA по задержкеFast2,5× Standard при известной цене
Realtime agent-цикл, incident responseUltrafast (после открытия)Скорость напрямую влияет на качество результата
Массовая классификация / extractionLuna + StandardLuna $0.20/$1.20 за 1M — в 25 раз дешевле Sol

Типичные ошибки и решения

Поскольку Ultrafast в ограниченном превью, большинство команд сейчас работают с Fast mode. Частые проблемы:

Ramp rate limit → понижение tier

Симптом: Запрос с service_tier: "fast", ответ с service_tier: "default".

Причина: Трафик превысил 1M TPM и вырос более чем на 50% за 15 минут; Fast mode понизил часть запросов до Standard.

Решение:

  • Наращивайте трафик постепенно при смене модели или tier
  • Используйте feature flags для плавного переключения в течение нескольких часов
  • ETL и batch-задачи отправляйте в Batch tier, а не в Fast

Модель не поддерживает Fast mode

Симптом: InvalidRequestError при service_tier: "fast" с определёнными моделями.

Решение: Fast mode поддерживает GPT-5.6 Sol/Terra/Luna, GPT-5.5, GPT-5.4 и более ранние GPT-4. Fine-tuned модели и embeddings не поддерживаются. Актуальный список — на странице тарифов.

priority vs fast в ответе

Симптом: Отправлен service_tier: "fast", в ответе service_tier: "priority".

Это ожидаемое поведение. Для GPT-5.6 и более ранних моделей ответ всегда содержит "priority", независимо от того, отправлен "priority" или "fast".

Чеклист для production

Перед добавлением Ultrafast (или Fast mode) в production:

  • Логируйте service_tier из ответа, а не из запроса — так вы увидите фактический tier
  • Настройте алерты по стоимости для каждого tier — Fast стоит 2× Standard; Ultrafast, вероятно, ещё дороже
  • Реализуйте graceful fallback — при недоступности Ultrafast/Fast автоматически переключайтесь на Standard
  • Разделите latency-критичный и batch-трафик — интерактивные запросы через Fast/Ultrafast, пакетные через Batch/Flex
  • Протестируйте ramp-поведение — наращивайте Fast-трафик постепенно, чтобы не сработал лимит 50%/15 мин
  • Проверьте data residency — Fast mode совместим с data residency, ZDR и BAA; для Ultrafast уточните при получении доступа
  • Отслеживайте метрики по tier — TTFT, полная задержка и cost раздельно для каждого tier

Интеграция с TheRouter

TheRouter маршрутизирует OpenAI-совместимые запросы к настроенным провайдерам. GPT-5.6 Sol доступен через интеграцию с OpenAI, а параметр service_tier прозрачно передаётся в OpenAI API.

При маршрутизации GPT-5.6 Sol через TheRouter:

  • Standard, Fast, Batch, Flex — service_tier передаётся в OpenAI. Укажите его в запросе, TheRouter сохранит значение.
  • Ultrafast — когда OpenAI расширит доступ, значение service_tier будет передаваться точно так же. Изменений конфигурации TheRouter не ожидается.
  • Fallback-маршрутизация — можно настроить fallback моделей, чтобы при сбое GPT-5.6 Sol запрос уходил на Terra или другого провайдера. service_tier действует только для OpenAI; у fallback-провайдеров свои режимы обработки.

Подробнее о маршрутизации GPT-5.6 через TheRouter: страница провайдера OpenAI и страница модели GPT-5.6 Sol.

Что известно и что пока нет

ИзвестноНеизвестно
Ultrafast запускает GPT-5.6 Sol на Cerebras WSEСтоимость Ultrafast (размер ценовой премии)
До 750 выходных tok/s, 14× StandardТочное значение service_tier для API
Ограниченное превью с 13 августа 2026Дата выхода GA
Совместим с существующим форматом OpenAI APIПоддерживаемые регионы и data residency
Первые клиенты: Jane Street, Podium, Basis, RogoRate limits для Ultrafast
Партнёрство с Cerebras: 750 МВт до 2028Расширение на Terra/Luna
Без потери качества моделиИзмерения TTFT

Руководство будет обновлено, когда OpenAI опубликует цены Ultrafast, подтвердит параметр API и расширит доступ.

FAQ

Ultrafast — это новая модель?

Нет. Ultrafast использует ту же модель GPT-5.6 Sol, что и Standard и Fast. Отличие — в оборудовании для inference (Cerebras Wafer-Scale Engine вместо GPU) и, как следствие, в пропускной способности.

Можно ли использовать Ultrafast сейчас?

Только участники ограниченного превью. Подайте заявку для получения уведомления. Пока Fast mode (service_tier: "fast") — лучший по задержке вариант для всех пользователей API.

Чем Ultrafast отличается от Fast mode?

Fast mode обеспечивает до 2,5× скорости Standard при двойной цене за токен. Ultrafast — до 14× скорости Standard. Ценовая премия Ultrafast не опубликована.

Будет ли Ultrafast поддерживать Terra и Luna?

OpenAI объявила Ultrafast только для GPT-5.6 Sol. Информации о поддержке Terra и Luna нет.

Влияет ли Ultrafast на качество модели?

OpenAI и Cerebras заявляют, что нет. Cerebras протестировала GPT-5.6 Sol Ultrafast на Humanity's Last Exam и получила точность, сопоставимую со Standard, с 7-кратным ускорением по wall-clock time по сравнению с Claude Fable 5.

Какое отношение это имеет к партнёрству OpenAI и Cerebras?

OpenAI объявила о партнёрстве с Cerebras в январе 2026 года: 750 МВт inference-мощностей до 2028 года с опцией на дополнительные 1,25 ГВт до 2030 года. Ultrafast — последний продукт, построенный на этой инфраструктуре.

Модели, упомянутые в статье

Помощь и контакты