OpenAI Ultrafast (Cerebras): GPT-5.6 Sol в 14 раз быстрее — руководство по выбору service tier для API-маршрутизации
Режим Ultrafast от OpenAI запускает GPT-5.6 Sol на оборудовании Cerebras со скоростью до 750 выходных токенов в секунду — в 14 раз быстрее стандартной обработки. Разбираем устройство service tier, влияние Ultrafast на решения по API-маршрутизации и подготовку инфраструктуры к новому уровню задержки.
13 августа 2026 года OpenAI представила Ultrafast — новый service tier, в котором GPT-5.6 Sol работает на оборудовании Cerebras со скоростью до 750 выходных токенов в секунду, примерно в 14 раз быстрее стандартной обработки. Модель та же самая. Отличается кремний, на котором выполняется inference, и, как следствие, профиль задержки.
Для операторов API Ultrafast меняет логику маршрутизации. До сих пор единственным способом получить frontier-уровень интеллекта и низкую задержку от одной модели был Fast mode (2,5× по сравнению со Standard, двойная цена). Ultrafast поднимает потолок скорости на порядок — появляются сценарии, где даже Fast mode был недостаточно быстр.
В этом руководстве собрана вся опубликованная информация об Ultrafast, показано его место в системе service tier OpenAI (Standard, Fast, Batch, Flex) и даны рекомендации по подготовке инфраструктуры к расширению доступа.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Источники: OpenAI — Previewing Ultrafast, получено 2026-08-19; Cerebras — Accelerating GPT-5.6 Sol Ultrafast, получено 2026-08-19; OpenAI API Pricing, получено 2026-08-19; OpenAI — Fast Mode Guide, получено 2026-08-19; MLQ — OpenAI previews GPT-5.6 Sol Ultrafast, получено 2026-08-19.
Начало работы за 3 минуты
Ultrafast пока доступен только в ограниченном превью. Самостоятельно подключить его через API, как Fast mode, сейчас нельзя. Вот что можно сделать прямо сейчас:
- Подать заявку на доступ: openai.com/form/ultrafast/.
- Использовать Fast mode для запросов GPT-5.6 Sol, указав
service_tier: "fast". Это лучший по задержке вариант, доступный всем пользователям API. - Организовать routing-логику так, чтобы переключение с Fast на Ultrafast потребовало изменения одного значения параметра, а не переписывания интеграции.
Когда Ultrafast станет общедоступным, подключение, по всей видимости, будет следовать существующей схеме параметра service_tier:
from openai import OpenAI
client = OpenAI()
# Fast mode — доступен уже сейчас
response = client.responses.create(
model="gpt-5.6-sol",
input="Проанализируйте этот лог инцидента и определите причину.",
service_tier="fast",
)
# Ultrafast — после получения доступа
# response = client.responses.create(
# model="gpt-5.6-sol",
# input="Проанализируйте этот лог инцидента и определите причину.",
# service_tier="ultrafast", # ожидаемое значение
# )
Примечание: Значение
service_tier: "ultrafast"официально не подтверждено. Пример выше следует паттерну"fast"и"flex". При получении доступа сверьтесь с документацией OpenAI по service tier.
Обзор service tier OpenAI
OpenAI теперь предлагает несколько режимов обработки для одной модели, каждый из которых по-разному балансирует задержку, стоимость и гарантии доступности. Понимание этих tier — основа routing-решений.
| Tier | Скорость vs Standard | Цена (Sol, за 1M токенов) | Доступность | Подходит для |
|---|---|---|---|---|
| Standard | 1× (базовая) | $5.00 вход / $30.00 выход | GA, все аккаунты | Общий production-трафик |
| Batch | Асинхронный (до 24 ч) | $2.50 / $15.00 (50% скидка) | GA | Офлайн-обработка, ETL |
| Flex | Переменная, возможна очередь | $2.50 / $15.00 (50% скидка) | GA | Чувствительные к цене задачи |
| Fast | До 2,5× | $10.00 / $60.00 (2× Standard) | GA | Клиентские приложения, критичная задержка |
| Ultrafast | До 14× (~750 tok/s) | Не опубликована | Ограниченное превью | Realtime agent-циклы, incident response |
Цены из OpenAI API Pricing, получено 19 августа 2026 г. Стоимость Ultrafast не раскрыта.
Как работает service_tier в API
Каждый запрос к Responses API или Chat Completions API принимает параметр service_tier:
"auto"или пропущен — маршрутизация на Standard"fast"(или устаревшее"priority") — маршрутизация на Fast mode"flex"— маршрутизация на Flex"default"в ответе — Fast mode был понижен до Standard из-за ramp rate limit
Ответ содержит поле service_tier, подтверждающее, какой tier фактически обработал запрос. Это важно для мониторинга: если вы запросили "fast", а в ответе "default", сработал ramp rate limiter, и запрос обработан на скорости и по цене Standard.
import OpenAI from "openai";
const openai = new OpenAI();
const response = await openai.responses.create({
model: "gpt-5.6-sol",
input: "Резюмируйте этот квартальный отчёт.",
service_tier: "fast",
});
// Какой tier фактически обработал запрос
console.log(`Processed by: ${response.service_tier}`);
// "priority" = использован Fast mode
// "default" = понижен до Standard
Можно также задать tier по умолчанию на уровне проекта в панели OpenAI: Settings > General > Project Service Tier.
Чем Ultrafast отличается
Оборудование: Cerebras Wafer-Scale Engine
Standard и Fast mode запускают GPT-5.6 Sol на GPU-кластерах. Ultrafast работает на чипах Cerebras Wafer-Scale Engine с принципиально другой архитектурой inference.
GPU-inference больших моделей упирается в пропускную способность памяти: веса модели при каждой генерации токена перемещаются между on-chip и off-chip хранилищем. Cerebras размещает 44 ГБ SRAM на каждом чипе размером с пластину (wafer), веса остаются on-chip, и пересылка данных, ограничивающая GPU, устраняется. Токены проходят через слои модели по pipeline-каналам между пластинами без задержек на перенос весов.
Результат: GPT-5.6 Sol генерирует до 750 выходных токенов в секунду на Ultrafast по сравнению с ~50–55 tok/s на Standard.
Заявленные скорости в контексте
OpenAI и Cerebras приводят следующие сравнения:
| Модель / режим | Выходных tok/s | Источник |
|---|---|---|
| GPT-5.6 Sol Ultrafast | До 750 | OpenAI |
| GPT-5.6 Sol Standard | ~50–55 (из кратности 14×) | Расчёт |
| Claude Fable 5 | ~140 (из кратности 5×) | Cerebras |
| Claude Opus 4.8 Fast | ~150 (из кратности 5×) | Cerebras |
Оговорки: OpenAI не опубликовала размер промпта, длину выхода, параллелизм, условия прогрева и TTFT, при которых получена цифра 750 tok/s. «14×» описывает пропускную способность генерации, а не полную задержку запроса, включая TTFT. Независимые бенчмарки пока не публиковались.
Cerebras также протестировала GPT-5.6 Sol Ultrafast на Humanity's Last Exam (HLE) — 2 500 вопросов PhD-уровня. Ultrafast прошёл весь бенчмарк за 11 часов 11 минут; Claude Fable 5 потребовалось 78 часов 27 минут при сопоставимой точности — 7-кратное ускорение по wall-clock time.
Когда Ultrafast оправдан
Не каждая задача требует 750 tok/s. Ценовая премия (размер пока неизвестен) делает Ultrafast избыточным для пакетной классификации или ночных ETL-пайплайнов. Подходящие сценарии:
Задержка на критическом пути взаимодействия с пользователем:
- Incident response — анализ логов и трейсов, пока сбой продолжается
- Голосовые/чат-системы поддержки — решение сложных вопросов без пауз в разговоре
- E-commerce — ответы на вопросы о товаре до того, как покупатель потеряет интерес
Agent-циклы итерируются быстрее, чем человек переключает контекст:
- Исследовательские потоки, ранее требовавшие ночных batch-прогонов, становятся интерактивными
- Agentic coding, где ожидание ответа модели — главный bottleneck
Конкуренция во времени:
- Анализ финансовых сигналов, когда минуты имеют значение
- Реагирование на инциденты безопасности, где время от обнаружения до сдерживания определяет потери
Когда оставаться на Standard или Fast
| Сценарий | Рекомендуемый tier | Причина |
|---|---|---|
| Фоновая обработка документов | Batch или Flex | Стоимость важнее скорости |
| Обычное чат-приложение | Standard | 50+ tok/s достаточно для диалога |
| Продукт с SLA по задержке | Fast | 2,5× Standard при известной цене |
| Realtime agent-цикл, incident response | Ultrafast (после открытия) | Скорость напрямую влияет на качество результата |
| Массовая классификация / extraction | Luna + Standard | Luna $0.20/$1.20 за 1M — в 25 раз дешевле Sol |
Типичные ошибки и решения
Поскольку Ultrafast в ограниченном превью, большинство команд сейчас работают с Fast mode. Частые проблемы:
Ramp rate limit → понижение tier
Симптом: Запрос с service_tier: "fast", ответ с service_tier: "default".
Причина: Трафик превысил 1M TPM и вырос более чем на 50% за 15 минут; Fast mode понизил часть запросов до Standard.
Решение:
- Наращивайте трафик постепенно при смене модели или tier
- Используйте feature flags для плавного переключения в течение нескольких часов
- ETL и batch-задачи отправляйте в Batch tier, а не в Fast
Модель не поддерживает Fast mode
Симптом: InvalidRequestError при service_tier: "fast" с определёнными моделями.
Решение: Fast mode поддерживает GPT-5.6 Sol/Terra/Luna, GPT-5.5, GPT-5.4 и более ранние GPT-4. Fine-tuned модели и embeddings не поддерживаются. Актуальный список — на странице тарифов.
priority vs fast в ответе
Симптом: Отправлен service_tier: "fast", в ответе service_tier: "priority".
Это ожидаемое поведение. Для GPT-5.6 и более ранних моделей ответ всегда содержит "priority", независимо от того, отправлен "priority" или "fast".
Чеклист для production
Перед добавлением Ultrafast (или Fast mode) в production:
- Логируйте
service_tierиз ответа, а не из запроса — так вы увидите фактический tier - Настройте алерты по стоимости для каждого tier — Fast стоит 2× Standard; Ultrafast, вероятно, ещё дороже
- Реализуйте graceful fallback — при недоступности Ultrafast/Fast автоматически переключайтесь на Standard
- Разделите latency-критичный и batch-трафик — интерактивные запросы через Fast/Ultrafast, пакетные через Batch/Flex
- Протестируйте ramp-поведение — наращивайте Fast-трафик постепенно, чтобы не сработал лимит 50%/15 мин
- Проверьте data residency — Fast mode совместим с data residency, ZDR и BAA; для Ultrafast уточните при получении доступа
- Отслеживайте метрики по tier — TTFT, полная задержка и cost раздельно для каждого tier
Интеграция с TheRouter
TheRouter маршрутизирует OpenAI-совместимые запросы к настроенным провайдерам. GPT-5.6 Sol доступен через интеграцию с OpenAI, а параметр service_tier прозрачно передаётся в OpenAI API.
При маршрутизации GPT-5.6 Sol через TheRouter:
- Standard, Fast, Batch, Flex —
service_tierпередаётся в OpenAI. Укажите его в запросе, TheRouter сохранит значение. - Ultrafast — когда OpenAI расширит доступ, значение
service_tierбудет передаваться точно так же. Изменений конфигурации TheRouter не ожидается. - Fallback-маршрутизация — можно настроить fallback моделей, чтобы при сбое GPT-5.6 Sol запрос уходил на Terra или другого провайдера.
service_tierдействует только для OpenAI; у fallback-провайдеров свои режимы обработки.
Подробнее о маршрутизации GPT-5.6 через TheRouter: страница провайдера OpenAI и страница модели GPT-5.6 Sol.
Что известно и что пока нет
| Известно | Неизвестно |
|---|---|
| Ultrafast запускает GPT-5.6 Sol на Cerebras WSE | Стоимость Ultrafast (размер ценовой премии) |
| До 750 выходных tok/s, 14× Standard | Точное значение service_tier для API |
| Ограниченное превью с 13 августа 2026 | Дата выхода GA |
| Совместим с существующим форматом OpenAI API | Поддерживаемые регионы и data residency |
| Первые клиенты: Jane Street, Podium, Basis, Rogo | Rate limits для Ultrafast |
| Партнёрство с Cerebras: 750 МВт до 2028 | Расширение на Terra/Luna |
| Без потери качества модели | Измерения TTFT |
Руководство будет обновлено, когда OpenAI опубликует цены Ultrafast, подтвердит параметр API и расширит доступ.
FAQ
Ultrafast — это новая модель?
Нет. Ultrafast использует ту же модель GPT-5.6 Sol, что и Standard и Fast. Отличие — в оборудовании для inference (Cerebras Wafer-Scale Engine вместо GPU) и, как следствие, в пропускной способности.
Можно ли использовать Ultrafast сейчас?
Только участники ограниченного превью. Подайте заявку для получения уведомления. Пока Fast mode (service_tier: "fast") — лучший по задержке вариант для всех пользователей API.
Чем Ultrafast отличается от Fast mode?
Fast mode обеспечивает до 2,5× скорости Standard при двойной цене за токен. Ultrafast — до 14× скорости Standard. Ценовая премия Ultrafast не опубликована.
Будет ли Ultrafast поддерживать Terra и Luna?
OpenAI объявила Ultrafast только для GPT-5.6 Sol. Информации о поддержке Terra и Luna нет.
Влияет ли Ultrafast на качество модели?
OpenAI и Cerebras заявляют, что нет. Cerebras протестировала GPT-5.6 Sol Ultrafast на Humanity's Last Exam и получила точность, сопоставимую со Standard, с 7-кратным ускорением по wall-clock time по сравнению с Claude Fable 5.
Какое отношение это имеет к партнёрству OpenAI и Cerebras?
OpenAI объявила о партнёрстве с Cerebras в январе 2026 года: 750 МВт inference-мощностей до 2028 года с опцией на дополнительные 1,25 ГВт до 2030 года. Ultrafast — последний продукт, построенный на этой инфраструктуре.