← Все статьи

Гайд по интеграции GPT-6 Astra API: модель, тарифы, Responses API и маршрутизация между провайдерами

Всё, что нужно для подключения GPT-6 Astra в продакшене — идентификатор модели, пять уровней reasoning effort, полная таблица цен с Fast mode и надбавкой за длинный контекст, ломающие изменения по сравнению с GPT-5.6 Sol, и как направить Astra через несколько провайдеров одной заменой base_url.

· TheRouter

GPT-6 Astra — флагманская модель OpenAI с reasoning-возможностями, выпущенная 3 сентября 2026 года. Идентификатор модели — gpt-6-astra. Контекстное окно вмещает 1 050 000 токенов, максимальный вывод — 128 000 токенов, доступны пять уровней reasoning effort от low до max. Стандартная цена API — $10 за миллион входных токенов и $50 за миллион выходных, что в 2,5 раза больше промо-тарифа GPT-5.6 Sol. Astra доступна через OpenAI API, Microsoft Azure Foundry, AWS Bedrock и сторонние шлюзы вроде OpenRouter.

Мы написали этот гайд, потому что Astra — не замена Sol «один к одному». OpenAI убрала из API параметры temperature, top_p и logprobs. Уровни reasoning effort none и minimal больше не существуют. Вызов функций (tool calling) теперь требует Responses API. Если у вас GPT-5.6 Sol в продакшене, при замене строки модели несколько вещей сломается. Этот гайд описывает весь путь интеграции — от первого API-вызова до маршрутизации через нескольких провайдеров с помощью TheRouter.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Начало работы за 3 минуты

Шаг 1. Получите API-ключ. Если у вас уже есть ключ OpenAI API, он подходит для Astra. Иначе зарегистрируйтесь на platform.openai.com, создайте проект и сгенерируйте ключ.

Шаг 2. Установите SDK. OpenAI Python SDK v1.x работает сразу:

pip install --upgrade openai

Шаг 3. Отправьте первый запрос. Responses API — основной интерфейс Astra:

from openai import OpenAI

client = OpenAI()  # использует переменную окружения OPENAI_API_KEY

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input=[
        {
            "role": "developer",
            "content": "You are a senior API engineer. Be concise."
        },
        {
            "role": "user",
            "content": "Объясни разницу между Chat Completions и Responses API в двух предложениях."
        },
    ],
)

print(response.output_text)

Chat Completions по-прежнему работает для генерации текста. Но как только вам нужен вызов функций или встроенные инструменты (web search, code interpreter, file search), переходите на Responses API.

Шаг 4 (опционально). Маршрутизация через TheRouter. Измените одну строку, чтобы Astra шла через TheRouter с автоматическим fallback:

client = OpenAI(
    api_key="YOUR_THEROUTER_KEY",
    base_url="https://api.therouter.ai/v1",
)

response = client.chat.completions.create(
    model="openai/gpt-6-astra",
    messages=[{"role": "user", "content": "Привет из TheRouter"}],
)

GPT-6 Astra: обзор

ПараметрЗначение
Идентификатор моделиgpt-6-astra
Контекстное окно1 050 000 токенов
Макс. вывод128 000 токенов
Дата отсечки знаний30 апреля 2026
МодальностиВход: текст, изображения. Выход: текст
Поддерживаемые endpoint'ыChat Completions, Responses, Batch
Не поддерживаетсяRealtime, Assistants, fine-tuning
Reasoning effortlow, medium, high, xhigh, max
Rate limits (Tier 5)15 000 RPM / 40 000 000 TPM
ДоступностьOpenAI API, Azure Foundry, AWS Bedrock, OpenRouter

В Enterprise-воркспейсах Astra отключена по умолчанию. Администратор должен включить её вручную, иначе API-вызовы не пройдут.

Тарифы: Standard, Batch, Fast mode и длинный контекст

Все цены — за миллион токенов. Источник: страница цен OpenAI (дата обращения — 9 сентября 2026).

ТарифInputCached inputCache writeOutput
Standard$10.00$1.00$12.50$50.00
Standard, длинный контекст (свыше 272K input)$20.00$2.00$25.00$75.00
Batch / Flex$5.00$0.50—$25.00
Batch, длинный контекст$10.00$1.00—$37.50
Fast mode$20.00$2.00—$100.00
Fast mode, длинный контекст$40.00$4.00—$150.00

Fast mode обеспечивает до 2-кратного ускорения обработки при 2-кратной цене. Для EU data residency endpoint'ов Fast mode недоступен.

Сравнение цен Astra и GPT-5.6 Sol

МодельInputCached inputOutput
GPT-6 Astra$10.00$1.00$50.00
GPT-5.6 Sol (промо до 21 ноября 2026)$4.00$0.40$20.00
GPT-5.6 Terra$2.00$0.20$12.00
GPT-5.6 Luna$0.20$0.02$1.20

Astra стоит в 2,5 раза дороже Sol по промо-тарифу — и на входе, и на выходе. Промо-тариф Sol действует как минимум до 21 ноября 2026.

Пример расчёта стоимости

Agent-запуск: одно чтение кодовой базы в 200 000 токенов, повторное использование как кэшированного префикса в 30 вызовах, суммарный вывод 60 000 токенов:

  • Astra: $2.00 за первое чтение + $5.80 (29 кэшированных чтений по $0.20) + $3.00 вывод = около $10.80
  • Sol (промо): $0.80 за первое чтение + $2.32 (29 кэшированных чтений по $0.08) + $1.20 вывод = около $4.32

Соотношение стабильно — 2,5x. Вопрос, который нужно проверить на практике: завершает ли Astra задачу меньшим количеством вызовов и меньшим объёмом выходных токенов.

Reasoning effort: пять уровней, без «none»

GPT-5.6 Sol предлагал шесть уровней effort — от none до max. У Astra их пять:

УровеньТипичное применение
lowПростая выгрузка данных, классификация, форматирование
mediumОбычный чат, суммаризация, code review
highМногошаговый анализ, сложная генерация кода
xhighИсследовательский уровень reasoning, multi-hop задачи
maxПроизводительность уровня бенчмарков, длинные agent-задачи

none и minimal удалены. Если ваша Sol-интеграция использует один из них — замените на low и проверьте результат. Остальные уровни оставляйте как есть.

Для routing-экономики это существенно. Astra на low — всё равно reasoning-модель; режима «классическое завершение» нет. Для механических задач (классификация, выгрузка, простое форматирование) направлять запросы в GPT-5.6 Terra или Luna остаётся самым выгодным вариантом.

# Astra с medium effort
response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input="Сделай саммари этого changelog в трёх пунктах.",
)

На max время до первого токена измеряется в минутах, а не в секундах. Сначала рассчитайте допустимую задержку, потом бюджет на токены.

Ломающие изменения по сравнению с GPT-5.6 Sol

Перед заменой строки модели проверьте эти пункты:

  1. temperature и top_p удалены. Передача любого из них вернёт ошибку. Уберите их из payload запроса.

  2. logprobs удалён. Astra не поддерживает. Если logprobs нужен для оценки уверенности — сохраните fallback на Sol или Terra.

  3. none и minimal reasoning effort удалены. Используйте low.

  4. prompt_cache_retention переименован. Теперь поле называется prompt_cache_options.ttl. Обновите конфигурацию кэша.

  5. Tool calling требует Responses API. Chat Completions обрабатывает только текст. Для вызова функций и встроенных инструментов (web search, code interpreter, file search, computer use) нужен endpoint /v1/responses.

  6. Enterprise: требуется включение администратором. Astra отключена по умолчанию в Enterprise-воркспейсах. Администратор должен включить модель, иначе вызовы не пройдут.

  7. Safety monitoring может прервать работу. Astra содержит runtime safety-фильтры, которые останавливают задачу при подозрительной активности. OpenAI признаёт, что фильтры сейчас срабатывают и на легитимных задачах. Учтите это, прежде чем подключать Astra к pipeline, работающему без присмотра.

# До (Sol)
response = client.chat.completions.create(
    model="gpt-5.6-sol",
    messages=[{"role": "user", "content": "Привет"}],
    temperature=0.7,       # Для Astra убрать
    top_p=0.9,             # Для Astra убрать
)

# После (Astra через Responses API)
response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input=[{"role": "user", "content": "Привет"}],
)

Маршрутизация через нескольких провайдеров

GPT-6 Astra доступна через три endpoint'а провайдеров и сторонние шлюзы. У каждой платформы свой идентификатор модели:

ПровайдерEndpointModel ID
OpenAIhttps://api.openai.com/v1/gpt-6-astra
Azure Foundryhttps://<resource>.openai.azure.com/Определяется при деплое
AWS BedrockРегиональный endpoint Bedrockopenai.gpt-6-astra-v1:0 (проверяйте документацию Bedrock)
OpenRouterhttps://openrouter.ai/api/v1/openai/gpt-6-astra
TheRouterhttps://api.therouter.ai/v1/openai/gpt-6-astra

Через TheRouter вы указываете Astra как основную модель и настраиваете fallback. Если endpoint OpenAI возвращает 5xx или упирается в rate limit, TheRouter автоматически направляет запрос на резервную модель — другую GPT-модель, Claude или любого OpenAI-совместимого провайдера.

from openai import OpenAI

# Маршрутизация через TheRouter с автоматическим fallback
client = OpenAI(
    api_key="YOUR_THEROUTER_KEY",
    base_url="https://api.therouter.ai/v1",
)

response = client.chat.completions.create(
    model="openai/gpt-6-astra",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Объясни prompt caching в одном абзаце."},
    ],
)

Подробности о настройке fallback моделей — в документации TheRouter.

Частые ошибки и решения

ОшибкаПричинаРешение
temperature is not supportedПередан temperature для AstraУдалите temperature из запроса
top_p is not supportedПередан top_p для AstraУдалите top_p из запроса
logprobs is not supportedЗапрошены logprobsУдалите logprobs; при необходимости используйте fallback на Sol/Terra
Invalid reasoning effortУказан none или minimalЗамените на low
model_not_found (Enterprise)Astra не включена в воркспейсеПопросите администратора включить модель
rate_limit_exceededДостигнут лимит тарифного уровняПроверьте свой уровень rate limit, повысьте или добавьте retry-логику
context_length_exceededInput превысил 1 050 000 токеновСократите вход или разбейте на несколько вызовов

Чек-лист перед выходом в продакшен

Перед деплоем GPT-6 Astra:

  • Удалите неподдерживаемые параметры. Уберите temperature, top_p, logprobs из всех запросов к Astra.
  • Обновите reasoning effort. Замените none/minimal на low. Проверьте задержку при выбранном уровне.
  • Перенесите tool calling на Responses API. Вызов функций работает через /v1/responses, не через Chat Completions.
  • Обновите конфигурацию кэша. Переименуйте prompt_cache_retention в prompt_cache_options.ttl.
  • Заложите бюджет на длинный контекст. Запросы со свыше 272K входных токенов стоят вдвое дороже. Отслеживайте размер входа.
  • Настройте fallback routing. Укажите резервную модель (Sol, Terra или кросс-провайдерную альтернативу) для rate limit'ов и сбоев.
  • Протестируйте safety-фильтры. Прогоните Astra через свои автоматизированные pipeline'ы и убедитесь, что она не останавливается на легитимных задачах.
  • Включите в Enterprise-воркспейсе. Попросите администратора активировать модель до того, как код пойдёт в продакшен.
  • Сравните стоимость с Sol. Запустите ваши типичные нагрузки на обеих моделях. Сравнивайте общую стоимость за задачу, а не цену за токен.

Заметка по интеграции с TheRouter

На момент написания GPT-6 Astra ещё не добавлена на страницу моделей TheRouter. Когда она появится, вы сможете маршрутизировать к ней через стандартный идентификатор openai/gpt-6-astra. А пока можно настроить пользовательский маршрут, указывающий на endpoint OpenAI напрямую.

Routing и fallback TheRouter особенно полезны для Astra из-за 2,5-кратного роста цены по сравнению с Sol. Конфигурация, отправляющая простые задачи на Terra или Luna и резервирующая Astra для сложного reasoning, позволит заметно снизить общие расходы, сохранив доступ к frontier-уровню для задач, которые его требуют.

Источники

Помощь и контакты