← Все статьи

Запуски AI-моделей в сентябре 2026: полный API changelog для GPT-6, Fable, Gemini 3.8 и V4.1

Пять крупных текстовых моделей вышли за первые две недели сентября 2026. На этой справочной странице собраны спецификации, цены и ссылки на отдельный routing-гайд для каждой модели.

· TheRouter

За первые десять дней сентября 2026 года вышли пять крупных текстовых моделей. Если вы управляете API routing-слоем, каждая из них меняет расчёты хотя бы одного routing-решения. Эта справочная страница собирает все пять запусков в одном месте с ценами, спецификациями и ссылками на подробные гайды.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Хронология запусков сентября 2026

ДатаМодельПровайдерInput $/MOutput $/MКонтекстОсобенности
1 сентClaude Fable 5.1Anthropic$10.00$50.001MСкидка 75% на cache-read ($2.50/M)
1 сентClaude Mythos 5.1Anthropic———Только для исследований; API недоступен
2 сентGemini 3.8 FlashGoogle$0.75$3.751MПромо-цена до 31 декабря 2026
2 сентQwen3.8-Max-0902Alibaba / DashScope~$1.69~$5.071MSnapshot-обновление; улучшены coding-бенчмарки
4 сентGPT-6 AstraOpenAI$10.00$50.00256KMax output 128K; cached input $1.00/M
10 сентDeepSeek V4.1 FlashDeepSeek$0.15$1.10128KOff-peak; peak $0.30/$2.20

Указаны стандартные API-цены. Промо-, batch- и off-peak-скидки описаны в разделах ниже.

GPT-6 Astra

GPT-6 Astra — flagship-модель OpenAI, вышедшая 4 сентября 2026 года. Контекст 256K, максимальный output 128K token, цена $10/$50 за миллион token.

Основные характеристики

  • Model ID: gpt-6-astra
  • Контекст: 256 000 token
  • Max output: 128 000 token
  • Цена: $10/M input, $50/M output, $1/M cached input
  • Batch: $5/M input, $25/M output (скидка 50%)
  • Effort levels: Low, Medium, High (масштабирование reasoning-вычислений)

Рекомендации по routing. GPT-6 Astra в 13 раз дороже по output, чем Gemini 3.8 Flash. Направляйте сюда сложные рассуждения, многошаговые agentic-процессы и задачи, требующие большого output-окна. Для массовой классификации, извлечения и суммаризации flash-уровень выгоднее.

Изменения по сравнению с GPT-5.6 Sol. Появился контроль effort level и увеличено output-окно. Programmatic tool calling из Sol сохранён. Цена выросла с $7.50/$30 до $10/$50.

Подробный routing-гайд: GPT-6 Astra API routing guide.

Claude Fable 5.1

Anthropic выпустила Claude Fable 5.1 1 сентября вместе с исследовательской Mythos 5.1. Fable 5.1 сохраняет цену Fable 5 ($10/$50), но добавляет существенную скидку на cache-read.

Основные характеристики

  • Model ID: claude-fable-5-1-20260901
  • Контекст: 1 000 000 token
  • Max output: 128 000 token (с extended thinking)
  • Цена: $10/M input, $50/M output
  • Cache read: $2.50/M (скидка 75%)
  • Cache write: $12.50/M
  • Batch: $5/M input, $25/M output (скидка 50%)

Рекомендации по routing. Скидка 75% на cache-read — главная фишка. При повторяющихся системных промптах, RAG-контекстах или многоходовых диалогах со стабильными префиксами эффективная стоимость input падает с $10/M до $2.50/M. Fable 5.1 обходит GPT-6 Astra по стоимости cached input при той же цене output.

Изменения по сравнению с Fable 5. Улучшены бенчмарки coding и agentic-задач. Скидка cache-read — новая. Лимиты extended thinking output увеличены. Model ID изменён с claude-fable-5-20260601 на claude-fable-5-1-20260901.

Подробности cache-экономики: Claude Fable 5.1 routing guide.

Gemini 3.8 Flash

Google выпустила Gemini 3.8 Flash 2 сентября, через три недели после 3.7 Flash. Промо-цена та же, модель нацелена на cost-effective продакшен.

Основные характеристики

  • Model ID: gemini-3.8-flash
  • Контекст: 1 000 000 token
  • Max output: 65 536 token
  • Цена: $0.75/M input, $3.75/M output (промо до 31 декабря 2026)
  • Thinking mode: поддерживается

Рекомендации по routing. За $0.75/$3.75 Gemini 3.8 Flash и DeepSeek V4.1 Flash находятся на одном flash-уровне. Output в 13 раз дешевле, чем у GPT-6 Astra. Направляйте сюда объёмные задачи, где latency и стоимость важнее максимальной глубины рассуждений.

Изменения по сравнению с 3.7 Flash. Улучшены бенчмарки coding и STEM. Цена не изменилась. Контекст остался 1M. Добавлены возможности computer-use (см. Gemini 3.5 Flash computer use guide).

Полный routing-гайд: Gemini 3.8 Flash routing guide.

DeepSeek V4.1 Flash

DeepSeek выпустил V4.1 Flash 10 сентября — дистиллированный вариант V4.1, оптимизированный на скорость и стоимость.

Основные характеристики

  • Model ID: deepseek-chat (авто-routing на V4.1 Flash при доступности)
  • Контекст: 128 000 token
  • Max output: 16 384 token
  • Off-peak: $0.15/M input, $1.10/M output
  • Peak: $0.30/M input, $2.20/M output
  • Cache hit: $0.003/M input (off-peak), $0.007/M (peak)

Рекомендации по routing. Самый дешёвый вариант в этом changelog — $0.15/$1.10 off-peak. Модель peak/off-peak добавляет измерение планирования. Если ваша нагрузка может работать в off-peak окна, это самый дешёвый путь для массовых задач. Cache-hit за $0.003/M — фактически бесплатно.

Изменения по сравнению с V4 Flash. Улучшены бенчмарки coding. Снижены цены input и output. Дистилляция из V4.1 дала лучшую скорость при сопоставимом качестве.

Подробности интеграции: DeepSeek V4.1 Flash complete guide.

Qwen3.8-Max-0902

Alibaba выпустила новый snapshot Qwen3.8-Max 2 сентября — первое обновление flagship-модели с 2.4 триллиона параметров после запуска 3 августа.

Основные характеристики

  • Model ID: qwen3.8-max-2026-09-02 (также qwen3.8-max)
  • Контекст: 1 000 000 token
  • Max output: 16 384 token (32 768 с thinking mode)
  • Цена: ~¥12/M input, ¥36/M output ($1.69/$5.07)
  • Thinking mode: через enable_thinking: true

Рекомендации по routing. Qwen3.8-Max-0902 — наиболее выгодная flagship-модель для операторов, которым нужно покрытие DashScope. Цена между flash-уровнем и западным frontier-уровнем. Если вы маршрутизируете через OpenAI-совместимый endpoint DashScope, менять код не нужно — snapshot обновляется автоматически при использовании unversioned model ID qwen3.8-max.

Изменения по сравнению с запуском 3 августа. Улучшена производительность coding, SWE-Bench score повысился. Цена и API-surface не изменились.

Полный гайд: Qwen3.8-Max API guide.

Сравнительная таблица

GPT-6 AstraFable 5.1Gemini 3.8 FlashV4.1 FlashQwen3.8-Max-0902
Input $/M$10.00$10.00$0.75$0.15~$1.69
Output $/M$50.00$50.00$3.75$1.10~$5.07
Cache read$1.00/M$2.50/M$0.19/M$0.003/M—
Контекст256K1M1M128K1M
Max output128K128K65K16K16K
Batch50%50%———
OpenAI-совместНативныйДаДаДаДа (DashScope)

Как читать таблицу. Frontier-уровень (GPT-6 Astra, Fable 5.1) стоит в 13 раз дороже по output, чем flash-уровень (Gemini 3.8 Flash, V4.1 Flash). Qwen3.8-Max между ними. Routing-конфигурация должна отражать этот разрыв.

Дерево решений по routing

  1. Задача требует глубокого многошагового рассуждения? GPT-6 Astra или Claude Fable 5.1. Если нагрузка содержит повторяющийся контекст, Fable 5.1 выгоднее за счёт cache-read.
  2. Массовое извлечение, классификация, суммаризация? Gemini 3.8 Flash или DeepSeek V4.1 Flash. V4.1 Flash дешевле, но с peak/off-peak и меньшим контекстом.
  3. Нужен DashScope или китайский провайдер? Qwen3.8-Max через OpenAI-совместимый endpoint DashScope.
  4. Нужна fallback-цепочка? Рабочий вариант: primary gpt-6-astra → fallback claude-fable-5-1-20260901 → last-resort gemini-3.8-flash.

Подробная настройка fallback: LLM API fallback routing guide.

Что не вошло в обзор

  • Claude Mythos 5.1 вышла вместе с Fable 5.1, но остаётся в research-доступе без публичного API. Мы напишем обзор, когда API откроется.
  • Provider-specific бенчмарки. Каждый вендор отчитывается на разных eval-наборах. В этом changelog мы не пытались нормализовать бенчмарки. Подробности — в отдельных гайдах по ссылкам выше.
  • TheRouter live-доступность моделей. Model ID отражают upstream-доступность. Проверяйте список моделей вашего routing-шлюза для актуальной информации.

FAQ

Какая модель сентября 2026 лучше всего подходит для coding agent?

GPT-6 Astra и Claude Fable 5.1 показывают высокие результаты в coding-бенчмарках. Если ваш agent использует длинные повторяющиеся системные промпты, cache-read Fable 5.1 сделает его дешевле в долгосрочной перспективе. Qwen3.8-Max-0902 — сильный вариант для покрытия DashScope. Подробное сравнение: coding agent routing comparison.

DeepSeek V4.1 Flash готов к продакшену?

V4.1 Flash запущен 10 сентября как публичный релиз. Поддерживает OpenAI-совместимый формат. Основные ограничения для продакшена — peak/off-peak ценообразование и 16K max output. Подробности: DeepSeek V4.1 Flash guide.

Чем отличается Gemini 3.8 Flash от DeepSeek V4.1 Flash?

Оба на flash-уровне, но у Gemini 3.8 Flash контекст 1M, а у V4.1 Flash — 128K. Gemini стоит $0.75/$3.75 (промо), V4.1 Flash — $0.15/$1.10 (off-peak). V4.1 Flash дешевле, у Gemini больше контекст. Подробности: GPT-6 Astra vs Gemini 3.8 Flash.

Когда закончится промо-цена Gemini 3.8 Flash?

Промо-цена Google $0.75/$3.75 за миллион token действует до 31 декабря 2026. После этого вернётся стандартная цена. Актуальные данные: Google pricing page.

Можно ли вызывать все пять моделей одним OpenAI SDK клиентом?

Да. Все пять поддерживают OpenAI-совместимый формат запросов. Меняйте base_url на endpoint провайдера (или routing-шлюза) и параметр model. Подробности по endpoint: OpenAI-compatible API providers.

Помощь и контакты