Запуски AI-моделей в сентябре 2026: полный API changelog для GPT-6, Fable, Gemini 3.8 и V4.1
Пять крупных текстовых моделей вышли за первые две недели сентября 2026. На этой справочной странице собраны спецификации, цены и ссылки на отдельный routing-гайд для каждой модели.
За первые десять дней сентября 2026 года вышли пять крупных текстовых моделей. Если вы управляете API routing-слоем, каждая из них меняет расчёты хотя бы одного routing-решения. Эта справочная страница собирает все пять запусков в одном месте с ценами, спецификациями и ссылками на подробные гайды.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Хронология запусков сентября 2026
| Дата | Модель | Провайдер | Input $/M | Output $/M | Контекст | Особенности |
|---|---|---|---|---|---|---|
| 1 сент | Claude Fable 5.1 | Anthropic | $10.00 | $50.00 | 1M | Скидка 75% на cache-read ($2.50/M) |
| 1 сент | Claude Mythos 5.1 | Anthropic | — | — | — | Только для исследований; API недоступен |
| 2 сент | Gemini 3.8 Flash | $0.75 | $3.75 | 1M | Промо-цена до 31 декабря 2026 | |
| 2 сент | Qwen3.8-Max-0902 | Alibaba / DashScope | ~$1.69 | ~$5.07 | 1M | Snapshot-обновление; улучшены coding-бенчмарки |
| 4 сент | GPT-6 Astra | OpenAI | $10.00 | $50.00 | 256K | Max output 128K; cached input $1.00/M |
| 10 сент | DeepSeek V4.1 Flash | DeepSeek | $0.15 | $1.10 | 128K | Off-peak; peak $0.30/$2.20 |
Указаны стандартные API-цены. Промо-, batch- и off-peak-скидки описаны в разделах ниже.
GPT-6 Astra
GPT-6 Astra — flagship-модель OpenAI, вышедшая 4 сентября 2026 года. Контекст 256K, максимальный output 128K token, цена $10/$50 за миллион token.
Основные характеристики
- Model ID:
gpt-6-astra - Контекст: 256 000 token
- Max output: 128 000 token
- Цена: $10/M input, $50/M output, $1/M cached input
- Batch: $5/M input, $25/M output (скидка 50%)
- Effort levels: Low, Medium, High (масштабирование reasoning-вычислений)
Рекомендации по routing. GPT-6 Astra в 13 раз дороже по output, чем Gemini 3.8 Flash. Направляйте сюда сложные рассуждения, многошаговые agentic-процессы и задачи, требующие большого output-окна. Для массовой классификации, извлечения и суммаризации flash-уровень выгоднее.
Изменения по сравнению с GPT-5.6 Sol. Появился контроль effort level и увеличено output-окно. Programmatic tool calling из Sol сохранён. Цена выросла с $7.50/$30 до $10/$50.
Подробный routing-гайд: GPT-6 Astra API routing guide.
Claude Fable 5.1
Anthropic выпустила Claude Fable 5.1 1 сентября вместе с исследовательской Mythos 5.1. Fable 5.1 сохраняет цену Fable 5 ($10/$50), но добавляет существенную скидку на cache-read.
Основные характеристики
- Model ID:
claude-fable-5-1-20260901 - Контекст: 1 000 000 token
- Max output: 128 000 token (с extended thinking)
- Цена: $10/M input, $50/M output
- Cache read: $2.50/M (скидка 75%)
- Cache write: $12.50/M
- Batch: $5/M input, $25/M output (скидка 50%)
Рекомендации по routing. Скидка 75% на cache-read — главная фишка. При повторяющихся системных промптах, RAG-контекстах или многоходовых диалогах со стабильными префиксами эффективная стоимость input падает с $10/M до $2.50/M. Fable 5.1 обходит GPT-6 Astra по стоимости cached input при той же цене output.
Изменения по сравнению с Fable 5. Улучшены бенчмарки coding и agentic-задач. Скидка cache-read — новая. Лимиты extended thinking output увеличены. Model ID изменён с claude-fable-5-20260601 на claude-fable-5-1-20260901.
Подробности cache-экономики: Claude Fable 5.1 routing guide.
Gemini 3.8 Flash
Google выпустила Gemini 3.8 Flash 2 сентября, через три недели после 3.7 Flash. Промо-цена та же, модель нацелена на cost-effective продакшен.
Основные характеристики
- Model ID:
gemini-3.8-flash - Контекст: 1 000 000 token
- Max output: 65 536 token
- Цена: $0.75/M input, $3.75/M output (промо до 31 декабря 2026)
- Thinking mode: поддерживается
Рекомендации по routing. За $0.75/$3.75 Gemini 3.8 Flash и DeepSeek V4.1 Flash находятся на одном flash-уровне. Output в 13 раз дешевле, чем у GPT-6 Astra. Направляйте сюда объёмные задачи, где latency и стоимость важнее максимальной глубины рассуждений.
Изменения по сравнению с 3.7 Flash. Улучшены бенчмарки coding и STEM. Цена не изменилась. Контекст остался 1M. Добавлены возможности computer-use (см. Gemini 3.5 Flash computer use guide).
Полный routing-гайд: Gemini 3.8 Flash routing guide.
DeepSeek V4.1 Flash
DeepSeek выпустил V4.1 Flash 10 сентября — дистиллированный вариант V4.1, оптимизированный на скорость и стоимость.
Основные характеристики
- Model ID:
deepseek-chat(авто-routing на V4.1 Flash при доступности) - Контекст: 128 000 token
- Max output: 16 384 token
- Off-peak: $0.15/M input, $1.10/M output
- Peak: $0.30/M input, $2.20/M output
- Cache hit: $0.003/M input (off-peak), $0.007/M (peak)
Рекомендации по routing. Самый дешёвый вариант в этом changelog — $0.15/$1.10 off-peak. Модель peak/off-peak добавляет измерение планирования. Если ваша нагрузка может работать в off-peak окна, это самый дешёвый путь для массовых задач. Cache-hit за $0.003/M — фактически бесплатно.
Изменения по сравнению с V4 Flash. Улучшены бенчмарки coding. Снижены цены input и output. Дистилляция из V4.1 дала лучшую скорость при сопоставимом качестве.
Подробности интеграции: DeepSeek V4.1 Flash complete guide.
Qwen3.8-Max-0902
Alibaba выпустила новый snapshot Qwen3.8-Max 2 сентября — первое обновление flagship-модели с 2.4 триллиона параметров после запуска 3 августа.
Основные характеристики
- Model ID:
qwen3.8-max-2026-09-02(такжеqwen3.8-max) - Контекст: 1 000 000 token
- Max output: 16 384 token (32 768 с thinking mode)
- Цена: ~¥12/M input,
¥36/M output ($1.69/$5.07) - Thinking mode: через
enable_thinking: true
Рекомендации по routing. Qwen3.8-Max-0902 — наиболее выгодная flagship-модель для операторов, которым нужно покрытие DashScope. Цена между flash-уровнем и западным frontier-уровнем. Если вы маршрутизируете через OpenAI-совместимый endpoint DashScope, менять код не нужно — snapshot обновляется автоматически при использовании unversioned model ID qwen3.8-max.
Изменения по сравнению с запуском 3 августа. Улучшена производительность coding, SWE-Bench score повысился. Цена и API-surface не изменились.
Полный гайд: Qwen3.8-Max API guide.
Сравнительная таблица
| GPT-6 Astra | Fable 5.1 | Gemini 3.8 Flash | V4.1 Flash | Qwen3.8-Max-0902 | |
|---|---|---|---|---|---|
| Input $/M | $10.00 | $10.00 | $0.75 | $0.15 | ~$1.69 |
| Output $/M | $50.00 | $50.00 | $3.75 | $1.10 | ~$5.07 |
| Cache read | $1.00/M | $2.50/M | $0.19/M | $0.003/M | — |
| Контекст | 256K | 1M | 1M | 128K | 1M |
| Max output | 128K | 128K | 65K | 16K | 16K |
| Batch | 50% | 50% | — | — | — |
| OpenAI-совмест | Нативный | Да | Да | Да | Да (DashScope) |
Как читать таблицу. Frontier-уровень (GPT-6 Astra, Fable 5.1) стоит в 13 раз дороже по output, чем flash-уровень (Gemini 3.8 Flash, V4.1 Flash). Qwen3.8-Max между ними. Routing-конфигурация должна отражать этот разрыв.
Дерево решений по routing
- Задача требует глубокого многошагового рассуждения? GPT-6 Astra или Claude Fable 5.1. Если нагрузка содержит повторяющийся контекст, Fable 5.1 выгоднее за счёт cache-read.
- Массовое извлечение, классификация, суммаризация? Gemini 3.8 Flash или DeepSeek V4.1 Flash. V4.1 Flash дешевле, но с peak/off-peak и меньшим контекстом.
- Нужен DashScope или китайский провайдер? Qwen3.8-Max через OpenAI-совместимый endpoint DashScope.
- Нужна fallback-цепочка? Рабочий вариант: primary
gpt-6-astra→ fallbackclaude-fable-5-1-20260901→ last-resortgemini-3.8-flash.
Подробная настройка fallback: LLM API fallback routing guide.
Что не вошло в обзор
- Claude Mythos 5.1 вышла вместе с Fable 5.1, но остаётся в research-доступе без публичного API. Мы напишем обзор, когда API откроется.
- Provider-specific бенчмарки. Каждый вендор отчитывается на разных eval-наборах. В этом changelog мы не пытались нормализовать бенчмарки. Подробности — в отдельных гайдах по ссылкам выше.
- TheRouter live-доступность моделей. Model ID отражают upstream-доступность. Проверяйте список моделей вашего routing-шлюза для актуальной информации.
FAQ
Какая модель сентября 2026 лучше всего подходит для coding agent?
GPT-6 Astra и Claude Fable 5.1 показывают высокие результаты в coding-бенчмарках. Если ваш agent использует длинные повторяющиеся системные промпты, cache-read Fable 5.1 сделает его дешевле в долгосрочной перспективе. Qwen3.8-Max-0902 — сильный вариант для покрытия DashScope. Подробное сравнение: coding agent routing comparison.
DeepSeek V4.1 Flash готов к продакшену?
V4.1 Flash запущен 10 сентября как публичный релиз. Поддерживает OpenAI-совместимый формат. Основные ограничения для продакшена — peak/off-peak ценообразование и 16K max output. Подробности: DeepSeek V4.1 Flash guide.
Чем отличается Gemini 3.8 Flash от DeepSeek V4.1 Flash?
Оба на flash-уровне, но у Gemini 3.8 Flash контекст 1M, а у V4.1 Flash — 128K. Gemini стоит $0.75/$3.75 (промо), V4.1 Flash — $0.15/$1.10 (off-peak). V4.1 Flash дешевле, у Gemini больше контекст. Подробности: GPT-6 Astra vs Gemini 3.8 Flash.
Когда закончится промо-цена Gemini 3.8 Flash?
Промо-цена Google $0.75/$3.75 за миллион token действует до 31 декабря 2026. После этого вернётся стандартная цена. Актуальные данные: Google pricing page.
Можно ли вызывать все пять моделей одним OpenAI SDK клиентом?
Да. Все пять поддерживают OpenAI-совместимый формат запросов. Меняйте base_url на endpoint провайдера (или routing-шлюза) и параметр model. Подробности по endpoint: OpenAI-compatible API providers.