Выбор модели для coding-агента (осень 2026): маршрутизация V4.1 Flash, Qwen3.8-Flash, Fable 5.1 и Astra через Cursor, Claude Code и Codex
В сентябре 2026 вышли четыре новые модели для coding-агентов — DeepSeek V4.1 Flash, Qwen3.8-Flash, Claude Fable 5.1 и GPT-6 Astra. Мы сравнили цены, бенчмарки и поведение маршрутизации, а затем написали конфигурации для Cursor, Claude Code и Codex.
Три месяца назад мы опубликовали сравнение моделей для coding-агентов, где рассматривали Kimi K2.7 Code, Claude Opus 4.8, DeepSeek V4 Pro и GLM-5.1. С тех пор каждая модель из того списка либо получила обновлённую версию, либо была дополнена более дешёвой и быстрой альтернативой. Если вы настроили свой coding-агент в июне, API, которые он вызывает, уже работают на других моделях.
В этой статье мы рассматриваем четыре модели, вышедшие в сентябре 2026 года. Именно они, по нашим оценкам, будут обрабатывать основной объём трафика coding-агентов до конца года: DeepSeek V4.1 Flash, Qwen3.8-Flash, Claude Fable 5.1 и GPT-6 Astra. Мы проверили поведение маршрутизации, собрали цены из официальной документации и написали конфигурации для Cursor, Claude Code и Codex.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Источники: DeepSeek Pricing, получено 2026-09-16; DashScope Pricing, получено 2026-09-16; Anthropic Pricing, получено 2026-09-16; OpenAI Pricing, получено 2026-09-16; BenchLM DeepSeek V4.1 Flash, получено 2026-09-16; BenchLM GPT-6 Astra, получено 2026-09-16; Anthropic Fable 5.1, получено 2026-09-16; OpenAI GPT-6 Astra, получено 2026-09-16.
Сводная таблица
| Параметр | DeepSeek V4.1 Flash | Qwen3.8-Flash | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| Провайдер | DeepSeek | Alibaba / DashScope | Anthropic | OpenAI |
| Дата выхода | 10 сентября 2026 | 26 августа 2026 | 1 сентября 2026 | 3 сентября 2026 |
| Архитектура | Causal Encoder-Decoder MoE (8B input / 16B output activation) | Проприетарная (open-weight вариант: Qwen3.8-Flash-Next) | Проприетарная | Проприетарная |
| Вход / Выход за 1M токенов | $0.15 / $0.60 (off-peak) | ~$0.02 / $0.065 (¥0.15/¥0.47 через DashScope) | $10.00 / $50.00 | $10.00 / $50.00 |
| Кэш (вход) | $0.003 (off-peak) | ~$0.002 (implicit cache) | $0.25 | $1.00 |
| Контекстное окно | 1M | 1M | 200K | 1M (short) / 2M (long) |
| Макс. выход | 384K | 8K (по умолчанию) | 128K | 100K |
| Режим рассуждения | Включён по умолчанию, переключаемый | Non-thinking и thinking | Extended thinking | Chain-of-thought |
| Tool calls | Да | Да | Да | Да (programmatic) |
| Зрение | Да | Да (multimodal) | Да | Да |
| Лучший для | Массовый coding при минимальной стоимости | Сверхдешёвая маршрутизация через DashScope, multimodal | Максимальная надёжность длинных цепочек | Frontier-рассуждения, programmatic tool calling |
Что изменилось с июня
В нашем июньском сравнении модели стоили от $0.95 до $25.00 за миллион выходных токенов. Осенняя линейка разделилась на два ценовых уровня.
Бюджетный уровень. DeepSeek V4.1 Flash и Qwen3.8-Flash оценивают выход ниже $1/MTok. V4.1 Flash использует новую архитектуру Causal Encoder-Decoder, которая сжимает KV Cache до 1/4 HBM, что делает длинные agent-сессии значительно дешевле. Qwen3.8-Flash через DashScope стоит примерно ¥0.47/MTok за выход (~$0.065) — самая низкая цена, которую мы видели для модели с режимом рассуждения и multimodal-поддержкой.
Frontier-уровень. Claude Fable 5.1 и GPT-6 Astra стоят одинаково — $10/$50 за вход/выход. Разница в экономике кэширования и поведении агента. Fable 5.1 снизил стоимость чтения кэша до $0.25/MTok (на 75% дешевле Fable 5), что существенно удешевляет повторное использование длинных system prompt. GPT-6 Astra ввёл programmatic tool calling и встроенный V8-sandbox для исполнения кода.
Для большинства задач coding-агентов бюджетный уровень теперь справляется с тем, что три месяца назад делал только frontier. Frontier-модели оправдывают свою наценку только на задачах с длинными цепочками (100+ tool calls за сессию) или когда нужна максимальная точность с первой попытки.
Одна задача, четыре модели
Все четыре модели принимают запросы в OpenAI-совместимом формате. Вот один и тот же coding-запрос, отправленный каждой модели.
DeepSeek V4.1 Flash:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "You are a senior Python developer."},
{"role": "user", "content": "Refactor this function to use async/await..."},
],
)
Qwen3.8-Flash через DashScope:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-flash",
messages=[
{"role": "system", "content": "You are a senior Python developer."},
{"role": "user", "content": "Refactor this function to use async/await..."},
],
)
Claude Fable 5.1 через Anthropic:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_ANTHROPIC_KEY",
base_url="https://api.anthropic.com/v1/",
)
response = client.chat.completions.create(
model="claude-fable-5-1-20260901",
messages=[
{"role": "system", "content": "You are a senior Python developer."},
{"role": "user", "content": "Refactor this function to use async/await..."},
],
)
GPT-6 Astra через OpenAI:
from openai import OpenAI
client = OpenAI(api_key="YOUR_OPENAI_KEY")
response = client.chat.completions.create(
model="gpt-6-astra",
messages=[
{"role": "system", "content": "You are a senior Python developer."},
{"role": "user", "content": "Refactor this function to use async/await..."},
],
)
Код SDK одинаковый, различаются только base_url и model. В этом вся суть OpenAI-совместимой маршрутизации — меняете upstream, клиент остаётся прежним.
Сравнение цен
Для coding-агентов цена критична, потому что агентные сессии сжигают токены в 10–100 раз быстрее обычного чата. Все цифры из официальных страниц.
| Модель | Вход (off-peak) | Вход (peak) | Выход (off-peak) | Выход (peak) | Кэш (вход) | Batch |
|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | $0.15/MTok | $0.30/MTok | $0.60/MTok | $1.20/MTok | $0.003/MTok (off-peak) | — |
| Qwen3.8-Flash (DashScope, Beijing) | ~$0.021/MTok (¥0.15) | — | ~$0.065/MTok (¥0.47) | — | ~$0.002/MTok (implicit cache) | 50% batch |
| Claude Fable 5.1 | $10.00/MTok | — | $50.00/MTok | — | $0.25/MTok | — |
| GPT-6 Astra (short ctx) | $10.00/MTok | — | $50.00/MTok | — | $1.00/MTok | 50% batch |
Для сессии в 50K токенов (10K вход, 40K выход) расходы примерно такие:
- Qwen3.8-Flash: $0.003
- DeepSeek V4.1 Flash: $0.026 (off-peak)
- Claude Fable 5.1: $2.10
- GPT-6 Astra: $2.10
Разница между бюджетным и frontier-уровнем составляет примерно 80 раз. Командам, которые запускают тысячи агентных сессий в день, бюджетный уровень подходит по умолчанию. Frontier оправдан только при жёстких требованиях к точности.
Бенчмарки
Единого бенчмарка для coding-агентов, который покрывает все четыре модели на одном наборе, не существует. Мы собрали подтверждённые данные из официальных анонсов и сторонних оценщиков.
| Бенчмарк | DeepSeek V4.1 Flash | Qwen3.8-Flash | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | — | — | 52.6% | 64.6% |
| DeepSWE v1.1 | — | — | — | 74.1% |
| CyberGym | 88.1 | — | — | — |
| Frontend Code Arena | 1586 (High mode) | — | — | — |
| Прирост над предшественником | — | — | ~45% vs Fable 5 (vendor) | ~7 pts vs Sol (vendor) |
V4.1 Flash лидирует на кибербезопасности и frontend-кодинге. GPT-6 Astra впереди на frontier science и agentic coding. Fable 5.1 сообщает о 45% улучшении на агентных задачах по сравнению с Fable 5, но абсолютные показатели на тех же наборах, что Astra, не публикует. Qwen3.8-Flash фокусируется на multimodal и общем рассуждении, а не на coding-специфичных оценках.
Практический вывод: для coding-агентов с сессиями длиннее 100 шагов Fable 5.1 и Astra надёжнее. Для массовых коротких сессий (до 20 шагов) V4.1 Flash даёт сопоставимое качество за долю стоимости.
Настройка маршрутизации для coding-инструментов
Cursor
Cursor поддерживает пользовательский OpenAI base URL. Для маршрутизации через TheRouter:
- Откройте Settings > Models > OpenAI API Key
- Введите ваш TheRouter API key
- Установите Override OpenAI Base URL на
https://api.therouter.ai/v1 - Добавьте модели:
deepseek-flash,qwen3.8-flash,claude-fable-5-1-20260901,gpt-6-astra
Cursor отправляет все запросы через настроенный base URL. TheRouter маршрутизирует каждый model ID к соответствующему upstream-провайдеру с fallback при недоступности основного.
Claude Code
Claude Code использует переменную окружения ANTHROPIC_BASE_URL:
export ANTHROPIC_BASE_URL="https://api.therouter.ai/anthropic"
export ANTHROPIC_API_KEY="your-therouter-key"
Claude Code воспринимает шлюз как Anthropic-совместимый endpoint и отправляет beta-заголовки и поля запроса так же, как при прямом подключении к api.anthropic.com. TheRouter транслирует и маршрутизирует на уровне шлюза.
Codex
Codex читает openai_base_url из ~/.codex/config.toml:
[providers.openai]
openai_base_url = "https://api.therouter.ai/v1"
api_key = "your-therouter-key"
Укажите модель в проектной или глобальной конфигурации. Codex отправляет стандартные OpenAI-запросы через указанный base URL.
Стратегия fallback-маршрутизации
Настоящая ценность маршрутизации не в выборе одной модели, а в цепочке. Рекомендуемая fallback-конфигурация на осень 2026:
- Основная: DeepSeek V4.1 Flash — минимальная стоимость, обрабатывает 80% задач
- Fallback 1: Qwen3.8-Flash через DashScope — вторая по дешевизне, независимый провайдер, другой failure domain
- Fallback 2: Claude Fable 5.1 — frontier-качество, когда бюджетные модели не справляются
- Fallback 3: GPT-6 Astra — альтернативный frontier-провайдер, failure domain отдельный от Anthropic
TheRouter поддерживает fallback-маршрутизацию, которая автоматически пробует следующего провайдера при 5xx, rate limit или timeout от основного. Ваш coding-агент не видит сбоя — он получает ответ от доступного провайдера.
Когда выбирать каждую модель
DeepSeek V4.1 Flash:
- Тысячи агентных сессий в день
- Задачи с чёткой областью (один файл, ясные инструкции)
- Нужен 1M-контекст для анализа больших кодовых баз
- Важна цена в off-peak (ночные пакетные прогоны)
Qwen3.8-Flash:
- Нужен абсолютно минимальный ценник
- В рабочем процессе есть визуальные входы (скриншоты, диаграммы, UI-макеты)
- Работаете из Китая или уже используете DashScope
- Нужен multimodal-анализ в составе coding-процесса
Claude Fable 5.1:
- Нужна максимальная надёжность на длинных многошаговых сессиях
- Задачи с комплексным рефакторингом нескольких файлов
- Важна экономика кэширования (переиспользование system prompt)
- Уже используете Claude Code и хотите нативную интеграцию
GPT-6 Astra:
- Нужен frontier-уровень рассуждения на сложных задачах
- Важен programmatic tool calling (V8 sandbox)
- Нужно максимальное контекстное окно (до 2M с long context)
- Хотите нативную интеграцию с Codex
Итог
В сентябре 2026 рынок моделей для coding-агентов разделился надвое. Бюджетные модели справляются с production-задачами при стоимости выхода ниже $0.07/MTok, а frontier-модели с ценником $50/MTok оправдывают себя только на самых сложных многошаговых задачах. Правильный ответ для большинства команд — не одна модель, а fallback-цепочка, которая начинает с дешёвого и эскалирует по мере необходимости.
Если вы настроили свой coding-агент в июне 2026, пора перенастроить. Модели обновились. Цены изменились. Маршрутизация тоже должна измениться.
Внутренние ссылки: Провайдер DeepSeek | Провайдер DashScope | Провайдер Anthropic | Провайдер OpenAI | Руководство по fallback-маршрутизации | Июньское сравнение coding-агентов | Настройка Cursor с пользовательским API