← Все статьи

Выбор модели для coding-агента (осень 2026): маршрутизация V4.1 Flash, Qwen3.8-Flash, Fable 5.1 и Astra через Cursor, Claude Code и Codex

В сентябре 2026 вышли четыре новые модели для coding-агентов — DeepSeek V4.1 Flash, Qwen3.8-Flash, Claude Fable 5.1 и GPT-6 Astra. Мы сравнили цены, бенчмарки и поведение маршрутизации, а затем написали конфигурации для Cursor, Claude Code и Codex.

· TheRouter

Три месяца назад мы опубликовали сравнение моделей для coding-агентов, где рассматривали Kimi K2.7 Code, Claude Opus 4.8, DeepSeek V4 Pro и GLM-5.1. С тех пор каждая модель из того списка либо получила обновлённую версию, либо была дополнена более дешёвой и быстрой альтернативой. Если вы настроили свой coding-агент в июне, API, которые он вызывает, уже работают на других моделях.

В этой статье мы рассматриваем четыре модели, вышедшие в сентябре 2026 года. Именно они, по нашим оценкам, будут обрабатывать основной объём трафика coding-агентов до конца года: DeepSeek V4.1 Flash, Qwen3.8-Flash, Claude Fable 5.1 и GPT-6 Astra. Мы проверили поведение маршрутизации, собрали цены из официальной документации и написали конфигурации для Cursor, Claude Code и Codex.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Источники: DeepSeek Pricing, получено 2026-09-16; DashScope Pricing, получено 2026-09-16; Anthropic Pricing, получено 2026-09-16; OpenAI Pricing, получено 2026-09-16; BenchLM DeepSeek V4.1 Flash, получено 2026-09-16; BenchLM GPT-6 Astra, получено 2026-09-16; Anthropic Fable 5.1, получено 2026-09-16; OpenAI GPT-6 Astra, получено 2026-09-16.

Сводная таблица

ПараметрDeepSeek V4.1 FlashQwen3.8-FlashClaude Fable 5.1GPT-6 Astra
ПровайдерDeepSeekAlibaba / DashScopeAnthropicOpenAI
Дата выхода10 сентября 202626 августа 20261 сентября 20263 сентября 2026
АрхитектураCausal Encoder-Decoder MoE (8B input / 16B output activation)Проприетарная (open-weight вариант: Qwen3.8-Flash-Next)ПроприетарнаяПроприетарная
Вход / Выход за 1M токенов$0.15 / $0.60 (off-peak)~$0.02 / $0.065 (¥0.15/¥0.47 через DashScope)$10.00 / $50.00$10.00 / $50.00
Кэш (вход)$0.003 (off-peak)~$0.002 (implicit cache)$0.25$1.00
Контекстное окно1M1M200K1M (short) / 2M (long)
Макс. выход384K8K (по умолчанию)128K100K
Режим рассужденияВключён по умолчанию, переключаемыйNon-thinking и thinkingExtended thinkingChain-of-thought
Tool callsДаДаДаДа (programmatic)
ЗрениеДаДа (multimodal)ДаДа
Лучший дляМассовый coding при минимальной стоимостиСверхдешёвая маршрутизация через DashScope, multimodalМаксимальная надёжность длинных цепочекFrontier-рассуждения, programmatic tool calling

Что изменилось с июня

В нашем июньском сравнении модели стоили от $0.95 до $25.00 за миллион выходных токенов. Осенняя линейка разделилась на два ценовых уровня.

Бюджетный уровень. DeepSeek V4.1 Flash и Qwen3.8-Flash оценивают выход ниже $1/MTok. V4.1 Flash использует новую архитектуру Causal Encoder-Decoder, которая сжимает KV Cache до 1/4 HBM, что делает длинные agent-сессии значительно дешевле. Qwen3.8-Flash через DashScope стоит примерно ¥0.47/MTok за выход (~$0.065) — самая низкая цена, которую мы видели для модели с режимом рассуждения и multimodal-поддержкой.

Frontier-уровень. Claude Fable 5.1 и GPT-6 Astra стоят одинаково — $10/$50 за вход/выход. Разница в экономике кэширования и поведении агента. Fable 5.1 снизил стоимость чтения кэша до $0.25/MTok (на 75% дешевле Fable 5), что существенно удешевляет повторное использование длинных system prompt. GPT-6 Astra ввёл programmatic tool calling и встроенный V8-sandbox для исполнения кода.

Для большинства задач coding-агентов бюджетный уровень теперь справляется с тем, что три месяца назад делал только frontier. Frontier-модели оправдывают свою наценку только на задачах с длинными цепочками (100+ tool calls за сессию) или когда нужна максимальная точность с первой попытки.

Одна задача, четыре модели

Все четыре модели принимают запросы в OpenAI-совместимом формате. Вот один и тот же coding-запрос, отправленный каждой модели.

DeepSeek V4.1 Flash:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "system", "content": "You are a senior Python developer."},
        {"role": "user", "content": "Refactor this function to use async/await..."},
    ],
)

Qwen3.8-Flash через DashScope:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DASHSCOPE_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[
        {"role": "system", "content": "You are a senior Python developer."},
        {"role": "user", "content": "Refactor this function to use async/await..."},
    ],
)

Claude Fable 5.1 через Anthropic:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_ANTHROPIC_KEY",
    base_url="https://api.anthropic.com/v1/",
)

response = client.chat.completions.create(
    model="claude-fable-5-1-20260901",
    messages=[
        {"role": "system", "content": "You are a senior Python developer."},
        {"role": "user", "content": "Refactor this function to use async/await..."},
    ],
)

GPT-6 Astra через OpenAI:

from openai import OpenAI

client = OpenAI(api_key="YOUR_OPENAI_KEY")

response = client.chat.completions.create(
    model="gpt-6-astra",
    messages=[
        {"role": "system", "content": "You are a senior Python developer."},
        {"role": "user", "content": "Refactor this function to use async/await..."},
    ],
)

Код SDK одинаковый, различаются только base_url и model. В этом вся суть OpenAI-совместимой маршрутизации — меняете upstream, клиент остаётся прежним.

Сравнение цен

Для coding-агентов цена критична, потому что агентные сессии сжигают токены в 10–100 раз быстрее обычного чата. Все цифры из официальных страниц.

МодельВход (off-peak)Вход (peak)Выход (off-peak)Выход (peak)Кэш (вход)Batch
DeepSeek V4.1 Flash$0.15/MTok$0.30/MTok$0.60/MTok$1.20/MTok$0.003/MTok (off-peak)—
Qwen3.8-Flash (DashScope, Beijing)~$0.021/MTok (¥0.15)—~$0.065/MTok (¥0.47)—~$0.002/MTok (implicit cache)50% batch
Claude Fable 5.1$10.00/MTok—$50.00/MTok—$0.25/MTok—
GPT-6 Astra (short ctx)$10.00/MTok—$50.00/MTok—$1.00/MTok50% batch

Для сессии в 50K токенов (10K вход, 40K выход) расходы примерно такие:

  • Qwen3.8-Flash: $0.003
  • DeepSeek V4.1 Flash: $0.026 (off-peak)
  • Claude Fable 5.1: $2.10
  • GPT-6 Astra: $2.10

Разница между бюджетным и frontier-уровнем составляет примерно 80 раз. Командам, которые запускают тысячи агентных сессий в день, бюджетный уровень подходит по умолчанию. Frontier оправдан только при жёстких требованиях к точности.

Бенчмарки

Единого бенчмарка для coding-агентов, который покрывает все четыре модели на одном наборе, не существует. Мы собрали подтверждённые данные из официальных анонсов и сторонних оценщиков.

БенчмаркDeepSeek V4.1 FlashQwen3.8-FlashClaude Fable 5.1GPT-6 Astra
Terminal-Bench-Science 0.1——52.6%64.6%
DeepSWE v1.1———74.1%
CyberGym88.1———
Frontend Code Arena1586 (High mode)———
Прирост над предшественником——~45% vs Fable 5 (vendor)~7 pts vs Sol (vendor)

V4.1 Flash лидирует на кибербезопасности и frontend-кодинге. GPT-6 Astra впереди на frontier science и agentic coding. Fable 5.1 сообщает о 45% улучшении на агентных задачах по сравнению с Fable 5, но абсолютные показатели на тех же наборах, что Astra, не публикует. Qwen3.8-Flash фокусируется на multimodal и общем рассуждении, а не на coding-специфичных оценках.

Практический вывод: для coding-агентов с сессиями длиннее 100 шагов Fable 5.1 и Astra надёжнее. Для массовых коротких сессий (до 20 шагов) V4.1 Flash даёт сопоставимое качество за долю стоимости.

Настройка маршрутизации для coding-инструментов

Cursor

Cursor поддерживает пользовательский OpenAI base URL. Для маршрутизации через TheRouter:

  1. Откройте Settings > Models > OpenAI API Key
  2. Введите ваш TheRouter API key
  3. Установите Override OpenAI Base URL на https://api.therouter.ai/v1
  4. Добавьте модели: deepseek-flash, qwen3.8-flash, claude-fable-5-1-20260901, gpt-6-astra

Cursor отправляет все запросы через настроенный base URL. TheRouter маршрутизирует каждый model ID к соответствующему upstream-провайдеру с fallback при недоступности основного.

Claude Code

Claude Code использует переменную окружения ANTHROPIC_BASE_URL:

export ANTHROPIC_BASE_URL="https://api.therouter.ai/anthropic"
export ANTHROPIC_API_KEY="your-therouter-key"

Claude Code воспринимает шлюз как Anthropic-совместимый endpoint и отправляет beta-заголовки и поля запроса так же, как при прямом подключении к api.anthropic.com. TheRouter транслирует и маршрутизирует на уровне шлюза.

Codex

Codex читает openai_base_url из ~/.codex/config.toml:

[providers.openai]
openai_base_url = "https://api.therouter.ai/v1"
api_key = "your-therouter-key"

Укажите модель в проектной или глобальной конфигурации. Codex отправляет стандартные OpenAI-запросы через указанный base URL.

Стратегия fallback-маршрутизации

Настоящая ценность маршрутизации не в выборе одной модели, а в цепочке. Рекомендуемая fallback-конфигурация на осень 2026:

  1. Основная: DeepSeek V4.1 Flash — минимальная стоимость, обрабатывает 80% задач
  2. Fallback 1: Qwen3.8-Flash через DashScope — вторая по дешевизне, независимый провайдер, другой failure domain
  3. Fallback 2: Claude Fable 5.1 — frontier-качество, когда бюджетные модели не справляются
  4. Fallback 3: GPT-6 Astra — альтернативный frontier-провайдер, failure domain отдельный от Anthropic

TheRouter поддерживает fallback-маршрутизацию, которая автоматически пробует следующего провайдера при 5xx, rate limit или timeout от основного. Ваш coding-агент не видит сбоя — он получает ответ от доступного провайдера.

Когда выбирать каждую модель

DeepSeek V4.1 Flash:

  • Тысячи агентных сессий в день
  • Задачи с чёткой областью (один файл, ясные инструкции)
  • Нужен 1M-контекст для анализа больших кодовых баз
  • Важна цена в off-peak (ночные пакетные прогоны)

Qwen3.8-Flash:

  • Нужен абсолютно минимальный ценник
  • В рабочем процессе есть визуальные входы (скриншоты, диаграммы, UI-макеты)
  • Работаете из Китая или уже используете DashScope
  • Нужен multimodal-анализ в составе coding-процесса

Claude Fable 5.1:

  • Нужна максимальная надёжность на длинных многошаговых сессиях
  • Задачи с комплексным рефакторингом нескольких файлов
  • Важна экономика кэширования (переиспользование system prompt)
  • Уже используете Claude Code и хотите нативную интеграцию

GPT-6 Astra:

  • Нужен frontier-уровень рассуждения на сложных задачах
  • Важен programmatic tool calling (V8 sandbox)
  • Нужно максимальное контекстное окно (до 2M с long context)
  • Хотите нативную интеграцию с Codex

Итог

В сентябре 2026 рынок моделей для coding-агентов разделился надвое. Бюджетные модели справляются с production-задачами при стоимости выхода ниже $0.07/MTok, а frontier-модели с ценником $50/MTok оправдывают себя только на самых сложных многошаговых задачах. Правильный ответ для большинства команд — не одна модель, а fallback-цепочка, которая начинает с дешёвого и эскалирует по мере необходимости.

Если вы настроили свой coding-агент в июне 2026, пора перенастроить. Модели обновились. Цены изменились. Маршрутизация тоже должна измениться.


Внутренние ссылки: Провайдер DeepSeek | Провайдер DashScope | Провайдер Anthropic | Провайдер OpenAI | Руководство по fallback-маршрутизации | Июньское сравнение coding-агентов | Настройка Cursor с пользовательским API

Помощь и контакты