← Все статьи

GPT-6.1 Sol vs Claude Sonnet 5 vs Qwen3.8-Flash: битва моделей среднего уровня за маршрутизацию

Три модели среднего уровня по почти одинаковой цене. GPT-6.1 Sol ($2/$10), Claude Sonnet 5 ($2/$10) и Qwen3.8-Flash (~$0.16/$0.47) сравниваются по кодированию, рассуждению, агентным задачам и стоимости — с рекомендациями по маршрутизации для каждого типа нагрузки.

· TheRouter

Три модели среднего уровня сейчас стоят примерно одинаково, и каждая претендует на результаты выше своей ценовой категории. GPT-6.1 Sol и Claude Sonnet 5 стоят по $2 за миллион входных токенов и $10 за миллион выходных. Qwen3.8-Flash на DashScope обходится примерно в ¥1.00/¥3.00 за миллион токенов (около $0.16/$0.47 по текущему курсу), что значительно дешевле. Вопрос маршрутизации не в том, какая модель «лучше» в абстрактном смысле, а в том, какая модель должна обрабатывать какую нагрузку в вашем pipeline и позволит ли объединение всех трёх за одним endpoint сэкономить деньги без потери качества.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Сводная таблица

ПараметрGPT-6.1 SolClaude Sonnet 5Qwen3.8-Flash
ПровайдерOpenAIAnthropicAlibaba Cloud / DashScope
Model IDgpt-6.1-solclaude-sonnet-5qwen3.8-flash
Дата запуска29 сентября 202630 июня 2026Сентябрь 2026
Цена за вход (на 1M токенов)$2.00$2.00~$0.16 (¥1.00)
Цена кэшированного входа$0.10$0.20~$0.05 (¥0.30, промо)
Цена за выход (на 1M токенов)$10.00$10.00~$0.47 (¥3.00)
Контекстное окно272K+ (длинный контекст по двойной цене)1M токенов1M токенов
Макс. выходНе раскрыт128K токеновНе раскрыт
Мультимодальный входVisionVisionVision, audio
Batch APIСкидка 50%Скидка 50%DashScope batch доступен
Основные сильные стороныКодирование, computer use, профессиональная работаРасширенное рассуждение, агентное кодирование, tool useЭкономичность, мультимодальность, задачи на китайском языке

Источники цен: OpenAI API pricing (получено 2026-10-01), Anthropic pricing (получено 2026-10-01), DashScope model pricing (получено 2026-10-01). Цены Qwen3.8-Flash в USD — приблизительная конвертация из RMB по курсу ~¥7.1/$1.

GPT-6.1 Sol: интеллект уровня Astra по цене Sol

OpenAI позиционирует GPT-6.1 Sol как модель с «интеллектом, близким к Astra, за пятую часть цены». На DeepSWE v1.1, который оценивает сложные задачи программной инженерии в реальных кодовых базах, GPT-6.1 Sol достигает результатов GPT-6 Astra, превышая GPT-6 Sol на 6.4 процентных пункта при меньших затратах на reasoning (по данным OpenAI).

На AutomationBench GPT-6.1 Sol обходит Claude Opus 5.5 на 2.2 процентных пункта при среднем уровне reasoning, стоимость за задачу — примерно треть. На OSWorld 2.0 модель превосходит GPT-6 Sol на 7 процентных пунктов в задачах computer use.

Кэшированный вход по $0.10 за миллион токенов — ключевая цифра. Это на 50% дешевле кэшированной цены GPT-6 Sol и на 95% дешевле стандартной входной цены GPT-6.1 Sol. Для агентных workflow, где длинный системный промпт повторно используется между запросами, фактическая стоимость завершённой задачи оказывается значительно ниже номинальной.

from openai import OpenAI

client = OpenAI()

response = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[
        {"role": "system", "content": "You are a senior software engineer."},
        {"role": "user", "content": "Refactor this module to use dependency injection."},
    ],
)
print(response.choices[0].message.content)

Claude Sonnet 5: действующий чемпион среднего уровня

Anthropic выпустила Claude Sonnet 5 30 июня 2026 года по той же цене $2/$10, заменив Sonnet 4.6 ($3/$15) более дешёвой и более способной моделью. Sonnet 5 предлагает контекстное окно в 1M токенов и выход до 128K токенов — максимальный подтверждённый размер выхода среди трёх моделей в этом сравнении.

По данным Anthropic, Sonnet 5 приближается к Opus 4.8 по нескольким агентным бенчмаркам при существенно меньшей стоимости. Режим расширенного рассуждения (extended thinking) позволяет модели проработать многошаговую цепочку рассуждений перед генерацией финального ответа, а развитые возможности tool use делают её сильным кандидатом для сложных агентных workflow.

Контекстное окно в 1M токенов имеет практическое преимущество для задач вроде рефакторинга на уровне всей кодовой базы, анализа длинных документов или code review нескольких файлов, когда весь релевантный контекст должен уместиться в один запрос.

from openai import OpenAI

client = OpenAI(
    api_key="ANTHROPIC_API_KEY",
    base_url="https://api.anthropic.com/v1/",
)

response = client.chat.completions.create(
    model="claude-sonnet-5",
    messages=[
        {"role": "user", "content": "Review this pull request for security issues."},
    ],
)
print(response.choices[0].message.content)

Qwen3.8-Flash: выброс по стоимости

Qwen3.8-Flash занимает принципиально иную позицию в ландшафте среднего уровня. При цене около $0.16/$0.47 за миллион токенов на DashScope она обходится примерно в 10–20 раз дешевле GPT-6.1 Sol или Claude Sonnet 5 при том же объёме токенов. Модель поддерживает контекстное окно в 1M токенов и нативный мультимодальный вход, включая vision и audio.

Компромисс очевиден: Qwen3.8-Flash не дотягивает до GPT-6.1 Sol или Claude Sonnet 5 на бенчмарках фронтирного кодирования. Но для нагрузок, где правильное инженерное решение — «достаточное качество при радикально меньшей стоимости» (массовая классификация, извлечение контента, перевод, суммаризация, задачи на китайском языке), — это рациональный выбор маршрутизации.

DashScope предоставляет Qwen3.8-Flash через OpenAI-совместимый endpoint, поэтому код интеграции следует той же схеме:

from openai import OpenAI

client = OpenAI(
    api_key="DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[
        {"role": "user", "content": "Summarize this document in three bullet points."},
    ],
)
print(response.choices[0].message.content)

Бенчмарки: что говорят цифры

Все бенчмарки ниже — данные вендоров, если не указано иное. По состоянию на момент написания не существует единого независимого теста, который покрывает все три модели в одинаковых условиях.

БенчмаркGPT-6.1 SolClaude Sonnet 5Qwen3.8-Flash
DeepSWE v1.1 (кодирование)На уровне GPT-6 Astra (OpenAI)Нет прямых данныхНет прямых данных
AutomationBench (агентные задачи)+2.2pp выше Opus 5.5 (OpenAI)Нет прямых данныхНет прямых данных
OSWorld 2.0 (computer use)+7pp выше GPT-6 Sol (OpenAI)Нет прямых данныхНет прямых данных
GDP.pdf (проф. документы)Приближается к Astra (OpenAI)Нет прямых данныхНет прямых данных
Агентное кодированиеСильное (OpenAI)Приближается к Opus 4.8 (Anthropic)Не позиционируется как фронтирная
Контекстное окно272K+1M1M
Задачи на китайском языкеХорошоХорошоОптимизирована

Пробелы в кросс-модельном покрытии бенчмарков реальны. OpenAI публикует данные GPT-6.1 Sol относительно Astra и Opus 5.5 на конкретных бенчмарках. Данные Anthropic по Sonnet 5 сравнивают с Opus 4.8 и GPT-6 Sol (предыдущее поколение). Бенчмарки Alibaba по Qwen3.8-Flash сфокусированы внутри семейства Qwen. Делать прямые выводы о рейтинге между тремя моделями нужно с осторожностью.

Tool calling и агентные возможности

Все три модели поддерживают function/tool calling через свои API:

  • GPT-6.1 Sol поддерживает нативный интерфейс tool calling OpenAI с параллельными вызовами функций. Результаты AutomationBench указывают на сильную производительность в многошаговых бизнес-процессах.
  • Claude Sonnet 5 поддерживает протокол tool use Anthropic с расширенным рассуждением для проработки сложных цепочек reasoning перед вызовом инструментов. Окно выхода в 128K токенов полезно для агентов, которым нужны длинные структурированные ответы.
  • Qwen3.8-Flash поддерживает tool calling через OpenAI-совместимый интерфейс DashScope. Модель справляется с вызовом инструментов, но позиционируется на экономичность, а не на фронтирные агентные возможности.

Для агентных pipeline, которые последовательно вызывают несколько инструментов, стоимость завершённой задачи важнее стоимости за токен. Кэшированный вход GPT-6.1 Sol по $0.10 здесь даёт заметное преимущество: агентный диалог, который повторно использует длинный системный промпт через 20 вызовов инструментов, платит кэшированную цену за системный промпт начиная со второго вызова.

Региональная доступность и пути доступа

ПараметрGPT-6.1 SolClaude Sonnet 5Qwen3.8-Flash
Прямой APIOpenAI APIAnthropic APIDashScope (Alibaba Cloud)
Облачный маркетплейсAzure (через Foundry)AWS Bedrock, GCP VertexAlibaba Cloud Model Studio
OpenAI-совместимый endpointНативныйЧерез переопределение base URLЧерез совместимый режим DashScope
Региональные endpointСША, ЕС (с data residency)США, ЕСПекин, Шанхай, Сингапур и др.
Доступ из материкового КитаяТребует proxy или gatewayТребует proxy или gatewayНативный

Для команд в Китае Qwen3.8-Flash через DashScope — путь с наименьшим сопротивлением. Для команд, которым нужен data residency в ЕС или США, GPT-6.1 Sol и Claude Sonnet 5 предлагают региональные варианты обработки.

Экономика кэширования

Кэширование промптов существенно меняет фактическую стоимость запроса для всех трёх моделей:

Параметр кэшированияGPT-6.1 SolClaude Sonnet 5Qwen3.8-Flash
Цена кэшированного входа$0.10/M$0.20/M~$0.05/M (промо)
Скидка за кэширование (от стандартного входа)95%90%~70%
Стоимость записи в кэш$2.50/MВключена в цену входаВключена (DashScope context cache)

Кэшированный вход GPT-6.1 Sol по $0.10 за миллион токенов — самый низкий в абсолютном выражении среди трёх. Для нагрузок с интенсивным повторным использованием промптов — агентные циклы, few-shot классификаторы с фиксированными примерами, batch-обработка с общим контекстом — именно скидка за кэширование определяет реальную оптимизацию затрат.

При этом базовая цена Qwen3.8-Flash настолько низка, что даже некэшированная цена ($0.16/M вход) меньше кэшированной цены GPT-6.1 Sol ($0.10/M). Если единственная цель — минимизация стоимости без ограничений по качеству, математика всегда в пользу Qwen3.8-Flash.

Матрица решений: маршрутизация по типу нагрузки

Выбирайте GPT-6.1 Sol, когда:

  • Задача включает сложное кодирование, программную инженерию или code review, где нужно качество уровня Astra
  • В pipeline входят задачи computer use или автоматизации десктопа
  • Интенсивное кэширование промптов делает $0.10/M кэшированную цену фактической ценой
  • Основная нагрузка — анализ профессиональных документов (финансовые, юридические, медицинские PDF)
  • Нужны максимальные бенчмарки кодирования в среднем ценовом сегменте

Выбирайте Claude Sonnet 5, когда:

  • Перед вызовом инструментов нужно расширенное рассуждение и многошаговый reasoning
  • Контекстное окно должно превышать 272K токенов (Sonnet 5 поддерживает 1M)
  • Нужны длинные структурированные выходы до 128K токенов
  • Нагрузка — в основном агентные задачи со сложными цепочками tool use
  • Предпочтение отдаётся характеристикам безопасности и alignment Anthropic

Выбирайте Qwen3.8-Flash, когда:

  • Стоимость — главное ограничение, а «достаточное» качество приемлемо
  • Основная задача — понимание, генерация или перевод на китайском языке
  • Нужен мультимодальный вход, включая audio
  • Нагрузка работает на больших объёмах (классификация, извлечение, суммаризация), где 10–20-кратная экономия накапливается
  • Важны латентность и data residency в материковом Китае

Комбинируйте все три, когда:

  • Разные части pipeline имеют разные компромиссы по качеству и стоимости
  • Qwen3.8-Flash используется для сортировки/классификации, а сложные элементы направляются в GPT-6.1 Sol или Claude Sonnet 5

Конфигурация TheRouter: кросс-провайдерная маршрутизация среднего уровня

TheRouter маршрутизирует OpenAI-совместимые запросы через настроенных провайдеров. Конфигурация среднего уровня может сопоставлять типы нагрузок с моделью, которая лучше всего подходит для каждого компромисса:

providers:
  openai:
    base_url: https://api.openai.com/v1
    api_key: ${OPENAI_API_KEY}
  anthropic:
    base_url: https://api.anthropic.com/v1/
    api_key: ${ANTHROPIC_API_KEY}
  dashscope:
    base_url: https://dashscope.aliyuncs.com/compatible-mode/v1
    api_key: ${DASHSCOPE_API_KEY}

routes:
  - model: gpt-6.1-sol
    providers: [openai]
  - model: claude-sonnet-5
    providers: [anthropic]
  - model: qwen3.8-flash
    providers: [dashscope]

Код приложения указывает на один endpoint TheRouter, каждая модель маршрутизируется к своему нативному провайдеру. Настройка fallback между моделями на близких ценах (GPT-6.1 Sol и Claude Sonnet 5) проста, если оба провайдера настроены и протестированы.

Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.

  • Одна валюта (USD) — конвертация на дату публикации с указанием курса.
  • Разделяйте input/output — никогда не публикуйте смешанную цифру.
  • Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
  • Указывайте тарифы длинного контекста — они часто скачут вверх.

Частые вопросы

GPT-6.1 Sol действительно на уровне GPT-6 Astra?

OpenAI заявляет, что GPT-6.1 Sol «почти достигает» Astra в кодировании, computer use и профессиональной работе при пятой части цены. На DeepSWE v1.1 модель достигает результатов Astra. На OSWorld 2.0 при максимальном reasoning уступает Astra на 2.1 процентных пункта. На Terminal-Bench Science Astra по-прежнему лидирует с 68.1%. «Близко к Astra» точно описывает ситуацию на большинстве бенчмарков; Astra сохраняет преимущество на самых сложных научных задачах.

Почему Qwen3.8-Flash настолько дешевле?

Qwen3.8-Flash — меньшая модель, оптимизированная для эффективности, работающая на инфраструктуре Alibaba Cloud. Ценообразование DashScope отражает как меньшие вычислительные требования модели, так и конкурентную стратегию Alibaba на китайском облачном рынке. Текущие цены промоционные и могут измениться.

Можно ли использовать все три модели через один SDK?

Да. Все три предоставляют OpenAI-совместимые endpoint для chat completions (Anthropic и DashScope через переопределение base URL). OpenAI Python/Node SDK работает со всеми тремя при смене base_url и api_key. TheRouter может абстрагировать эту разницу, чтобы код приложения не управлял несколькими клиентами.

Какая модель лучше для tool calling?

GPT-6.1 Sol и Claude Sonnet 5 обе сильны в tool calling. GPT-6.1 Sol набрал больше, чем Opus 5.5, на AutomationBench в многоинструментальных workflow. Расширенное рассуждение Claude Sonnet 5 позволяет проработать сложные цепочки reasoning перед выполнением действий. Qwen3.8-Flash поддерживает tool calling, но не позиционируется как фронтирная агентная модель.

Стоит ли переходить с GPT-6 Sol на GPT-6.1 Sol?

Если вы уже используете GPT-6 Sol по $2/$10, GPT-6.1 Sol — прямое обновление по той же цене с улучшенными бенчмарками по всем направлениям и на 50% более дешёвым кэшированным входом ($0.10 vs $0.20). Model ID меняется с gpt-6-sol на gpt-6.1-sol; API-интерфейс идентичен.

Как сравниваются затраты на длинный контекст?

GPT-6.1 Sol взимает двойную цену за входы свыше 272K токенов ($4.00/M вход, $15.00/M выход). Claude Sonnet 5 и Qwen3.8-Flash поддерживают 1M контекста по стандартным ценам. Для нагрузок с длинным контекстом свыше 272K токенов Sonnet 5 или Qwen3.8-Flash могут быть выгоднее по стоимости, в зависимости от требований к качеству.

Модели, упомянутые в статье

Помощь и контакты