← Все статьи

Qwen3.8-Max vs Claude Opus 5.5 vs GPT-6.1 Sol: три модели frontier-класса, три ценовых сегмента — сравнение для routing

Сравнение трёх frontier-моделей Q4 2026: Qwen3.8-Max (~$1.65/$5), Claude Opus 5.5 ($4/$20) и GPT-6.1 Sol ($2/$10). Бенчмарки, pricing, контекстные окна, стратегии кэширования и routing.

· updated 2026-10-03· TheRouter

Три модели определяют frontier API-reasoning во втором полугодии 2026 года. Qwen3.8-Max от Alibaba (2.4T MoE, запуск 2 августа), Claude Opus 5.5 от Anthropic (запуск 22 сентября) и GPT-6.1 Sol от OpenAI (запуск 29 сентября). Каждая занимает свой ценовой сегмент и имеет свои сильные стороны. Мы собрали цифры, чтобы помочь вам решить, куда направлять каждый тип нагрузки.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Сводная таблица

ПараметрQwen3.8-MaxClaude Opus 5.5GPT-6.1 Sol
ПровайдерAlibaba / DashScopeAnthropicOpenAI
Input / Output (за 1M токенов)~$1.65 / $5 (¥12 / ¥36 через DashScope)$4 / $20$2 / $10
Cached input~$0.83 / 1M (¥6, context cache)$0.20 / 1M (cache read)$0.10 / 1M
Контекстное окно1M токенов1M токенов1.05M токенов
Макс. output128K (настраивается до 1M)128K100K
Архитектура2.4T MoE, ~95B активныхЗакрытаяЗакрытая
Open weightsApache 2.0НетНет
BenchLM overall72.12/100 (#16)—77.58/100 (#9)
Terminal-Bench 2.186.6% (vendor)——
DeepSWE56.6% (vendor)—71.9% (vendor)
MMMU-Pro82.3% (vendor)—86.0% (AA)
Batch APIДа (DashScope)ДаДа (скидка 50%)
Режим reasoningThinking mode (enable_thinking)Adaptive thinkingВстроенный reasoning
MultimodalТекст + изображения + видео + аудиоТекст + изображенияТекст + изображения

Данные от производителей, если не отмечено AA (Artificial Analysis). Прочерк означает отсутствие публичных данных на момент написания.

Ландшафт frontier после отмены Astra

GPT-6 Astra остаётся самой мощной моделью OpenAI, но при $10/$50 за 1M токенов она недоступна для большинства продуктовых нагрузок. GPT-6.1 Sol закрывает бо́льшую часть разрыва в возможностях за одну пятую стоимости Astra. Одновременно Opus 5.5 стал на 20% дешевле Opus 5, а Qwen3.8-Max предлагает frontier-уровень по ценам DashScope в юанях. Практический frontier никогда не был настолько конкурентным.

Для команд, которые направляют API-вызовы через OpenAI-compatible gateway, вопрос уже не в том, какая модель «лучше», а какая модель даёт лучший результат за доллар на конкретной нагрузке.

Pricing в деталях

Стандартные API-цены

МодельInputCached InputOutputBatch InputBatch Output
Qwen3.8-Max~$1.65/1M~$0.83/1M~$5/1M~$0.83/1M~$2.50/1M
Claude Opus 5.5$4/1M$0.20/1M$20/1M$2/1M$10/1M
GPT-6.1 Sol$2/1M$0.10/1M$10/1M$1/1M$5/1M

DashScope pricing для Qwen3.8-Max составляет ¥12/¥36 за 1M токенов (input/output). По текущему курсу (~¥7.25/$1) это примерно $1.65/$5. DashScope также предлагает context caching API по 50% от input-цены.

GPT-6.1 Sol имеет самую низкую стоимость cached input ($0.10/1M), что делает его особенно выгодным для нагрузок с общими system prompt или повторяющимся контекстом. У Claude Opus 5.5 cache-read упал на 60% по сравнению с Opus 5 и составляет $0.20/1M.

Стоимость запроса на 10K токенов (1K input, 9K output)

МодельСтоимость запросаМесячная стоимость (100K запросов)
Qwen3.8-Max~$0.047~$4,650
GPT-6.1 Sol~$0.092~$9,200
Claude Opus 5.5~$0.184~$18,400

На output-тяжёлых нагрузках Opus 5.5 обходится примерно в 4 раза дороже Qwen3.8-Max и в 2 раза дороже GPT-6.1 Sol. При включённом кэшировании на input-тяжёлых нагрузках разрыв заметно сокращается.

Сравнение бенчмарков

Код и software engineering

БенчмаркQwen3.8-MaxGPT-6.1 SolИсточник
Terminal-Bench 2.186.6%—Qwen blog
DeepSWE56.6%71.9%Vendor
SWE-bench Pro67.7%—Qwen blog
FrontierSWE73.5%—Qwen blog
SWE-bench (Vals)85.6%—Vals AI
LiveCodeBench (Vals)87.9%—Vals AI
PaperBench93.0%—Qwen blog

GPT-6.1 Sol показывает более высокий результат на DeepSWE (71.9% vs 56.6%), тогда как Qwen3.8-Max лидирует на Terminal-Bench 2.1 и серии SWE-bench. Прямого сравнения на одном и том же наборе тестов пока мало.

Агентные задачи и автоматизация

БенчмаркQwen3.8-MaxGPT-6.1 SolИсточник
AutomationBench27.3%36.1%Vendor
OSWorld-Verified86.1%—Qwen blog
WebArena-Verified66.8%—Qwen blog
AndroidWorld85.3%—Qwen blog

Qwen3.8-Max покрывает 61/645 бенчмарков на BenchLM (против 28/645 у GPT-6.1 Sol). Более широкое покрытие облегчает оценку по разным задачам, но означает, что общий балл GPT-6.1 Sol (77.58 vs 72.12) основан на более узкой и потенциально более выгодной выборке.

Reasoning и знания

GPT-6.1 Sol демонстрирует сильные результаты на оценках Artificial Analysis: AA-LCR 83.0%, AA-HLE 52.9%, MMMU-Pro 86.0%. Qwen3.8-Max набирает 82.3% на MMMU-Pro (vendor) и 56.2% на HLE w/ tools.

Публичных бенчмарков Claude Opus 5.5 от Anthropic на момент написания немного. Anthropic заявляет, что Opus 5.5 тратит на 40% меньше токенов, чем Opus 5 на типичных нагрузках, благодаря adaptive thinking, который подстраивает глубину reasoning под сложность задачи.

Контекстные окна и стратегии кэширования

Все три модели предлагают контекстные окна размером 1M+ токенов, но механизмы кэширования различаются.

Qwen3.8-Max использует явный context caching API от DashScope. Вы создаёте cache-объект, ссылаетесь на него в запросах, а cached-токены оплачиваются по 50% от input-цены. Срок жизни cache настраивается.

Claude Opus 5.5 использует автоматическое prompt caching. Любой prefix из 2,048+ токенов, который встречается в последовательных запросах, кэшируется автоматически. Cache read стоит $0.20/1M, cache write $5/1M. Opus 5.5 снизил cache-read на 60% по сравнению с Opus 5.

GPT-6.1 Sol использует автоматическое prompt caching аналогично GPT-6 Sol. Cached input стоит $0.10/1M, cache write $2.50/1M. Long-context запросы (выше порога short context) оплачиваются по удвоенному тарифу для input и output.

Для нагрузок с большими общими system prompt GPT-6.1 Sol ($0.10/1M cached reads) обходится дешевле всех. Для нагрузок, где нужен явный контроль жизненного цикла cache, подход DashScope даёт больше предсказуемости.

Региональная доступность и провайдеры

МодельОсновной endpointOpenAI-compatibleДругие провайдеры
Qwen3.8-MaxDashScope (Китай + intl)ДаOpenRouter, SiliconFlow
Claude Opus 5.5Anthropic APIНет (Messages API)AWS Bedrock, GCP Vertex, OpenRouter
GPT-6.1 SolOpenAI APIДа (native)Azure Foundry, AWS Bedrock, OpenRouter

Qwen3.8-Max и GPT-6.1 Sol поддерживают формат OpenAI /v1/chat/completions нативно. Claude Opus 5.5 использует Messages API от Anthropic, но OpenRouter и gateway-сервисы предоставляют OpenAI-compatible обёртки.

Для команд, работающих в Китае, Qwen3.8-Max через DashScope — единственный вариант без трансграничных API-вызовов. Команды с требованиями по data residency в Северной Америке или Европе могут использовать GPT-6.1 Sol через Azure Foundry или Opus 5.5 через AWS Bedrock.

Код интеграции

Qwen3.8-Max через DashScope

from openai import OpenAI

client = OpenAI(
    api_key="your-dashscope-key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen-max",
    messages=[{"role": "user", "content": "Объясните компромиссы между MoE и dense архитектурами."}],
    max_tokens=4096
)
print(response.choices[0].message.content)

Claude Opus 5.5 через Anthropic

from anthropic import Anthropic

client = Anthropic(api_key="your-anthropic-key")

response = client.messages.create(
    model="claude-opus-5-5-20260922",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Объясните компромиссы между MoE и dense архитектурами."}]
)
print(response.content[0].text)

GPT-6.1 Sol через OpenAI

from openai import OpenAI

client = OpenAI(api_key="your-openai-key")

response = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Объясните компромиссы между MoE и dense архитектурами."}],
    max_tokens=4096
)
print(response.choices[0].message.content)

Матрица выбора

Выбирайте Qwen3.8-Max, если:

  • Бюджет на первом месте, а нужно frontier-качество
  • Нагрузка на coding/agent-задачи, где Qwen сильна (Terminal-Bench 86.6%, SWE-bench 85.6%)
  • Нужен multimodal input (изображения + видео + аудио) в одной модели
  • Вы работаете в Китае или нужна нативная интеграция с DashScope
  • Open weights важны для compliance, fine-tuning или self-hosting

Выбирайте Claude Opus 5.5, если:

  • Нагрузка выигрывает от adaptive thinking (Opus 5.5 подстраивает compute под задачу, экономя 40% по сравнению с Opus 5 на типичных нагрузках)
  • Нужно сильное следование инструкциям и длинные текстовые генерации
  • Платформа развёртывания — AWS Bedrock или GCP Vertex
  • Вы уже используете Anthropic SDK и экосистему Messages API

Выбирайте GPT-6.1 Sol, если:

  • Нужен интеллект уровня Astra за mid-tier цену ($2/$10)
  • Нагрузка cache-тяжёлая (cached reads за $0.10/1M не имеют конкурентов)
  • Нужна максимально зрелая экосистема (Codex, Responses API, function calling)
  • Важна интеграция через Azure Foundry или Batch API со скидкой 50%
  • Приоритет — производительность на DeepSWE coding (71.9%)

TheRouter: cross-provider frontier routing

При routing OpenAI-compatible запросов через TheRouter можно настроить frontier tier, который выбирает между провайдерами по latency, стоимости или capability.

# Пример: конфигурация frontier-tier routing
routes:
  - name: frontier-reasoning
    models:
      - provider: openai
        model: gpt-6.1-sol
        priority: 1
      - provider: dashscope
        model: qwen-max
        priority: 2
        # Fallback: output в 2.5 раза дешевле, сильный на coding
      - provider: anthropic
        model: claude-opus-5-5-20260922
        priority: 3
        # Premium tier: adaptive thinking для сложного reasoning

TheRouter направляет OpenAI-compatible запросы через настроенных провайдеров и поддерживает routing и fallback между провайдерами/моделями, когда это позволяют живые product-пути. Если GPT-6.1 Sol возвращает 429 или 5xx, запрос переходит к Qwen3.8-Max, сохраняя frontier-качество ответов и избегая простоев.

FAQ

Q: Какая модель лучше всех кодирует? Все три — frontier-уровень. Qwen3.8-Max лидирует на Terminal-Bench 2.1 (86.6%) и SWE-bench Vals (85.6%). GPT-6.1 Sol лидирует на DeepSWE (71.9%). Полного сравнения всех трёх на одном наборе тестов пока нет.

Q: Можно ли использовать OpenAI SDK для всех трёх? Qwen3.8-Max (через DashScope) и GPT-6.1 Sol работают со стандартным OpenAI Python/Node SDK — достаточно поменять base_url и api_key. Claude Opus 5.5 использует собственный SDK Anthropic, но через OpenAI-compatible gateway вроде TheRouter или OpenRouter можно работать и с ним.

Q: Как adaptive thinking в Opus 5.5 влияет на стоимость? По данным Anthropic, Opus 5.5 тратит на 40% меньше токенов, чем Opus 5 на типичных нагрузках, масштабируя глубину reasoning под сложность задачи. Простые задачи потребляют меньше compute, сложные — больше. Цена за токен ($4/$20) на 20% ниже, чем у Opus 5 ($5/$25), а adaptive-поведение дополнительно усиливает экономию.

Q: Qwen3.8-Max действительно open weight? Да. Alibaba опубликовала полную модель Qwen3.8-2.4T-A95B под лицензией Apache 2.0 на Hugging Face. Можно развернуть self-hosted, хотя 2.4T параметров требуют серьёзной GPU-инфраструктуры. Для большинства команд API через DashScope практичнее.

Q: У какой модели самый дешёвый cache read? GPT-6.1 Sol — $0.10/1M токенов. Затем Opus 5.5 — $0.20/1M, Qwen3.8-Max через DashScope context cache — около $0.83/1M.

Q: GPT-6.1 Sol заменит GPT-6 Astra? Нет. GPT-6 Astra остаётся top-tier моделью для максимальных возможностей, особенно на frontier-исследованиях и самых сложных reasoning-задачах. GPT-6.1 Sol позиционируется как near-Astra интеллект за малую долю стоимости, по аналогии с тем, как GPT-5.6 Sol относился к GPT-5.6 Terra.


Источники: OpenAI Pricing (получено 2026-10-03), Anthropic Opus 5.5 launch (получено 2026-10-03), BenchLM Qwen3.8-Max (получено 2026-10-03), BenchLM GPT-6.1 Sol (получено 2026-10-03), Artificial Analysis GPT-6.1 Sol (получено 2026-10-03), OpenRouter Qwen3.8-Max pricing (получено 2026-10-03).

Модели, упомянутые в статье

Помощь и контакты