Qwen3.8-Max vs Claude Opus 5.5 vs GPT-6.1 Sol: три модели frontier-класса, три ценовых сегмента — сравнение для routing
Сравнение трёх frontier-моделей Q4 2026: Qwen3.8-Max (~$1.65/$5), Claude Opus 5.5 ($4/$20) и GPT-6.1 Sol ($2/$10). Бенчмарки, pricing, контекстные окна, стратегии кэширования и routing.
Три модели определяют frontier API-reasoning во втором полугодии 2026 года. Qwen3.8-Max от Alibaba (2.4T MoE, запуск 2 августа), Claude Opus 5.5 от Anthropic (запуск 22 сентября) и GPT-6.1 Sol от OpenAI (запуск 29 сентября). Каждая занимает свой ценовой сегмент и имеет свои сильные стороны. Мы собрали цифры, чтобы помочь вам решить, куда направлять каждый тип нагрузки.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Сводная таблица
| Параметр | Qwen3.8-Max | Claude Opus 5.5 | GPT-6.1 Sol |
|---|---|---|---|
| Провайдер | Alibaba / DashScope | Anthropic | OpenAI |
| Input / Output (за 1M токенов) | ~$1.65 / $5 (¥12 / ¥36 через DashScope) | $4 / $20 | $2 / $10 |
| Cached input | ~$0.83 / 1M (¥6, context cache) | $0.20 / 1M (cache read) | $0.10 / 1M |
| Контекстное окно | 1M токенов | 1M токенов | 1.05M токенов |
| Макс. output | 128K (настраивается до 1M) | 128K | 100K |
| Архитектура | 2.4T MoE, ~95B активных | Закрытая | Закрытая |
| Open weights | Apache 2.0 | Нет | Нет |
| BenchLM overall | 72.12/100 (#16) | — | 77.58/100 (#9) |
| Terminal-Bench 2.1 | 86.6% (vendor) | — | — |
| DeepSWE | 56.6% (vendor) | — | 71.9% (vendor) |
| MMMU-Pro | 82.3% (vendor) | — | 86.0% (AA) |
| Batch API | Да (DashScope) | Да | Да (скидка 50%) |
| Режим reasoning | Thinking mode (enable_thinking) | Adaptive thinking | Встроенный reasoning |
| Multimodal | Текст + изображения + видео + аудио | Текст + изображения | Текст + изображения |
Данные от производителей, если не отмечено AA (Artificial Analysis). Прочерк означает отсутствие публичных данных на момент написания.
Ландшафт frontier после отмены Astra
GPT-6 Astra остаётся самой мощной моделью OpenAI, но при $10/$50 за 1M токенов она недоступна для большинства продуктовых нагрузок. GPT-6.1 Sol закрывает бо́льшую часть разрыва в возможностях за одну пятую стоимости Astra. Одновременно Opus 5.5 стал на 20% дешевле Opus 5, а Qwen3.8-Max предлагает frontier-уровень по ценам DashScope в юанях. Практический frontier никогда не был настолько конкурентным.
Для команд, которые направляют API-вызовы через OpenAI-compatible gateway, вопрос уже не в том, какая модель «лучше», а какая модель даёт лучший результат за доллар на конкретной нагрузке.
Pricing в деталях
Стандартные API-цены
| Модель | Input | Cached Input | Output | Batch Input | Batch Output |
|---|---|---|---|---|---|
| Qwen3.8-Max | ~$1.65/1M | ~$0.83/1M | ~$5/1M | ~$0.83/1M | ~$2.50/1M |
| Claude Opus 5.5 | $4/1M | $0.20/1M | $20/1M | $2/1M | $10/1M |
| GPT-6.1 Sol | $2/1M | $0.10/1M | $10/1M | $1/1M | $5/1M |
DashScope pricing для Qwen3.8-Max составляет ¥12/¥36 за 1M токенов (input/output). По текущему курсу (~¥7.25/$1) это примерно $1.65/$5. DashScope также предлагает context caching API по 50% от input-цены.
GPT-6.1 Sol имеет самую низкую стоимость cached input ($0.10/1M), что делает его особенно выгодным для нагрузок с общими system prompt или повторяющимся контекстом. У Claude Opus 5.5 cache-read упал на 60% по сравнению с Opus 5 и составляет $0.20/1M.
Стоимость запроса на 10K токенов (1K input, 9K output)
| Модель | Стоимость запроса | Месячная стоимость (100K запросов) |
|---|---|---|
| Qwen3.8-Max | ~$0.047 | ~$4,650 |
| GPT-6.1 Sol | ~$0.092 | ~$9,200 |
| Claude Opus 5.5 | ~$0.184 | ~$18,400 |
На output-тяжёлых нагрузках Opus 5.5 обходится примерно в 4 раза дороже Qwen3.8-Max и в 2 раза дороже GPT-6.1 Sol. При включённом кэшировании на input-тяжёлых нагрузках разрыв заметно сокращается.
Сравнение бенчмарков
Код и software engineering
| Бенчмарк | Qwen3.8-Max | GPT-6.1 Sol | Источник |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6% | — | Qwen blog |
| DeepSWE | 56.6% | 71.9% | Vendor |
| SWE-bench Pro | 67.7% | — | Qwen blog |
| FrontierSWE | 73.5% | — | Qwen blog |
| SWE-bench (Vals) | 85.6% | — | Vals AI |
| LiveCodeBench (Vals) | 87.9% | — | Vals AI |
| PaperBench | 93.0% | — | Qwen blog |
GPT-6.1 Sol показывает более высокий результат на DeepSWE (71.9% vs 56.6%), тогда как Qwen3.8-Max лидирует на Terminal-Bench 2.1 и серии SWE-bench. Прямого сравнения на одном и том же наборе тестов пока мало.
Агентные задачи и автоматизация
| Бенчмарк | Qwen3.8-Max | GPT-6.1 Sol | Источник |
|---|---|---|---|
| AutomationBench | 27.3% | 36.1% | Vendor |
| OSWorld-Verified | 86.1% | — | Qwen blog |
| WebArena-Verified | 66.8% | — | Qwen blog |
| AndroidWorld | 85.3% | — | Qwen blog |
Qwen3.8-Max покрывает 61/645 бенчмарков на BenchLM (против 28/645 у GPT-6.1 Sol). Более широкое покрытие облегчает оценку по разным задачам, но означает, что общий балл GPT-6.1 Sol (77.58 vs 72.12) основан на более узкой и потенциально более выгодной выборке.
Reasoning и знания
GPT-6.1 Sol демонстрирует сильные результаты на оценках Artificial Analysis: AA-LCR 83.0%, AA-HLE 52.9%, MMMU-Pro 86.0%. Qwen3.8-Max набирает 82.3% на MMMU-Pro (vendor) и 56.2% на HLE w/ tools.
Публичных бенчмарков Claude Opus 5.5 от Anthropic на момент написания немного. Anthropic заявляет, что Opus 5.5 тратит на 40% меньше токенов, чем Opus 5 на типичных нагрузках, благодаря adaptive thinking, который подстраивает глубину reasoning под сложность задачи.
Контекстные окна и стратегии кэширования
Все три модели предлагают контекстные окна размером 1M+ токенов, но механизмы кэширования различаются.
Qwen3.8-Max использует явный context caching API от DashScope. Вы создаёте cache-объект, ссылаетесь на него в запросах, а cached-токены оплачиваются по 50% от input-цены. Срок жизни cache настраивается.
Claude Opus 5.5 использует автоматическое prompt caching. Любой prefix из 2,048+ токенов, который встречается в последовательных запросах, кэшируется автоматически. Cache read стоит $0.20/1M, cache write $5/1M. Opus 5.5 снизил cache-read на 60% по сравнению с Opus 5.
GPT-6.1 Sol использует автоматическое prompt caching аналогично GPT-6 Sol. Cached input стоит $0.10/1M, cache write $2.50/1M. Long-context запросы (выше порога short context) оплачиваются по удвоенному тарифу для input и output.
Для нагрузок с большими общими system prompt GPT-6.1 Sol ($0.10/1M cached reads) обходится дешевле всех. Для нагрузок, где нужен явный контроль жизненного цикла cache, подход DashScope даёт больше предсказуемости.
Региональная доступность и провайдеры
| Модель | Основной endpoint | OpenAI-compatible | Другие провайдеры |
|---|---|---|---|
| Qwen3.8-Max | DashScope (Китай + intl) | Да | OpenRouter, SiliconFlow |
| Claude Opus 5.5 | Anthropic API | Нет (Messages API) | AWS Bedrock, GCP Vertex, OpenRouter |
| GPT-6.1 Sol | OpenAI API | Да (native) | Azure Foundry, AWS Bedrock, OpenRouter |
Qwen3.8-Max и GPT-6.1 Sol поддерживают формат OpenAI /v1/chat/completions нативно. Claude Opus 5.5 использует Messages API от Anthropic, но OpenRouter и gateway-сервисы предоставляют OpenAI-compatible обёртки.
Для команд, работающих в Китае, Qwen3.8-Max через DashScope — единственный вариант без трансграничных API-вызовов. Команды с требованиями по data residency в Северной Америке или Европе могут использовать GPT-6.1 Sol через Azure Foundry или Opus 5.5 через AWS Bedrock.
Код интеграции
Qwen3.8-Max через DashScope
from openai import OpenAI
client = OpenAI(
api_key="your-dashscope-key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen-max",
messages=[{"role": "user", "content": "Объясните компромиссы между MoE и dense архитектурами."}],
max_tokens=4096
)
print(response.choices[0].message.content)
Claude Opus 5.5 через Anthropic
from anthropic import Anthropic
client = Anthropic(api_key="your-anthropic-key")
response = client.messages.create(
model="claude-opus-5-5-20260922",
max_tokens=4096,
messages=[{"role": "user", "content": "Объясните компромиссы между MoE и dense архитектурами."}]
)
print(response.content[0].text)
GPT-6.1 Sol через OpenAI
from openai import OpenAI
client = OpenAI(api_key="your-openai-key")
response = client.chat.completions.create(
model="gpt-6.1-sol",
messages=[{"role": "user", "content": "Объясните компромиссы между MoE и dense архитектурами."}],
max_tokens=4096
)
print(response.choices[0].message.content)
Матрица выбора
Выбирайте Qwen3.8-Max, если:
- Бюджет на первом месте, а нужно frontier-качество
- Нагрузка на coding/agent-задачи, где Qwen сильна (Terminal-Bench 86.6%, SWE-bench 85.6%)
- Нужен multimodal input (изображения + видео + аудио) в одной модели
- Вы работаете в Китае или нужна нативная интеграция с DashScope
- Open weights важны для compliance, fine-tuning или self-hosting
Выбирайте Claude Opus 5.5, если:
- Нагрузка выигрывает от adaptive thinking (Opus 5.5 подстраивает compute под задачу, экономя 40% по сравнению с Opus 5 на типичных нагрузках)
- Нужно сильное следование инструкциям и длинные текстовые генерации
- Платформа развёртывания — AWS Bedrock или GCP Vertex
- Вы уже используете Anthropic SDK и экосистему Messages API
Выбирайте GPT-6.1 Sol, если:
- Нужен интеллект уровня Astra за mid-tier цену ($2/$10)
- Нагрузка cache-тяжёлая (cached reads за $0.10/1M не имеют конкурентов)
- Нужна максимально зрелая экосистема (Codex, Responses API, function calling)
- Важна интеграция через Azure Foundry или Batch API со скидкой 50%
- Приоритет — производительность на DeepSWE coding (71.9%)
TheRouter: cross-provider frontier routing
При routing OpenAI-compatible запросов через TheRouter можно настроить frontier tier, который выбирает между провайдерами по latency, стоимости или capability.
# Пример: конфигурация frontier-tier routing
routes:
- name: frontier-reasoning
models:
- provider: openai
model: gpt-6.1-sol
priority: 1
- provider: dashscope
model: qwen-max
priority: 2
# Fallback: output в 2.5 раза дешевле, сильный на coding
- provider: anthropic
model: claude-opus-5-5-20260922
priority: 3
# Premium tier: adaptive thinking для сложного reasoning
TheRouter направляет OpenAI-compatible запросы через настроенных провайдеров и поддерживает routing и fallback между провайдерами/моделями, когда это позволяют живые product-пути. Если GPT-6.1 Sol возвращает 429 или 5xx, запрос переходит к Qwen3.8-Max, сохраняя frontier-качество ответов и избегая простоев.
FAQ
Q: Какая модель лучше всех кодирует? Все три — frontier-уровень. Qwen3.8-Max лидирует на Terminal-Bench 2.1 (86.6%) и SWE-bench Vals (85.6%). GPT-6.1 Sol лидирует на DeepSWE (71.9%). Полного сравнения всех трёх на одном наборе тестов пока нет.
Q: Можно ли использовать OpenAI SDK для всех трёх?
Qwen3.8-Max (через DashScope) и GPT-6.1 Sol работают со стандартным OpenAI Python/Node SDK — достаточно поменять base_url и api_key. Claude Opus 5.5 использует собственный SDK Anthropic, но через OpenAI-compatible gateway вроде TheRouter или OpenRouter можно работать и с ним.
Q: Как adaptive thinking в Opus 5.5 влияет на стоимость? По данным Anthropic, Opus 5.5 тратит на 40% меньше токенов, чем Opus 5 на типичных нагрузках, масштабируя глубину reasoning под сложность задачи. Простые задачи потребляют меньше compute, сложные — больше. Цена за токен ($4/$20) на 20% ниже, чем у Opus 5 ($5/$25), а adaptive-поведение дополнительно усиливает экономию.
Q: Qwen3.8-Max действительно open weight? Да. Alibaba опубликовала полную модель Qwen3.8-2.4T-A95B под лицензией Apache 2.0 на Hugging Face. Можно развернуть self-hosted, хотя 2.4T параметров требуют серьёзной GPU-инфраструктуры. Для большинства команд API через DashScope практичнее.
Q: У какой модели самый дешёвый cache read? GPT-6.1 Sol — $0.10/1M токенов. Затем Opus 5.5 — $0.20/1M, Qwen3.8-Max через DashScope context cache — около $0.83/1M.
Q: GPT-6.1 Sol заменит GPT-6 Astra? Нет. GPT-6 Astra остаётся top-tier моделью для максимальных возможностей, особенно на frontier-исследованиях и самых сложных reasoning-задачах. GPT-6.1 Sol позиционируется как near-Astra интеллект за малую долю стоимости, по аналогии с тем, как GPT-5.6 Sol относился к GPT-5.6 Terra.
Источники: OpenAI Pricing (получено 2026-10-03), Anthropic Opus 5.5 launch (получено 2026-10-03), BenchLM Qwen3.8-Max (получено 2026-10-03), BenchLM GPT-6.1 Sol (получено 2026-10-03), Artificial Analysis GPT-6.1 Sol (получено 2026-10-03), OpenRouter Qwen3.8-Max pricing (получено 2026-10-03).