← Все статьи

Qwen3.8-Max vs DeepSeek V4 Pro: сравнение флагманских китайских API для операторов маршрутизации

Прямое сравнение Qwen3.8-Max и DeepSeek V4 Pro — двух флагманских китайских LLM API — по архитектуре, ценам, контекстным окнам, мультимодальным возможностям, режимам reasoning и стратегиям маршрутизации через OpenAI-совместимый gateway.

· updated 2026-08-11· TheRouter

В августе 2026 года на вершине стека китайских LLM API стоят две модели: Qwen3.8-Max от Alibaba и V4 Pro от DeepSeek. Обе построены на архитектуре Mixture-of-Experts с триллионами параметров, поддерживают контекстное окно в миллион токенов и OpenAI-совместимые endpoint. Обе доступны через DashScope и через собственные API. Вопрос не в том, хороши ли они — они хороши. Вопрос в том, какая из них подходит вашей нагрузке, и стоит ли маршрутизировать запросы между обеими.

Мы протестировали их на нашем routing layer, сравнили официальные спецификации и цены, и подготовили это руководство для операторов, которым нужно выбрать одну модель или запустить обе за одним base_url.

OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.

Сводная таблица

ПараметрQwen3.8-MaxDeepSeek V4 Pro
Параметры~2.4T (MoE, конфигурация не раскрыта)~1.6T total / 49B active (MoE)
Контекстное окно1M токенов1M токенов
Макс. выход16K токенов (по умолчанию)384K токенов
МультимодальностьТекст + изображения + видеоТолько текст
Thinking modeHybrid (вкл/выкл по запросу)Hybrid (включён по умолчанию)
DashScope input/1M¥12 (~$1.65)¥4 (~$0.55)
DashScope output/1M¥36 (~$4.95)¥12 (~$1.65)
DeepSeek direct input/1MТолько через DashScope$0.435
DeepSeek direct output/1MТолько через DashScope$0.87
Скидка cache hitContext caching поддерживается$0.003625/1M input (cache hit)
Лимит concurrencyНе опубликован500 RPM
Форматы APIOpenAI, Anthropic, DashScopeOpenAI, Anthropic
Лучше всего дляМультимодальные задачи, vision, китайскоязычные нагрузкиГлубокий reasoning, экономия на тексте, длинный output

Коротко: Qwen3.8-Max выбирают, когда нужны изображения или видео на входе. DeepSeek V4 Pro выбирают, когда нагрузка полностью текстовая и важна стоимость за токен.

Архитектура: два подхода к триллионному MoE

Обе модели используют sparse Mixture-of-Experts, но устроены по-разному.

Qwen3.8-Max — самая большая модель Alibaba, анонсирована 19 июля 2026, доступна через DashScope с 3 августа. Общий объём параметров около 2.4 триллиона. Alibaba не раскрыла конфигурацию MoE — количество экспертов, число активных параметров на токен и стратегия routing не опубликованы. Модель принимает текст, изображения и видео нативно, поддерживает контекстное окно в 1M токенов и hybrid reasoning с переключением по запросу.

DeepSeek V4 Pro вышла в preview 24 апреля 2026, GA с peak/off-peak pricing — в середине июля. Общий объём 1.6 триллиона параметров, из которых 49 миллиардов активны на каждый токен — это опубликованная, конкретная цифра. Модель работает только с текстом, поддерживает 1M контекст и thinking mode по умолчанию (можно отключить в каждом запросе).

Практическая разница: Qwen3.8-Max имеет больше параметров и нативный мультимодальный вход. DeepSeek V4 Pro активирует меньше параметров за токен, что означает более быстрый inference и более низкую стоимость.

Цены: DashScope vs прямой API

Цены — главный фактор для операторов маршрутизации, выбирающих между этими моделями.

Цены DashScope (Alibaba Cloud Bailian)

Обе модели доступны через DashScope по одному OpenAI-совместимому endpoint. Цены в юанях за миллион токенов:

МодельInput (за 1M токенов)Output (за 1M токенов)Скидка cache
qwen3.8-max¥12 (~$1.65)¥36 (~$4.95)Context caching
deepseek-v4-pro (через DashScope)¥4 (~$0.55)¥12 (~$1.65)Не опубликована

Прямой API DeepSeek

DeepSeek V4 Pro также доступна через собственный API DeepSeek (https://api.deepseek.com):

МодельInput (cache miss)Input (cache hit)Output
deepseek-v4-pro$0.435/1M$0.003625/1M$0.87/1M

Цены прямого API в долларах — примерно в том же диапазоне, что и юаневые цены DashScope после конвертации. Скидка на cache hit крайне агрессивная: $0.003625 за миллион input-токенов для повторяющихся промптов — фактически бесплатно.

Для операторов: если вы уже маршрутизируете через DashScope для Qwen-моделей, добавить DeepSeek V4 Pro на тот же endpoint не требует дополнительной интеграции. Если нужна минимальная стоимость, прямой API DeepSeek с cache hits сложно превзойти.

Примечание: DeepSeek объявила о планах повышения цен с «значительным увеличением». Мы обновим это сравнение, когда новые цены вступят в силу.

Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.

  • Одна валюта (USD) — конвертация на дату публикации с указанием курса.
  • Разделяйте input/output — никогда не публикуйте смешанную цифру.
  • Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
  • Указывайте тарифы длинного контекста — они часто скачут вверх.

Контекстное окно и лимиты output

Обе модели поддерживают 1M токенов контекста — наравне с Gemini 2.5 Pro на верхней границе.

Лимит output — существенная разница:

  • Qwen3.8-Max: максимальный output по умолчанию 16K токенов. Alibaba не опубликовала способа значительно увеличить его.
  • DeepSeek V4 Pro: максимальный output 384K токенов — более чем в 20 раз больше.

Если задача предполагает генерацию длинных документов, больших блоков кода или развёрнутых цепочек reasoning, у DeepSeek V4 Pro явное преимущество. Для задач с output менее 16K токенов (большинство чатов, Q&A и аналитики) ограничение не играет роли.

Мультимодальные возможности

Здесь у Qwen3.8-Max самое сильное отличие.

Qwen3.8-Max нативно принимает текст, изображения и видео. Можно передавать URL изображений или base64-данные в массиве content в стандартном формате OpenAI vision (type: "image_url"). Видео передаётся аналогично. Это позволяет строить pipeline, анализирующие скриншоты, обрабатывающие документы с картинками или разбирающие видеокадры — всё в одном вызове модели.

DeepSeek V4 Pro работает только с текстом. Нет input изображений, нет input видео. Если pipeline требует vision, нужна отдельная модель.

# Qwen3.8-Max vision-запрос через DashScope (OpenAI-совместимый)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DASHSCOPE_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Что на этом изображении?"},
            {"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
        ]
    }],
)

Для DeepSeek V4 Pro вызов тот же — замените base_url и model — но в content можно передавать только текст.

Reasoning и thinking mode

Обе модели поддерживают hybrid reasoning — возможность переключаться между быстрыми ответами без thinking и медленным chain-of-thought reasoning.

Qwen3.8-Max по умолчанию работает без thinking mode. Включение через параметр enable_thinking: true в extra_body. При активации модель генерирует цепочку рассуждений перед финальным ответом. Стандартные sampling-параметры (temperature 0-2, top_p, penalties) работают как обычно.

DeepSeek V4 Pro включает thinking mode по умолчанию. Каждый запрос генерирует chain-of-thought, пока вы явно не отключите его. Thinking-токены учитываются в billing output-токенов.

Эта разница в дефолтах напрямую влияет на стоимость маршрутизации: если нагрузка не требует reasoning, DeepSeek V4 Pro по умолчанию тратит thinking-токены. Qwen3.8-Max работает по принципу opt-in, и трафик без reasoning остаётся дешёвым по умолчанию.

Способы подключения к API

Обе модели поддерживают формат OpenAI chat completions — любой код на OpenAI SDK работает с заменой base_url.

Qwen3.8-Max

  • DashScope OpenAI-compatible: https://dashscope.aliyuncs.com/compatible-mode/v1, model ID qwen3.8-max
  • DashScope Anthropic-compatible: путь /apps/anthropic
  • Региональные endpoint: Пекин, Сингапур, Токио, Франкфурт, Вирджиния
  • Нет отдельного Qwen API: Qwen3.8-Max доступна только через DashScope (Alibaba Cloud Bailian)

DeepSeek V4 Pro

  • DeepSeek direct API (OpenAI-compatible): https://api.deepseek.com, model ID deepseek-v4-pro
  • DeepSeek Anthropic-compatible: https://api.deepseek.com/anthropic
  • DashScope-hosted: тот же model ID deepseek-v4-pro
  • Сторонние платформы: OpenRouter, Together AI и другие

У DeepSeek V4 Pro больше путей подключения. Если redundancy провайдеров важна для вашего routing, DeepSeek даёт больше fallback-вариантов.

Бенчмарки

Независимые данные от Artificial Analysis (получены в августе 2026):

  • Qwen3.8-Max: Intelligence Index 53. Топ-5 среди всех отслеживаемых моделей, на четыре пункта ниже Kimi K3 (57).
  • DeepSeek V4 Pro: сильные результаты на reasoning-бенчмарках. Тесты сообщества показывают, что V4 Pro отлично справляется со сложным многоступенчатым reasoning и agent-задачами.

Бенчмарки от вендоров нужно воспринимать с осторожностью — мы приводим их для контекста, а не как истину. В наших собственных тестах через routing layer обе модели стабильно обрабатывают сложные промпты. Qwen3.8-Max показала особую силу на китайскоязычных задачах и мультимодальном анализе. DeepSeek V4 Pro стабильно хороша в кодогенерации и структурированном reasoning.

Матрица выбора

Выбирайте Qwen3.8-Max, если:

  • Нагрузка включает изображения или видео на входе (vision-анализ, обработка документов, разбор скриншотов)
  • Работаете преимущественно с китайскоязычной аудиторией
  • Предпочитаете thinking mode как opt-in, а не по умолчанию
  • Уже используете DashScope и хотите остаться в экосистеме Alibaba Cloud
  • Нужны региональные endpoint (Сингапур, Токио, Франкфурт, Вирджиния)

Выбирайте DeepSeek V4 Pro, если:

  • Нагрузка полностью текстовая и стоимость — приоритет номер один
  • Нужен большой output (до 384K токенов за ответ)
  • Важна redundancy провайдеров с несколькими путями подключения (DeepSeek direct, DashScope, OpenRouter)
  • Основные задачи — сложный reasoning и кодогенерация
  • Хотите агрессивную скидку cache hit ($0.003625/1M input) для повторяющихся промптов

Запускайте обе, если:

  • Мультимодальные запросы идут на Qwen3.8-Max, текстовые — на DeepSeek V4 Pro
  • Нужен cost-based routing: задачи с большим output идут на DeepSeek, короткие ответы — на любую
  • Нужна fallback-цепочка: при сбое одного провайдера трафик автоматически переключается на другой

Маршрутизация китайских флагманов

Для операторов, запускающих обе модели, логика routing прямо вытекает из различий выше:

  1. Capability-based routing: любой запрос с изображениями или видео идёт на Qwen3.8-Max. Текстовые запросы маршрутизируются по стоимости или качеству.
  2. Cost-based routing: для текстовых нагрузок DeepSeek V4 Pro через прямой API примерно в 3 раза дешевле по output, чем Qwen3.8-Max через DashScope.
  3. Fallback routing: при ограничениях или недоступности API DeepSeek трафик идёт на Qwen3.8-Max через DashScope, и наоборот. Оба поддерживают OpenAI-совместимый формат — переключение требует замены base_url и model.

TheRouter маршрутизирует OpenAI-совместимые запросы через сконфигурированных провайдеров, что позволяет настроить обе модели как targets и определить правила routing на основе типа контента, пороговой стоимости или доступности.

За чем следить

Несколько факторов, которые могут изменить расклад:

  • Повышение цен DeepSeek: DeepSeek анонсировала предстоящее повышение. Когда оно произойдёт, ценовое преимущество перед Qwen3.8-Max может сократиться или исчезнуть.
  • Open weights Qwen3.8-Max: Alibaba сообщила, что open weights будут опубликованы, но не назвала дату, лицензию и model card. Если веса выйдут под Apache 2.0, self-hosting станет реальностью.
  • Responses API для V4 Pro: DeepSeek пока поддерживает Responses API только для V4 Flash. Поддержка V4 Pro запланирована на август 2026 — это добавит ещё один API surface для agent-воркфлоу.

Источники

Модели, упомянутые в статье

Помощь и контакты