Qwen3.8-Max vs DeepSeek V4 Pro: сравнение флагманских китайских API для операторов маршрутизации
Прямое сравнение Qwen3.8-Max и DeepSeek V4 Pro — двух флагманских китайских LLM API — по архитектуре, ценам, контекстным окнам, мультимодальным возможностям, режимам reasoning и стратегиям маршрутизации через OpenAI-совместимый gateway.
В августе 2026 года на вершине стека китайских LLM API стоят две модели: Qwen3.8-Max от Alibaba и V4 Pro от DeepSeek. Обе построены на архитектуре Mixture-of-Experts с триллионами параметров, поддерживают контекстное окно в миллион токенов и OpenAI-совместимые endpoint. Обе доступны через DashScope и через собственные API. Вопрос не в том, хороши ли они — они хороши. Вопрос в том, какая из них подходит вашей нагрузке, и стоит ли маршрутизировать запросы между обеими.
Мы протестировали их на нашем routing layer, сравнили официальные спецификации и цены, и подготовили это руководство для операторов, которым нужно выбрать одну модель или запустить обе за одним base_url.
OpenAI-совместимость означает, что провайдер предоставляет endpoint chat-completions, чей контракт запроса и ответа достаточно близок к API OpenAI, чтобы немодифицированный вызов OpenAI SDK работал после замены трёх значений: API key, base URL, название модели. Минимальная поверхность на практике —POST /v1/chat/completions с messages, model и потоковым ответом в форме OpenAI.
Сводная таблица
| Параметр | Qwen3.8-Max | DeepSeek V4 Pro |
|---|---|---|
| Параметры | ~2.4T (MoE, конфигурация не раскрыта) | ~1.6T total / 49B active (MoE) |
| Контекстное окно | 1M токенов | 1M токенов |
| Макс. выход | 16K токенов (по умолчанию) | 384K токенов |
| Мультимодальность | Текст + изображения + видео | Только текст |
| Thinking mode | Hybrid (вкл/выкл по запросу) | Hybrid (включён по умолчанию) |
| DashScope input/1M | ¥12 (~$1.65) | ¥4 (~$0.55) |
| DashScope output/1M | ¥36 (~$4.95) | ¥12 (~$1.65) |
| DeepSeek direct input/1M | Только через DashScope | $0.435 |
| DeepSeek direct output/1M | Только через DashScope | $0.87 |
| Скидка cache hit | Context caching поддерживается | $0.003625/1M input (cache hit) |
| Лимит concurrency | Не опубликован | 500 RPM |
| Форматы API | OpenAI, Anthropic, DashScope | OpenAI, Anthropic |
| Лучше всего для | Мультимодальные задачи, vision, китайскоязычные нагрузки | Глубокий reasoning, экономия на тексте, длинный output |
Коротко: Qwen3.8-Max выбирают, когда нужны изображения или видео на входе. DeepSeek V4 Pro выбирают, когда нагрузка полностью текстовая и важна стоимость за токен.
Архитектура: два подхода к триллионному MoE
Обе модели используют sparse Mixture-of-Experts, но устроены по-разному.
Qwen3.8-Max — самая большая модель Alibaba, анонсирована 19 июля 2026, доступна через DashScope с 3 августа. Общий объём параметров около 2.4 триллиона. Alibaba не раскрыла конфигурацию MoE — количество экспертов, число активных параметров на токен и стратегия routing не опубликованы. Модель принимает текст, изображения и видео нативно, поддерживает контекстное окно в 1M токенов и hybrid reasoning с переключением по запросу.
DeepSeek V4 Pro вышла в preview 24 апреля 2026, GA с peak/off-peak pricing — в середине июля. Общий объём 1.6 триллиона параметров, из которых 49 миллиардов активны на каждый токен — это опубликованная, конкретная цифра. Модель работает только с текстом, поддерживает 1M контекст и thinking mode по умолчанию (можно отключить в каждом запросе).
Практическая разница: Qwen3.8-Max имеет больше параметров и нативный мультимодальный вход. DeepSeek V4 Pro активирует меньше параметров за токен, что означает более быстрый inference и более низкую стоимость.
Цены: DashScope vs прямой API
Цены — главный фактор для операторов маршрутизации, выбирающих между этими моделями.
Цены DashScope (Alibaba Cloud Bailian)
Обе модели доступны через DashScope по одному OpenAI-совместимому endpoint. Цены в юанях за миллион токенов:
| Модель | Input (за 1M токенов) | Output (за 1M токенов) | Скидка cache |
|---|---|---|---|
qwen3.8-max | ¥12 (~$1.65) | ¥36 (~$4.95) | Context caching |
deepseek-v4-pro (через DashScope) | ¥4 (~$0.55) | ¥12 (~$1.65) | Не опубликована |
Прямой API DeepSeek
DeepSeek V4 Pro также доступна через собственный API DeepSeek (https://api.deepseek.com):
| Модель | Input (cache miss) | Input (cache hit) | Output |
|---|---|---|---|
deepseek-v4-pro | $0.435/1M | $0.003625/1M | $0.87/1M |
Цены прямого API в долларах — примерно в том же диапазоне, что и юаневые цены DashScope после конвертации. Скидка на cache hit крайне агрессивная: $0.003625 за миллион input-токенов для повторяющихся промптов — фактически бесплатно.
Для операторов: если вы уже маршрутизируете через DashScope для Qwen-моделей, добавить DeepSeek V4 Pro на тот же endpoint не требует дополнительной интеграции. Если нужна минимальная стоимость, прямой API DeepSeek с cache hits сложно превзойти.
Примечание: DeepSeek объявила о планах повышения цен с «значительным увеличением». Мы обновим это сравнение, когда новые цены вступят в силу.
Сравнивая цены API между провайдерами, всегда нормализуйте кUSD за миллион токенов и разделяйте input и output. Большинство провайдеров берёт за output токены в 2–5 раз дороже, чем за input, поэтому нагрузка с длинными completion'ами при одной и той же номинальной цене обходится дороже.
- Одна валюта (USD) — конвертация на дату публикации с указанием курса.
- Разделяйте input/output — никогда не публикуйте смешанную цифру.
- Цитируйте каждую строку со страницы цен провайдера + дата извлечения.
- Указывайте тарифы длинного контекста — они часто скачут вверх.
Контекстное окно и лимиты output
Обе модели поддерживают 1M токенов контекста — наравне с Gemini 2.5 Pro на верхней границе.
Лимит output — существенная разница:
- Qwen3.8-Max: максимальный output по умолчанию 16K токенов. Alibaba не опубликовала способа значительно увеличить его.
- DeepSeek V4 Pro: максимальный output 384K токенов — более чем в 20 раз больше.
Если задача предполагает генерацию длинных документов, больших блоков кода или развёрнутых цепочек reasoning, у DeepSeek V4 Pro явное преимущество. Для задач с output менее 16K токенов (большинство чатов, Q&A и аналитики) ограничение не играет роли.
Мультимодальные возможности
Здесь у Qwen3.8-Max самое сильное отличие.
Qwen3.8-Max нативно принимает текст, изображения и видео. Можно передавать URL изображений или base64-данные в массиве content в стандартном формате OpenAI vision (type: "image_url"). Видео передаётся аналогично. Это позволяет строить pipeline, анализирующие скриншоты, обрабатывающие документы с картинками или разбирающие видеокадры — всё в одном вызове модели.
DeepSeek V4 Pro работает только с текстом. Нет input изображений, нет input видео. Если pipeline требует vision, нужна отдельная модель.
# Qwen3.8-Max vision-запрос через DashScope (OpenAI-совместимый)
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Что на этом изображении?"},
{"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
]
}],
)
Для DeepSeek V4 Pro вызов тот же — замените base_url и model — но в content можно передавать только текст.
Reasoning и thinking mode
Обе модели поддерживают hybrid reasoning — возможность переключаться между быстрыми ответами без thinking и медленным chain-of-thought reasoning.
Qwen3.8-Max по умолчанию работает без thinking mode. Включение через параметр enable_thinking: true в extra_body. При активации модель генерирует цепочку рассуждений перед финальным ответом. Стандартные sampling-параметры (temperature 0-2, top_p, penalties) работают как обычно.
DeepSeek V4 Pro включает thinking mode по умолчанию. Каждый запрос генерирует chain-of-thought, пока вы явно не отключите его. Thinking-токены учитываются в billing output-токенов.
Эта разница в дефолтах напрямую влияет на стоимость маршрутизации: если нагрузка не требует reasoning, DeepSeek V4 Pro по умолчанию тратит thinking-токены. Qwen3.8-Max работает по принципу opt-in, и трафик без reasoning остаётся дешёвым по умолчанию.
Способы подключения к API
Обе модели поддерживают формат OpenAI chat completions — любой код на OpenAI SDK работает с заменой base_url.
Qwen3.8-Max
- DashScope OpenAI-compatible:
https://dashscope.aliyuncs.com/compatible-mode/v1, model IDqwen3.8-max - DashScope Anthropic-compatible: путь
/apps/anthropic - Региональные endpoint: Пекин, Сингапур, Токио, Франкфурт, Вирджиния
- Нет отдельного Qwen API: Qwen3.8-Max доступна только через DashScope (Alibaba Cloud Bailian)
DeepSeek V4 Pro
- DeepSeek direct API (OpenAI-compatible):
https://api.deepseek.com, model IDdeepseek-v4-pro - DeepSeek Anthropic-compatible:
https://api.deepseek.com/anthropic - DashScope-hosted: тот же model ID
deepseek-v4-pro - Сторонние платформы: OpenRouter, Together AI и другие
У DeepSeek V4 Pro больше путей подключения. Если redundancy провайдеров важна для вашего routing, DeepSeek даёт больше fallback-вариантов.
Бенчмарки
Независимые данные от Artificial Analysis (получены в августе 2026):
- Qwen3.8-Max: Intelligence Index 53. Топ-5 среди всех отслеживаемых моделей, на четыре пункта ниже Kimi K3 (57).
- DeepSeek V4 Pro: сильные результаты на reasoning-бенчмарках. Тесты сообщества показывают, что V4 Pro отлично справляется со сложным многоступенчатым reasoning и agent-задачами.
Бенчмарки от вендоров нужно воспринимать с осторожностью — мы приводим их для контекста, а не как истину. В наших собственных тестах через routing layer обе модели стабильно обрабатывают сложные промпты. Qwen3.8-Max показала особую силу на китайскоязычных задачах и мультимодальном анализе. DeepSeek V4 Pro стабильно хороша в кодогенерации и структурированном reasoning.
Матрица выбора
Выбирайте Qwen3.8-Max, если:
- Нагрузка включает изображения или видео на входе (vision-анализ, обработка документов, разбор скриншотов)
- Работаете преимущественно с китайскоязычной аудиторией
- Предпочитаете thinking mode как opt-in, а не по умолчанию
- Уже используете DashScope и хотите остаться в экосистеме Alibaba Cloud
- Нужны региональные endpoint (Сингапур, Токио, Франкфурт, Вирджиния)
Выбирайте DeepSeek V4 Pro, если:
- Нагрузка полностью текстовая и стоимость — приоритет номер один
- Нужен большой output (до 384K токенов за ответ)
- Важна redundancy провайдеров с несколькими путями подключения (DeepSeek direct, DashScope, OpenRouter)
- Основные задачи — сложный reasoning и кодогенерация
- Хотите агрессивную скидку cache hit ($0.003625/1M input) для повторяющихся промптов
Запускайте обе, если:
- Мультимодальные запросы идут на Qwen3.8-Max, текстовые — на DeepSeek V4 Pro
- Нужен cost-based routing: задачи с большим output идут на DeepSeek, короткие ответы — на любую
- Нужна fallback-цепочка: при сбое одного провайдера трафик автоматически переключается на другой
Маршрутизация китайских флагманов
Для операторов, запускающих обе модели, логика routing прямо вытекает из различий выше:
- Capability-based routing: любой запрос с изображениями или видео идёт на Qwen3.8-Max. Текстовые запросы маршрутизируются по стоимости или качеству.
- Cost-based routing: для текстовых нагрузок DeepSeek V4 Pro через прямой API примерно в 3 раза дешевле по output, чем Qwen3.8-Max через DashScope.
- Fallback routing: при ограничениях или недоступности API DeepSeek трафик идёт на Qwen3.8-Max через DashScope, и наоборот. Оба поддерживают OpenAI-совместимый формат — переключение требует замены
base_urlиmodel.
TheRouter маршрутизирует OpenAI-совместимые запросы через сконфигурированных провайдеров, что позволяет настроить обе модели как targets и определить правила routing на основе типа контента, пороговой стоимости или доступности.
За чем следить
Несколько факторов, которые могут изменить расклад:
- Повышение цен DeepSeek: DeepSeek анонсировала предстоящее повышение. Когда оно произойдёт, ценовое преимущество перед Qwen3.8-Max может сократиться или исчезнуть.
- Open weights Qwen3.8-Max: Alibaba сообщила, что open weights будут опубликованы, но не назвала дату, лицензию и model card. Если веса выйдут под Apache 2.0, self-hosting станет реальностью.
- Responses API для V4 Pro: DeepSeek пока поддерживает Responses API только для V4 Flash. Поддержка V4 Pro запланирована на август 2026 — это добавит ещё один API surface для agent-воркфлоу.
Источники
- DashScope Model Pricing — получено 11 августа 2026
- DeepSeek API Models & Pricing — получено 11 августа 2026
- DashScope Model Specifications — получено 11 августа 2026
- Artificial Analysis — Qwen3.8-Max — ссылка от 11 августа 2026
- DeepSeek V4 Preview Announcement — получено 11 августа 2026
- Qwen3.8-Max Specs and Benchmarks (CheapestInference) — получено 11 августа 2026