← Все статьи

Сравнение Flash-моделей: DeepSeek V4.1 Flash vs Qwen3.8 Flash vs GLM-5.3 Flash

Три Flash-модели появились в течение четырёх недель — DeepSeek V4.1 Flash, Qwen3.8 Flash и GLM-5.3 Flash — все с контекстом 1M токенов, ценой менее $1 за миллион выходных токенов и поддержкой рассуждений. Сравниваем архитектуру, цены, мультимодальность, качество кода и пропускную способность.

· TheRouter

В августе–сентябре 2026 года за четыре недели вышли три Flash-модели: DeepSeek V4.1 Flash, Qwen3.8 Flash и GLM-5.3 Flash. Все три предлагают контекст в 1 миллион токенов, рассуждения и цену ниже $1 за миллион выходных токенов. Для команд, обрабатывающих чувствительные к стоимости задачи — классификацию, суммаризацию, помощь в написании кода, извлечение данных из документов — вопрос уже не «есть ли у провайдера Flash-модель?», а «какая Flash-модель лучше для моего сценария?»

Мы поставили три модели рядом. Вот что выяснили.

Сводная таблица

ПараметрDeepSeek V4.1 FlashQwen3.8 FlashGLM-5.3 Flash
ПровайдерDeepSeekDashScopeZ.AI (BigModel)
Архитектура552B MoE, 8–16B активныхDense (число параметров не раскрыто)320B MoE, 18B активных
Контекст1M токенов1M токенов1M токенов
Макс. вывод384K токенов131K токенов131K токенов
Ввод (офф-пик)$0.15 / 1M$0.162 / 1M$0.162 / 1M
Вывод (офф-пик)$0.60 / 1M$0.508 / 1M$0.54 / 1M
Кэш-хит$0.003 / 1MКэширование через DashScope$0.03 / 1M
ЗрениеДа (нативное)Только текст (VL-вариант отдельно)Да (нативное)
Режим рассужденийДа (по умолчанию вкл., переключаемый)ДаДа (всегда вкл.)
Вызов функцийДаДаДа
JSON-выводДаДаДа
Открытые весаДа (MIT)ДаДа
Контроль глубины рассужденийНетНетДа (reasoning_effort)
OpenAI-совместимыйДаДа (через DashScope)Да (через BigModel)

Источники: DeepSeek API pricing, DashScope model pricing, Together.ai GLM-5.3-Flash, OpenRouter GLM-5.3-Flash.

Архитектура: три разных подхода к «быстроте»

DeepSeek V4.1 Flash — модель Mixture-of-Experts на 552 миллиарда параметров с активацией 8–16 миллиардов за один прямой проход. DeepSeek заявляет, что KV-кэш занимает 1/4 HBM и 1/8 SSD по сравнению с эквивалентной плотной моделью. Обновление V4.1 (сентябрь 2026) добавило нативную поддержку изображений и заменило старую V4 Flash — вызов deepseek-flash или устаревшего deepseek-v4-flash автоматически направляется на V4.1 Flash.

Qwen3.8 Flash — точка входа по стоимости/задержке для поколения 3.8 от Alibaba. Полное число параметров не раскрыто. Запущена в конце августа 2026 с контекстом 1M токенов, только текстовый ввод. Мультимодальный вход доступен через отдельный вариант Qwen3.8 VL Flash.

GLM-5.3 Flash от Z.AI — 320B MoE с 18B активными параметрами, комбинация разреженного и линейного внимания. Запущена 31 августа 2026, нативная мультимодальность — текст и изображения в одном model ID. Режим рассуждений всегда включён, но есть параметр reasoning_effort для управления глубиной.

Сравнение цен

DeepSeek V4.1 Flash

DeepSeek использует пиковое/внепиковое ценообразование. Пиковые часы: 01:00–04:00 и 06:00–10:00 UTC в будни (кроме китайских праздников). Всё остальное время — офф-пик, включая выходные.

ПериодВвод (кэш-промах)Ввод (кэш-хит)Вывод
Офф-пик$0.15 / 1M$0.003 / 1M$0.60 / 1M
Пик$0.30 / 1M$0.006 / 1M$1.20 / 1M

Qwen3.8 Flash

КомпонентЦена
Ввод$0.162 / 1M токенов
Вывод$0.508 / 1M токенов

DashScope также поддерживает контекстное кэширование со скидкой ~90% на кэш-хиты.

GLM-5.3 Flash

КомпонентЦена
Ввод$0.162 / 1M токенов
Вывод$0.54 / 1M токенов
Кэш-хит$0.03 / 1M токенов

Через OpenRouter GLM-5.3 Flash доступна по $0.075/M ввод и $0.25/M вывод — примерно вдвое дешевле прямого API.

Стоимость типичной нагрузки

При обработке 10 миллионов входных и 2 миллионов выходных токенов в день (офф-пик):

МодельВвод/деньВывод/деньИтого/день
DeepSeek V4.1 Flash$1.50$1.20$2.70
Qwen3.8 Flash$1.62$1.02$2.64
GLM-5.3 Flash$1.62$1.08$2.70

При таком объёме стоимость практически одинакова. Разница на границах: у DeepSeek самый дешёвый кэш-хит, у Qwen3.8 Flash самый низкий вывод, пиковые часы DeepSeek удваивают цену.

Зрение и мультимодальность

DeepSeek V4.1 Flash: нативная поддержка изображений (V4.1). Можно передавать URL изображений или base64 вместе с текстом в массиве content.

Qwen3.8 Flash: только текст. Для мультимодального ввода нужен Qwen3.8 VL Flash или Qwen3.8 Max — дополнительный model ID в конфигурации маршрутизации.

GLM-5.3 Flash: нативная мультимодальность с момента запуска. Блоки image_url в стандартном формате OpenAI, без отдельного варианта.

Вердикт: для смешанных текстово-визуальных пайплайнов DeepSeek V4.1 Flash и GLM-5.3 Flash удобнее — один model ID. Qwen3.8 Flash требует маршрутизации визуальных запросов на другую модель.

Качество кода

DeepSeek V4.1 Flash продолжает сильную линию V4 в программировании. HumanEval и SWE-bench — традиционно высокие показатели, V4.1 добавляет зрение сверху.

Qwen3.8 Flash позиционируется как универсальная рабочая лошадка. Кодинг — зона вариантов Coder (qwen3-coder, qwen3-coder-plus). Flash справляется с генерацией и объяснением кода, но это не кодинг-флагман линейки.

GLM-5.3 Flash выигрывает от инвестиций Z.AI в кодинг-бенчмарки. Полная версия GLM-5.3 возглавила SWE-bench Pro, Flash-вариант сохраняет бо́льшую часть этих возможностей. По отзывам сообщества — сопоставимо с Claude Opus 4.8 на практических задачах за ~5% стоимости.

Вердикт: для чисто кодовых задач — GLM-5.3 Flash или DeepSeek V4.1 Flash. Qwen3.8 Flash работает, но в своей линейке это не лидер по кодингу.

Контекст и эффективность KV-кэша

Все три модели заявляют 1M контекст, но максимальный вывод различается: DeepSeek — 384K, Qwen3.8 Flash и GLM-5.3 Flash — по 131K. Для большинства продакшн-сценариев 131K достаточно, но при генерации очень длинных файлов DeepSeek даёт запас.

Матрица выбора

Выбирайте DeepSeek V4.1 Flash, если:

  • Нужен максимальный вывод (384K)
  • Много повторяющихся префиксов ($0.003/M кэш-хит)
  • Нагрузка в основном во внепиковые часы
  • MIT-лицензия для самостоятельного развёртывания
  • Нужны зрение + текст в одном model ID

Выбирайте Qwen3.8 Flash, если:

  • Уже работаете с DashScope и хотите единый биллинг
  • Нагрузка только текстовая
  • Важна минимальная цена вывода ($0.508/M)
  • Нужен доступ к экосистеме Qwen (VL, Coder, Max) через одного провайдера
  • Предпочитаете фиксированные цены без пик/офф-пик

Выбирайте GLM-5.3 Flash, если:

  • Нужны нативное зрение + текст + контроль глубины рассуждений
  • Качество кода — приоритет во Flash-классе
  • Предпочитаете всегда включённые рассуждения
  • Хотите маршрутизировать через OpenRouter по $0.075/$0.25/M — примерно вдвое дешевле прямого API
  • Цените открытые веса + сильные бенчмарки

Конфигурация TheRouter: маршрутизация Flash-уровня

Все три Flash-модели можно настроить как группу маршрутизации с оптимизацией по стоимости:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_THEROUTER_KEY",
    base_url="https://api.therouter.ai/v1",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash",  # или qwen/qwen3.8-flash, zai/glm-5.3-flash
    messages=[
        {"role": "user", "content": "Объясни теорему CAP в трёх предложениях."}
    ],
)

print(response.choices[0].message.content)

Для визуальных задач настройте фолбэк между DeepSeek V4.1 Flash и GLM-5.3 Flash — оба принимают изображения нативно.

Часто задаваемые вопросы

В: Эти модели действительно такого же качества, как дорогие флагманы? Нет. Flash-модели жертвуют частью глубины рассуждений ради скорости и экономии. Для сложных многошаговых задач используйте Pro/Max. Flash отлично подходит для массовой обработки, помощи в написании кода, извлечения данных и задач с жёсткими требованиями к задержке.

В: Можно переключаться между моделями без изменения кода? Да. Все три используют OpenAI-совместимые API. Измените base_url и model — и код работает. При маршрутизации через TheRouter переключение происходит на уровне маршрутизации.

В: Какая модель быстрее по токенам в секунду? Пропускная способность зависит от нагрузки провайдера и времени суток. Рекомендуем тестировать на своей реальной нагрузке.

В: Поддерживается ли формат Anthropic API? DeepSeek V4.1 Flash нативно поддерживает формат Anthropic на https://api.deepseek.com/anthropic. Qwen3.8 Flash и GLM-5.3 Flash — только OpenAI-формат.

В: Можно развернуть самостоятельно? Все три опубликовали открытые веса. DeepSeek V4.1 Flash — MIT-лицензия, наиболее свободная для коммерческого использования.


Цены и характеристики проверены на 23 сентября 2026 года. Возможности и цены моделей могут измениться — сверяйтесь с официальной документацией провайдеров.

Модели, упомянутые в статье

Помощь и контакты