Сравнение Flash-моделей: DeepSeek V4.1 Flash vs Qwen3.8 Flash vs GLM-5.3 Flash
Три Flash-модели появились в течение четырёх недель — DeepSeek V4.1 Flash, Qwen3.8 Flash и GLM-5.3 Flash — все с контекстом 1M токенов, ценой менее $1 за миллион выходных токенов и поддержкой рассуждений. Сравниваем архитектуру, цены, мультимодальность, качество кода и пропускную способность.
В августе–сентябре 2026 года за четыре недели вышли три Flash-модели: DeepSeek V4.1 Flash, Qwen3.8 Flash и GLM-5.3 Flash. Все три предлагают контекст в 1 миллион токенов, рассуждения и цену ниже $1 за миллион выходных токенов. Для команд, обрабатывающих чувствительные к стоимости задачи — классификацию, суммаризацию, помощь в написании кода, извлечение данных из документов — вопрос уже не «есть ли у провайдера Flash-модель?», а «какая Flash-модель лучше для моего сценария?»
Мы поставили три модели рядом. Вот что выяснили.
Сводная таблица
| Параметр | DeepSeek V4.1 Flash | Qwen3.8 Flash | GLM-5.3 Flash |
|---|---|---|---|
| Провайдер | DeepSeek | DashScope | Z.AI (BigModel) |
| Архитектура | 552B MoE, 8–16B активных | Dense (число параметров не раскрыто) | 320B MoE, 18B активных |
| Контекст | 1M токенов | 1M токенов | 1M токенов |
| Макс. вывод | 384K токенов | 131K токенов | 131K токенов |
| Ввод (офф-пик) | $0.15 / 1M | $0.162 / 1M | $0.162 / 1M |
| Вывод (офф-пик) | $0.60 / 1M | $0.508 / 1M | $0.54 / 1M |
| Кэш-хит | $0.003 / 1M | Кэширование через DashScope | $0.03 / 1M |
| Зрение | Да (нативное) | Только текст (VL-вариант отдельно) | Да (нативное) |
| Режим рассуждений | Да (по умолчанию вкл., переключаемый) | Да | Да (всегда вкл.) |
| Вызов функций | Да | Да | Да |
| JSON-вывод | Да | Да | Да |
| Открытые веса | Да (MIT) | Да | Да |
| Контроль глубины рассуждений | Нет | Нет | Да (reasoning_effort) |
| OpenAI-совместимый | Да | Да (через DashScope) | Да (через BigModel) |
Источники: DeepSeek API pricing, DashScope model pricing, Together.ai GLM-5.3-Flash, OpenRouter GLM-5.3-Flash.
Архитектура: три разных подхода к «быстроте»
DeepSeek V4.1 Flash — модель Mixture-of-Experts на 552 миллиарда параметров с активацией 8–16 миллиардов за один прямой проход. DeepSeek заявляет, что KV-кэш занимает 1/4 HBM и 1/8 SSD по сравнению с эквивалентной плотной моделью. Обновление V4.1 (сентябрь 2026) добавило нативную поддержку изображений и заменило старую V4 Flash — вызов deepseek-flash или устаревшего deepseek-v4-flash автоматически направляется на V4.1 Flash.
Qwen3.8 Flash — точка входа по стоимости/задержке для поколения 3.8 от Alibaba. Полное число параметров не раскрыто. Запущена в конце августа 2026 с контекстом 1M токенов, только текстовый ввод. Мультимодальный вход доступен через отдельный вариант Qwen3.8 VL Flash.
GLM-5.3 Flash от Z.AI — 320B MoE с 18B активными параметрами, комбинация разреженного и линейного внимания. Запущена 31 августа 2026, нативная мультимодальность — текст и изображения в одном model ID. Режим рассуждений всегда включён, но есть параметр reasoning_effort для управления глубиной.
Сравнение цен
DeepSeek V4.1 Flash
DeepSeek использует пиковое/внепиковое ценообразование. Пиковые часы: 01:00–04:00 и 06:00–10:00 UTC в будни (кроме китайских праздников). Всё остальное время — офф-пик, включая выходные.
| Период | Ввод (кэш-промах) | Ввод (кэш-хит) | Вывод |
|---|---|---|---|
| Офф-пик | $0.15 / 1M | $0.003 / 1M | $0.60 / 1M |
| Пик | $0.30 / 1M | $0.006 / 1M | $1.20 / 1M |
Qwen3.8 Flash
| Компонент | Цена |
|---|---|
| Ввод | $0.162 / 1M токенов |
| Вывод | $0.508 / 1M токенов |
DashScope также поддерживает контекстное кэширование со скидкой ~90% на кэш-хиты.
GLM-5.3 Flash
| Компонент | Цена |
|---|---|
| Ввод | $0.162 / 1M токенов |
| Вывод | $0.54 / 1M токенов |
| Кэш-хит | $0.03 / 1M токенов |
Через OpenRouter GLM-5.3 Flash доступна по $0.075/M ввод и $0.25/M вывод — примерно вдвое дешевле прямого API.
Стоимость типичной нагрузки
При обработке 10 миллионов входных и 2 миллионов выходных токенов в день (офф-пик):
| Модель | Ввод/день | Вывод/день | Итого/день |
|---|---|---|---|
| DeepSeek V4.1 Flash | $1.50 | $1.20 | $2.70 |
| Qwen3.8 Flash | $1.62 | $1.02 | $2.64 |
| GLM-5.3 Flash | $1.62 | $1.08 | $2.70 |
При таком объёме стоимость практически одинакова. Разница на границах: у DeepSeek самый дешёвый кэш-хит, у Qwen3.8 Flash самый низкий вывод, пиковые часы DeepSeek удваивают цену.
Зрение и мультимодальность
DeepSeek V4.1 Flash: нативная поддержка изображений (V4.1). Можно передавать URL изображений или base64 вместе с текстом в массиве content.
Qwen3.8 Flash: только текст. Для мультимодального ввода нужен Qwen3.8 VL Flash или Qwen3.8 Max — дополнительный model ID в конфигурации маршрутизации.
GLM-5.3 Flash: нативная мультимодальность с момента запуска. Блоки image_url в стандартном формате OpenAI, без отдельного варианта.
Вердикт: для смешанных текстово-визуальных пайплайнов DeepSeek V4.1 Flash и GLM-5.3 Flash удобнее — один model ID. Qwen3.8 Flash требует маршрутизации визуальных запросов на другую модель.
Качество кода
DeepSeek V4.1 Flash продолжает сильную линию V4 в программировании. HumanEval и SWE-bench — традиционно высокие показатели, V4.1 добавляет зрение сверху.
Qwen3.8 Flash позиционируется как универсальная рабочая лошадка. Кодинг — зона вариантов Coder (qwen3-coder, qwen3-coder-plus). Flash справляется с генерацией и объяснением кода, но это не кодинг-флагман линейки.
GLM-5.3 Flash выигрывает от инвестиций Z.AI в кодинг-бенчмарки. Полная версия GLM-5.3 возглавила SWE-bench Pro, Flash-вариант сохраняет бо́льшую часть этих возможностей. По отзывам сообщества — сопоставимо с Claude Opus 4.8 на практических задачах за ~5% стоимости.
Вердикт: для чисто кодовых задач — GLM-5.3 Flash или DeepSeek V4.1 Flash. Qwen3.8 Flash работает, но в своей линейке это не лидер по кодингу.
Контекст и эффективность KV-кэша
Все три модели заявляют 1M контекст, но максимальный вывод различается: DeepSeek — 384K, Qwen3.8 Flash и GLM-5.3 Flash — по 131K. Для большинства продакшн-сценариев 131K достаточно, но при генерации очень длинных файлов DeepSeek даёт запас.
Матрица выбора
Выбирайте DeepSeek V4.1 Flash, если:
- Нужен максимальный вывод (384K)
- Много повторяющихся префиксов ($0.003/M кэш-хит)
- Нагрузка в основном во внепиковые часы
- MIT-лицензия для самостоятельного развёртывания
- Нужны зрение + текст в одном model ID
Выбирайте Qwen3.8 Flash, если:
- Уже работаете с DashScope и хотите единый биллинг
- Нагрузка только текстовая
- Важна минимальная цена вывода ($0.508/M)
- Нужен доступ к экосистеме Qwen (VL, Coder, Max) через одного провайдера
- Предпочитаете фиксированные цены без пик/офф-пик
Выбирайте GLM-5.3 Flash, если:
- Нужны нативное зрение + текст + контроль глубины рассуждений
- Качество кода — приоритет во Flash-классе
- Предпочитаете всегда включённые рассуждения
- Хотите маршрутизировать через OpenRouter по $0.075/$0.25/M — примерно вдвое дешевле прямого API
- Цените открытые веса + сильные бенчмарки
Конфигурация TheRouter: маршрутизация Flash-уровня
Все три Flash-модели можно настроить как группу маршрутизации с оптимизацией по стоимости:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_THEROUTER_KEY",
base_url="https://api.therouter.ai/v1",
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash", # или qwen/qwen3.8-flash, zai/glm-5.3-flash
messages=[
{"role": "user", "content": "Объясни теорему CAP в трёх предложениях."}
],
)
print(response.choices[0].message.content)
Для визуальных задач настройте фолбэк между DeepSeek V4.1 Flash и GLM-5.3 Flash — оба принимают изображения нативно.
Часто задаваемые вопросы
В: Эти модели действительно такого же качества, как дорогие флагманы? Нет. Flash-модели жертвуют частью глубины рассуждений ради скорости и экономии. Для сложных многошаговых задач используйте Pro/Max. Flash отлично подходит для массовой обработки, помощи в написании кода, извлечения данных и задач с жёсткими требованиями к задержке.
В: Можно переключаться между моделями без изменения кода?
Да. Все три используют OpenAI-совместимые API. Измените base_url и model — и код работает. При маршрутизации через TheRouter переключение происходит на уровне маршрутизации.
В: Какая модель быстрее по токенам в секунду? Пропускная способность зависит от нагрузки провайдера и времени суток. Рекомендуем тестировать на своей реальной нагрузке.
В: Поддерживается ли формат Anthropic API?
DeepSeek V4.1 Flash нативно поддерживает формат Anthropic на https://api.deepseek.com/anthropic. Qwen3.8 Flash и GLM-5.3 Flash — только OpenAI-формат.
В: Можно развернуть самостоятельно? Все три опубликовали открытые веса. DeepSeek V4.1 Flash — MIT-лицензия, наиболее свободная для коммерческого использования.
Цены и характеристики проверены на 23 сентября 2026 года. Возможности и цены моделей могут измениться — сверяйтесь с официальной документацией провайдеров.