Назад к моделям

Mistral Small 4

mistralmistral/mistral-small-4

Mistral's 2026-03 unified small model (119B MoE, 6B active). Combines Magistral (reasoning), Pixtral (multimodal), and Devstral (agentic coding) capabilities into a single model.

Mistral Small 4 — это 119-миллиардная MoE-модель (Mixture of Experts), выпущенная 16 марта 2026 года под лицензией Apache 2.0. С активацией всего 6,5 миллиардов параметров на токен (128 экспертов, 4 активных на токен) она объединяет четыре ранее отдельных семейства моделей Mistral — Magistral (рассуждение), Pixtral (мультимодальность), Devstral (агентский кодинг) и Mistral Small (инструкции) — в единую развёртываемую модель. Это первая модель Mistral, консолидирующая весь не-флагманский стек в одну архитектуру, что кардинально упрощает логику маршрутизации в продакшене.

Для оператора TheRouter Mistral Small 4 — это экономичный «швейцарский нож»: один эндпоинт для vision, вызова инструментов, рассуждения и кодинга по цене $0,20/млн входных токенов (через TheRouter). Параметр reasoning_effort (none/high) позволяет регулировать вычислительные затраты на запрос, что делает модель одинаково пригодной как для быстрых чатов, так и для глубокого пошагового рассуждения без необходимости поддерживать отдельные развёртывания. Модель поддерживает контекст в 256K токенов (upstream) и может быть развёрнута на скромных multi-GPU-конфигурациях (минимум 4× H100 или 2× H200).

Когда выбирать
  • • Единый чат + рассуждение + кодинг — одна модель для быстрых диалогов, анализа изображений документов, пошаговых математических рассуждений и генерации кода, устраняющая необходимость в отдельных развёртываниях для быстрых и глубоких режимов
  • • Чувствительные к затратам продуктовые пайплайны — 6,5B активных параметров на токен и эффективность MoE обеспечивают высокое соотношение качества к затратам для высоконагруженных приложений вроде генерации контента, суммаризации и RAG-пайплайнов
  • • Self-hosted fallback — лицензия Apache 2.0 позволяет полностью приватное развёртывание на собственном оборудовании через vLLM, SGLang или llama.cpp с одним и тем же model id, который бесшовно переключается между API TheRouter и self-hosted эндпоинтами
  • • Мультимодальный анализ документов — поддержка зрения (ввод текста + изображений) позволяет структурированно извлекать данные из PDF, скриншотов и сканов документов по доступной цене
Когда не выбирать
  • • Конкурсная математика — хотя настраиваемое рассуждение достойное, специализированные модели рассуждения (DeepSeek V3.2, GPT-5.2 thinking) превосходят её на AIME 2025 и подобных сложных бенчмарках
  • • Очень высокая пропускная способность для одной задачи — если 100% трафика — простой текстовый чат без vision/рассуждения/кодинга, специализированная Ministral 8B или 3B ($0,10-$0,15/M входных) может быть выгоднее
  • • Аудиовыход — Mistral Small 4 работает только с текстом/изображениями на входе и текстом на выходе. Для синтеза речи используйте mistral/voxtral-tts или fishaudio/fish-speech-1.5
Размер контекста
131K
Максимальный вывод
16K
Цена Входза 1M токенов
$0.162за 1 млн токенов
Цена Выходза 1M токенов
$0.648за 1 млн токенов

Модальности

ТекстИзображение→Текст

Возможности

Зрение

Разбивка цен

ТипСтавка
Вход$0.162 за 1 млн токенов
Выход$0.648 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatreasoningstop

Характеристики

Дата релиза2026-03-16mistral.ai ↗проверено
Архитектура119B всего / 6,5B активных — MoE (128 экспертов, 4 активных на токен); Transformer с grouped-query attention (GQA)docs.mistral.ai ↗проверено
Длина контекста (upstream)262 144 токена (256K); TheRouter отдаёт 131 072 согласно standard-models.yamlhuggingface.co ↗проверено
Дата отсечения данныхНе раскрытонеизвестно
ЛицензияApache 2.0 (коммерческое использование разрешено, без ограничений по объёму)huggingface.co ↗проверено
Поддерживаемые backend инференсаvLLM, SGLang, llama.cpp, Transformers, NVIDIA NIMhuggingface.co ↗проверено
Минимальное оборудование для self-host4× NVIDIA HGX H100, 2× HGX H200 или 1× DGX B200mistral.ai ↗к проверке

Бенчмарки

BenchmarkDistributionScoreSource
AA LCR
Academic Agent LiveCodeBench Reasoning. Результат достигнут при ~1,6K символах вывода — заметно лаконичнее сопоставимых моделей Qwen, которым требуется 5,8-6,1K символов для аналогичных показателей
0.72mistral.ai ↗
LiveCodeBench
По данным Mistral; превосходит GPT-OSS 120B с 20% меньшим объёмом вывода
Outperforms GPT-OSS 120Bmistral.ai ↗
AIME 2025
American Invitational Mathematics Examination 2025 — сопоставима с GPT-OSS 120B при более коротком выводе
Matches GPT-OSS 120Bmistral.ai ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "mistral/mistral-small-4",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Chat completion

Базовый chat completion для тестирования эндпоинта или задач диалога.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral/mistral-small-4",
    "messages": [
      {"role": "user", "content": "Explain the difference between MoE and dense transformer models"}
    ]
  }'

Ещё от mistral

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2026-03-16

Представление Mistral Small 4

Mistral AI выпустила Mistral Small 4 (mistral-small-2603) — 119B MoE-модель, объединяющую возможности Magistral (рассуждение), Pixtral (мультимодальность), Devstral (кодинг) и Mistral Small (инструкции) в единое развёртывание с открытыми весами (Apache 2.0). Ключевые особенности: настраиваемый reasoning_effort, контекст 256K и возможность self-host на 4× H100 GPU.

переработано TheRoutermistral.ai/news ↗

Частые вопросы

Чем Mistral Small 4 отличается от Mistral Small 3?

Mistral Small 4 имеет принципиально другую архитектуру: это 119B MoE с 6,5B активных параметров, а не плотная 24B-модель. Она объединяет четыре ранее отдельных семейства моделей Mistral (Magistral, Pixtral, Devstral, Mistral Small) в одну. Добавлена поддержка vision, настраиваемый reasoning_effort и контекст в 256K токенов. Mistral заявляет о снижении задержки на 40% и трёхкратном увеличении пропускной способности по сравнению с Small 3.

переработано TheRoutermistral.ai ↗
Могу ли я использовать Mistral Small 4 через стандартный OpenAI SDK (Python/TypeScript)?

Да — TheRouter предоставляет полностью совместимые с OpenAI эндпоинты на api.therouter.ai/v1. Просто установите baseURL и ваш API-ключ TheRouter, укажите model: 'mistral/mistral-small-4'. Параметр reasoning_effort передаётся как поле верхнего уровня — некоторым SDK может потребоваться @ts-expect-error, если они не пробрасывают неизвестные ключи.

Является ли Mistral Small 4 открытым исходным кодом? Могу ли я запустить её на своём оборудовании?

Веса модели выпущены под лицензией Apache 2.0 — это open-weight, означающее, что вы можете развёртывать, дообучать и распространять веса без ограничений. Для self-host требуется минимум 4× NVIDIA H100, 2× HGX H200 или 1× DGX B200. Поддерживаемые фреймворки: vLLM, SGLang, llama.cpp и Transformers.

переработано TheRouterhuggingface.co ↗
Как работает параметр reasoning_effort?

Установите reasoning_effort в 'none' для быстрых прямых ответов (скорость сопоставима с Mistral Small 3.2). Установите 'high' для активации пошагового рассуждения глубиной уровня Magistral. Это устраняет необходимость поддерживать отдельные развёртывания быстрой и рассуждающей модели — одна модель обрабатывает оба режима. Параметр передаётся как поле верхнего уровня в теле запроса chat completion.

переработано TheRouterdocs.mistral.ai ↗
Каковы результаты бенчмарков Mistral Small 4?

Mistral сообщает, что Small 4 достигает AA LCR 0.72 (с заметно лаконичным выводом ~1,6K символов против 5,8-6,1K у сопоставимых моделей Qwen). Превосходит GPT-OSS 120B на LiveCodeBench с 20% меньшим объёмом вывода и сопоставима с GPT-OSS 120B на AIME 2025. Более подробные сторонние данные бенчмарков ожидаются по мере публикации независимых оценок.

переработано TheRoutermistral.ai ↗
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаmistral.ai ↗2026-05-27проверено
Архитектураdocs.mistral.ai ↗2026-05-27проверено
Длина контекста (upstream)huggingface.co ↗2026-05-27проверено
Дата отсечения данных——неизвестно
Лицензияhuggingface.co ↗2026-05-27проверено
Поддерживаемые backend инференсаhuggingface.co ↗2026-05-27проверено
Минимальное оборудование для self-hostmistral.ai ↗2026-05-27к проверке
AA LCRmistral.ai ↗2026-05-27к проверке
LiveCodeBenchmistral.ai ↗2026-05-27к проверке
AIME 2025mistral.ai ↗2026-05-27к проверке
Представление Mistral Small 4mistral.ai/news ↗2026-05-27проверено
Чем Mistral Small 4 отличается от Mistral Small 3?mistral.ai ↗2026-05-27к проверке
Могу ли я использовать Mistral Small 4 через стандартный OpenAI SDK (Python/TypeScript)?docs.therouter.ai ↗2026-05-27к проверке
Является ли Mistral Small 4 открытым исходным кодом? Могу ли я запустить её на своём оборудовании?huggingface.co ↗2026-05-27к проверке
Как работает параметр reasoning_effort?docs.mistral.ai ↗2026-05-27к проверке
Каковы результаты бенчмарков Mistral Small 4?mistral.ai ↗2026-05-27к проверке
Помощь и контакты