Mistral Small 4 正式发布
Mistral AI 发布了 Mistral Small 4(mistral-small-2603),一个 119B MoE 模型,将 Magistral 推理、Pixtral 多模态、Devstral 编码和 Mistral Small 指令跟随能力统一到单个开源(Apache 2.0)部署中。关键功能包括可配置的 reasoning_effort、256K 上下文和在 4× H100 GPU 上的自部署能力。
Mistral's 2026-03 unified small model (119B MoE, 6B active). Combines Magistral (reasoning), Pixtral (multimodal), and Devstral (agentic coding) capabilities into a single model.
Mistral Small 4 是一个 1190 亿参数的混合专家(MoE)模型,2026 年 3 月 16 日发布,采用 Apache 2.0 许可。每 token 仅激活 6.5B 参数(128 专家中激活 4 个),它将此前四个独立的 Mistral 模型家族——Magistral(推理)、Pixtral(多模态)、Devstral(agent 编码)和 Mistral Small(指令跟随)——统一到单个可部署模型中。这是 Mistral 首个将非旗舰产品整合为单一架构的模型,显著简化了生产部署时的路由逻辑。
对于 TheRouter 的路由操作者而言,Mistral Small 4 是一款高性价比的「瑞士军刀」——同一端点即可处理视觉、工具调用、推理和编码任务,输入价格 $0.20/百万 token(通过 TheRouter)。可配置的 reasoning_effort 参数(none/high)允许按请求调节计算量,无需维护多个模型即可同时满足快速对话与深度推理。上游支持 256K token 上下文窗口,可在中等规模多 GPU(最低 4× H100 或 2× H200)上自部署。
| 类型 | 费率 |
|---|---|
| 输入 | $0.162 每百万 Tokens |
| 输出 | $0.648 每百万 Tokens |
| 发布日期 | 2026-03-16mistral.ai ↗ | 已核实 |
| 架构 | 119B 总参数 / 6.5B 激活参数 — MoE(128 专家,每 token 激活 4 个);分组查询注意力(GQA)Transformerdocs.mistral.ai ↗ | 已核实 |
| 上游上下文长度 | 262,144 tokens(256K);TheRouter 按标准配置提供 131,072huggingface.co ↗ | 已核实 |
| 训练数据截止 | 未公开披露 | 未知 |
| 许可 | Apache 2.0(允许商用,无使用上限)huggingface.co ↗ | 已核实 |
| 支持的推理后端 | vLLM、SGLang、llama.cpp、Transformers、NVIDIA NIMhuggingface.co ↗ | 已核实 |
| 自部署最低硬件要求 | 4× NVIDIA HGX H100、2× HGX H200 或 1× DGX B200mistral.ai ↗ | 待核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
AA LCR Academic Agent LiveCodeBench Reasoning。得分仅用约 1.6K 字符输出即达成——显著比需要 5.8-6.1K 字符才能达到类似得分的 Qwen 模型更简洁 | 0.72 | mistral.ai ↗ | |
LiveCodeBench Mistral 报告;超越 GPT-OSS 120B 且输出减少 20% | Outperforms GPT-OSS 120B | mistral.ai ↗ | |
AIME 2025 2025 年美国数学邀请赛(AIME)——以更短输出与 GPT-OSS 120B 持平 | Matches GPT-OSS 120B | mistral.ai ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "mistral/mistral-small-4",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'基础对话调用,用于测试端点或执行对话任务。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mistral/mistral-small-4",
"messages": [
{"role": "user", "content": "Explain the difference between MoE and dense transformer models"}
]
}'Mistral AI 发布了 Mistral Small 4(mistral-small-2603),一个 119B MoE 模型,将 Magistral 推理、Pixtral 多模态、Devstral 编码和 Mistral Small 指令跟随能力统一到单个开源(Apache 2.0)部署中。关键功能包括可配置的 reasoning_effort、256K 上下文和在 4× H100 GPU 上的自部署能力。
Mistral Small 4 架构完全不同:119B MoE 仅激活 6.5B 参数,而非稠密 24B 模型。它将四个此前独立的 Mistral 模型家族(Magistral、Pixtral、Devstral、Mistral Small)统一到同一模型中。新增了视觉支持、可配置 reasoning_effort 和 256K 上下文窗口。Mistral 声称相比 Small 3 延迟降低 40%、吞吐量提升 3 倍。
可以——TheRouter 在 api.therouter.ai/v1 提供完全兼容 OpenAI 的端点。只需设置 baseURL 和 TheRouter API key,指定 model: 'mistral/mistral-small-4'。reasoning_effort 参数作为顶层请求字段传递——部分 SDK 若不转发未知键可能需要 @ts-expect-error。
模型权重以 Apache 2.0 许可发布——属于开放权重(open-weight),允许无限制地部署、微调和再分发。自部署需要至少 4× NVIDIA H100、2× HGX H200 或 1× DGX B200。支持的推理框架包括 vLLM、SGLang、llama.cpp 和 Transformers。
将 reasoning_effort 设为 'none' 可获得快速直接回复(速度接近 Mistral Small 3.2);设为 'high' 可激活与 Magistral 同等深度的分步推理。这避免了维护两套部署(快速模式 + 推理模式)的需要——同一模型即可处理两种模式。参数作为 chat completion 请求体中的顶层字段传递。
Mistral 报告 Small 4 在 AA LCR 上得分 0.72(输出极简洁,仅约 1.6K 字符,而同类 Qwen 模型需 5.8-6.1K 字符)。在 LiveCodeBench 上超越 GPT-OSS 120B 且输出减少 20%,在 AIME 2025 上与 GPT-OSS 120B 持平。更多第三方基准数据有待独立评估方发布。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | mistral.ai ↗ | 2026-05-27 | 已核实 |
| 架构 | docs.mistral.ai ↗ | 2026-05-27 | 已核实 |
| 上游上下文长度 | huggingface.co ↗ | 2026-05-27 | 已核实 |
| 训练数据截止 | — | — | 未知 |
| 许可 | huggingface.co ↗ | 2026-05-27 | 已核实 |
| 支持的推理后端 | huggingface.co ↗ | 2026-05-27 | 已核实 |
| 自部署最低硬件要求 | mistral.ai ↗ | 2026-05-27 | 待核实 |
| AA LCR | mistral.ai ↗ | 2026-05-27 | 待核实 |
| LiveCodeBench | mistral.ai ↗ | 2026-05-27 | 待核实 |
| AIME 2025 | mistral.ai ↗ | 2026-05-27 | 待核实 |
| Mistral Small 4 正式发布 | mistral.ai/news ↗ | 2026-05-27 | 已核实 |
| Mistral Small 4 和 Mistral Small 3 有什么不同? | mistral.ai ↗ | 2026-05-27 | 待核实 |
| 能否通过标准 OpenAI Python/TypeScript SDK 调用 Mistral Small 4? | docs.therouter.ai ↗ | 2026-05-27 | 待核实 |
| Mistral Small 4 是开源的吗?能否在自有硬件上运行? | huggingface.co ↗ | 2026-05-27 | 待核实 |
| reasoning_effort 参数如何工作? | docs.mistral.ai ↗ | 2026-05-27 | 待核实 |
| Mistral Small 4 的基准测试分数如何? | mistral.ai ↗ | 2026-05-27 | 待核实 |