返回模型列表

Mistral Small 4

mistralmistral/mistral-small-4

Mistral's 2026-03 unified small model (119B MoE, 6B active). Combines Magistral (reasoning), Pixtral (multimodal), and Devstral (agentic coding) capabilities into a single model.

Mistral Small 4 是一个 1190 亿参数的混合专家(MoE)模型,2026 年 3 月 16 日发布,采用 Apache 2.0 许可。每 token 仅激活 6.5B 参数(128 专家中激活 4 个),它将此前四个独立的 Mistral 模型家族——Magistral(推理)、Pixtral(多模态)、Devstral(agent 编码)和 Mistral Small(指令跟随)——统一到单个可部署模型中。这是 Mistral 首个将非旗舰产品整合为单一架构的模型,显著简化了生产部署时的路由逻辑。

对于 TheRouter 的路由操作者而言,Mistral Small 4 是一款高性价比的「瑞士军刀」——同一端点即可处理视觉、工具调用、推理和编码任务,输入价格 $0.20/百万 token(通过 TheRouter)。可配置的 reasoning_effort 参数(none/high)允许按请求调节计算量,无需维护多个模型即可同时满足快速对话与深度推理。上游支持 256K token 上下文窗口,可在中等规模多 GPU(最低 4× H100 或 2× H200)上自部署。

适合使用
  • 统一聊天 + 推理 + 编码——单一模型同时处理快速问答、图片文档分析、分步数学推理和代码生成,无需为不同模式维护独立部署
  • 成本敏感的生产管道——每 token 仅 6.5B 激活参数和 MoE 效率使 Mistral Small 4 在高吞吐场景(内容生成、摘要、RAG 管道)具备极佳的性价比
  • 自部署 fallback——Apache 2.0 许可允许在自有硬件上通过 vLLM、SGLang 或 llama.cpp 完全私有部署,同一模型 ID 可在 TheRouter API 和自部署端点之间无缝切换
  • 多模态文档分析——支持图片输入,可在经济价格下完成 PDF、截图和扫描件的结构化提取
不适合使用
  • 竞赛级数学推理——虽然可配置推理能力不俗,但专攻推理的模型(DeepSeek V3.2、GPT-5.2 thinking)在 AIME 2025 等硬基准上表现更强
  • 极高吞吐纯文本对话——如果 100% 流量都是纯文本聊天(无需视觉/推理/编码),专用的 Ministral 8B 或 3B($0.10-$0.15/M 输入)可能更划算
  • 音频输出——Mistral Small 4 仅支持文本/图像输入和文本输出。语音合成任务请路由到 mistral/voxtral-tts 或 fishaudio/fish-speech-1.5
上下文长度
131K
最大输出
16K
输入价格每百万 tokens
$0.162每百万 Tokens
输出价格每百万 tokens
$0.648每百万 Tokens

模态能力

文本图像文本

能力

视觉理解

价格明细

类型费率
输入$0.162 每百万 Tokens
输出$0.648 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatreasoningstop

模型规格

发布日期2026-03-16mistral.ai已核实
架构119B 总参数 / 6.5B 激活参数 — MoE(128 专家,每 token 激活 4 个);分组查询注意力(GQA)Transformerdocs.mistral.ai已核实
上游上下文长度262,144 tokens(256K);TheRouter 按标准配置提供 131,072huggingface.co已核实
训练数据截止未公开披露未知
许可Apache 2.0(允许商用,无使用上限)huggingface.co已核实
支持的推理后端vLLM、SGLang、llama.cpp、Transformers、NVIDIA NIMhuggingface.co已核实
自部署最低硬件要求4× NVIDIA HGX H100、2× HGX H200 或 1× DGX B200mistral.ai待核实

基准成绩

BenchmarkDistributionScoreSource
AA LCR
Academic Agent LiveCodeBench Reasoning。得分仅用约 1.6K 字符输出即达成——显著比需要 5.8-6.1K 字符才能达到类似得分的 Qwen 模型更简洁
0.72mistral.ai
LiveCodeBench
Mistral 报告;超越 GPT-OSS 120B 且输出减少 20%
Outperforms GPT-OSS 120Bmistral.ai
AIME 2025
2025 年美国数学邀请赛(AIME)——以更短输出与 GPT-OSS 120B 持平
Matches GPT-OSS 120Bmistral.ai

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "mistral/mistral-small-4",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

Chat 调用

基础对话调用,用于测试端点或执行对话任务。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral/mistral-small-4",
    "messages": [
      {"role": "user", "content": "Explain the difference between MoE and dense transformer models"}
    ]
  }'

mistral 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2026-03-16

Mistral Small 4 正式发布

Mistral AI 发布了 Mistral Small 4(mistral-small-2603),一个 119B MoE 模型,将 Magistral 推理、Pixtral 多模态、Devstral 编码和 Mistral Small 指令跟随能力统一到单个开源(Apache 2.0)部署中。关键功能包括可配置的 reasoning_effort、256K 上下文和在 4× H100 GPU 上的自部署能力。

TheRouter 编辑重写mistral.ai/news

常见问题

Mistral Small 4 和 Mistral Small 3 有什么不同?

Mistral Small 4 架构完全不同:119B MoE 仅激活 6.5B 参数,而非稠密 24B 模型。它将四个此前独立的 Mistral 模型家族(Magistral、Pixtral、Devstral、Mistral Small)统一到同一模型中。新增了视觉支持、可配置 reasoning_effort 和 256K 上下文窗口。Mistral 声称相比 Small 3 延迟降低 40%、吞吐量提升 3 倍。

TheRouter 编辑重写mistral.ai
能否通过标准 OpenAI Python/TypeScript SDK 调用 Mistral Small 4?

可以——TheRouter 在 api.therouter.ai/v1 提供完全兼容 OpenAI 的端点。只需设置 baseURL 和 TheRouter API key,指定 model: 'mistral/mistral-small-4'。reasoning_effort 参数作为顶层请求字段传递——部分 SDK 若不转发未知键可能需要 @ts-expect-error。

Mistral Small 4 是开源的吗?能否在自有硬件上运行?

模型权重以 Apache 2.0 许可发布——属于开放权重(open-weight),允许无限制地部署、微调和再分发。自部署需要至少 4× NVIDIA H100、2× HGX H200 或 1× DGX B200。支持的推理框架包括 vLLM、SGLang、llama.cpp 和 Transformers。

TheRouter 编辑重写huggingface.co
reasoning_effort 参数如何工作?

将 reasoning_effort 设为 'none' 可获得快速直接回复(速度接近 Mistral Small 3.2);设为 'high' 可激活与 Magistral 同等深度的分步推理。这避免了维护两套部署(快速模式 + 推理模式)的需要——同一模型即可处理两种模式。参数作为 chat completion 请求体中的顶层字段传递。

TheRouter 编辑重写docs.mistral.ai
Mistral Small 4 的基准测试分数如何?

Mistral 报告 Small 4 在 AA LCR 上得分 0.72(输出极简洁,仅约 1.6K 字符,而同类 Qwen 模型需 5.8-6.1K 字符)。在 LiveCodeBench 上超越 GPT-OSS 120B 且输出减少 20%,在 AIME 2025 上与 GPT-OSS 120B 持平。更多第三方基准数据有待独立评估方发布。

TheRouter 编辑重写mistral.ai
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期mistral.ai2026-05-27已核实
架构docs.mistral.ai2026-05-27已核实
上游上下文长度huggingface.co2026-05-27已核实
训练数据截止未知
许可huggingface.co2026-05-27已核实
支持的推理后端huggingface.co2026-05-27已核实
自部署最低硬件要求mistral.ai2026-05-27待核实
AA LCRmistral.ai2026-05-27待核实
LiveCodeBenchmistral.ai2026-05-27待核实
AIME 2025mistral.ai2026-05-27待核实
Mistral Small 4 正式发布mistral.ai/news2026-05-27已核实
Mistral Small 4 和 Mistral Small 3 有什么不同?mistral.ai2026-05-27待核实
能否通过标准 OpenAI Python/TypeScript SDK 调用 Mistral Small 4?docs.therouter.ai2026-05-27待核实
Mistral Small 4 是开源的吗?能否在自有硬件上运行?huggingface.co2026-05-27待核实
reasoning_effort 参数如何工作?docs.mistral.ai2026-05-27待核实
Mistral Small 4 的基准测试分数如何?mistral.ai2026-05-27待核实
客服支持