Mistral 3 系列发布——从 3B 到 675B
Mistral AI 于 2025 年 12 月 2 日发布了完整的 Mistral 3 模型系列,从超紧凑的 Ministral 3 3B 到旗舰 Mistral Large 3 (675B)。全系列在 NVIDIA Hopper GPU 上训练,大部分成员以 Apache 2.0 开放权重。Ministral 3 3B 专门面向边缘和设备端部署,总参数量 3.8B 并包含视觉编码器。
Mistral's smallest model at 3B parameters. Ultra-fast and cost-efficient for lightweight tasks.
Ministral 3 3B 是 Mistral 3 系列中最小成员,于 2025 年 12 月 2 日发布。拥有 34 亿语言模型参数和 4 亿视觉编码器,在紧凑封装中提供稳健的文本与图像理解能力,专为边缘部署设计。采用 Apache 2.0 许可证,提供指令微调和推理微调两种变体,FP8 精度下仅需约 8 GB 显存——可在消费级硬件上运行,无需 GPU 集群。
尽管体积微小,Ministral 3 3B 在推理基准如 AIME 2025(72.1%)和 LiveCodeBench(54.8%)上表现强劲,在多个直接对比中超越 Qwen3 4B。它支持包括原生函数调用、结构化 JSON 输出在内的智能体能力,拥有 256K 上下文窗口,覆盖 10+ 种语言,每轮提示支持最多 10 张图像输入。对于成本敏感、边缘或设备端工作负载,它是 2026 年第二季度最具竞争力的超紧凑模型之一。
| 类型 | 费率 |
|---|---|
| 输入 | $0.108 每百万 Tokens |
| 输出 | $0.108 每百万 Tokens |
| 发布日期 | 2025-12-02AWS Bedrock model card ↗ | 已核实 |
| 架构 | 3.4B 语言模型 + 0.4B 视觉编码器 = 3.8B 总参数,密集 Transformer,GQA(32 查询头 / 8 KV头)Hugging Face model card ↗ | 已核实 |
| 上下文窗口 | 256K tokens (262,144)Hugging Face model card ↗ | 已核实 |
| 最大输出 Token | 8K tokensAWS Bedrock model card ↗ | 已核实 |
| 训练数据截止 | 未公开披露 | 未知 |
| 许可 | Apache 2.0Hugging Face — License ↗ | 已核实 |
| 支持语言 | 10 多种语言,包括中、英、法、西、德、意、葡、荷、日、韩、阿拉伯语Hugging Face — Languages ↗ | 已核实 |
| 推荐温度参数 | 0.1Hugging Face — Recommended settings ↗ | 已核实 |
| 显存需求(FP8) | 约 8 GBHugging Face — Deployability ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
AIME 2025 Ministral 3 3B(推理版)——在 4B 以下模型中领先,超越 Qwen3 4B(69.7%) | 72.1%% | Hugging Face — Reasoning benchmarks ↗ | |
AIME 2024 | 77.5%% | Hugging Face — Reasoning benchmarks ↗ | |
GPQA Diamond | 53.4%% | Hugging Face — Reasoning benchmarks ↗ | |
LiveCodeBench 在 4B 以下模型中领先,超越 Qwen3 4B(51.3%) | 54.8%% | Hugging Face — Reasoning benchmarks ↗ | |
Arena Hard | 30.5%% | Hugging Face — Instruct benchmarks ↗ | |
WildBench | 56.8 | Hugging Face — Instruct benchmarks ↗ | |
MATH Maj@1 | 83.0%% | Hugging Face — Instruct benchmarks ↗ | |
MM MTBench 分数归一化为 78.3% 用于柱状图显示 | 7.83 / 10/10 | Hugging Face — Instruct benchmarks ↗ | |
Multilingual MMLU | 65.2%% | Hugging Face — Base benchmarks ↗ | |
MMLU (5-shot) | 70.7%% | Hugging Face — Base benchmarks ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "mistral/ministral-3b",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'标准聊天补全,支持系统提示词和多轮对话。流式响应实现实时用户体验。
curl https://api.therouter.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-d '{
"model": "mistral/ministral-3b",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Classify this sentence: The cat sat on the mat."}
],
"temperature": 0.1,
"max_tokens": 256,
"stream": true
}'Mistral AI 于 2025 年 12 月 2 日发布了完整的 Mistral 3 模型系列,从超紧凑的 Ministral 3 3B 到旗舰 Mistral Large 3 (675B)。全系列在 NVIDIA Hopper GPU 上训练,大部分成员以 Apache 2.0 开放权重。Ministral 3 3B 专门面向边缘和设备端部署,总参数量 3.8B 并包含视觉编码器。
Ministral 3 3B 提供两种微调变体。指令版(FP8 权重)针对聊天、指令遵循和工具使用进行微调——是大多数生产场景的推荐默认选择。推理版(BF16 权重)针对思维链推理进行后训练,更适合数学、编程和 STEM 任务,但显存需求略高。
可以。在 FP8 精度下,Ministral 3 3B 需要约 8 GB 显存——适配单块 RTX 4060 (12 GB) 或至少 8 GB 统一内存的 Apple Silicon Mac。进一步量化(INT4)后,可在更基础的硬件上运行。这使其成为完全本地、离线 AI 助手中最有能力的模型之一。
是的。该模型拥有一个专用 4 亿参数视觉编码器与 34 亿语言模型配合,每个提示支持最多 10 张图像。图像可通过 base64 data URL 或远程 URL 在 content 数组中提供。Mistral 建议保持图像接近 1:1 的宽高比以获得最佳性能。
Apache 2.0——允许免费使用、修改和分发,可用于商业和非商业目的。这也是整个 Ministral 3 系列使用的开源许可证,使其成为许可最宽松、能力最强的边缘模型之一。