返回模型列表

Llama 4 Maverick

metameta/llama-4-maverick

Llama 4 Maverick (400B total, 17B active, 128 experts MoE) offers industry-leading performance in image and text understanding with support for 12 languages. Great for precise image understanding and creative writing. Our product workhorse model for general assistant and chat use cases.

Llama 4 Maverick 于 2025 年 4 月 5 日发布,是 Meta 旗舰级开放权重多模态语言模型。它采用 128 专家混合专家(MoE)架构,总参数量 4000 亿,每次前向传递仅激活 170 亿参数,以极低推理成本提供前沿级文本与图像推理能力。该模型支持 100 万 token 上下文窗口、12 种语言以及最多 5 张同时输入的图片。

从 TheRouter 路由视角看,Maverick 是目前最高能力的 Meta 模型,价格为每百万 token $0.30/$1.25——通过 MoE 稀疏化,以相近成本获得了与密集模型相比 400 倍的参数优势。它在精准图像理解、多语言助手任务和长上下文文档处理方面表现出色。对于无需完整 100 万上下文的任务,其兄弟模型 Llama 4 Scout(17Bx16E,10M 上下文)在轻量工作负载下成本更低。Maverick 的开放权重与 Llama 4 社区许可证使其既适合商业部署,也适合自托管推理管道。

适合使用
  • • 结合文本与图像的多模态推理任务,如图表分析、视觉问答以及含嵌入图表的文档解析
  • • 最长 100 万 token 的长上下文文档分析——大型代码库审查、合同综合、多报告摘要
  • • 12 种原生支持语言(含阿拉伯语、印地语、印度尼西亚语)的多语言助手与翻译工作负载
  • • 需要开放权重、商业许可自由度以及 MoE 高效服务的自托管推理管道
  • • 创意写作和通用助手对话,在这些场景中高吞吐量和低延迟比最先进的推理深度更重要
不适合使用
  • • 复杂推理链和数学奥林匹克级别的问题——这类任务应路由至 deepseek/deepseek-r1 或 anthropic/claude-opus-4.7
  • • 需要顶级 SWE-bench 可靠性的生产级代理编码与工具调用循环——请使用 anthropic/claude-sonnet-4.6 或 openai/gpt-5.2-codex
  • • 超长上下文(超过 100 万 token)——应路由至支持 1000 万 token 窗口的 meta/llama-4-scout

供应商自营与 TheRouter 服务形态的差异

供应商自己运营时

Meta 以开放权重形式发布 Llama 4 Maverick 供自托管使用,也将其作为 Meta AI 模型介绍。运营方可在 Llama 4 社区许可证下直接运行 BF16 或 FP8 checkpoint。

在 TheRouter 上

TheRouter 将该模型作为 api.therouter.ai/v1 上兼容 OpenAI 的 chat 与 vision endpoint 提供,不暴露 Meta 原始 checkpoint、自托管控制、训练期安全栈或 Meta AI 消费级产品界面。

上下文长度
1M
最大输出
16K
输入价格每百万 tokens
$0.2592每百万 Tokens
输出价格每百万 tokens
$1.05每百万 Tokens

模态能力

文本图像→文本

能力

视觉理解

价格明细

类型费率
输入$0.2592 每百万 Tokens
输出$1.05 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

模型规格

发布日期2025 年 4 月 5 日huggingface.co ↗已核实
架构混合专家(MoE)——128 个专家,交替密集层与 MoE 层ai.meta.com ↗已核实
总参数量4000 亿huggingface.co ↗已核实
每次前向传递激活参数量170 亿ai.meta.com ↗已核实
上下文窗口1,000,000 token(1M)huggingface.co ↗已核实
训练 token 数量约 22 万亿 tokenhuggingface.co ↗已核实
训练数据截止2024 年 8 月huggingface.co ↗已核实
支持语言12 种原生支持(阿拉伯语、英语、法语、德语、印地语、印度尼西亚语、意大利语、葡萄牙语、西班牙语、他加禄语、泰语、越南语)huggingface.co ↗已核实
许可Llama 4 社区许可证(自定义商业许可;允许用于 Meta 产品/服务)github.com/meta-llama ↗已核实
多模态输入支持文本 + 图像(每次请求最多 5 张图)huggingface.co ↗已核实

基准成绩

BenchmarkDistributionScoreSource
MMLU
预训练模型评测;Meta 报告的 Llama 4 Maverick 5-shot macro_avg/acc_char。
85.5%%github.com/meta-llama ↗
MMLU Pro
指令微调模型评测;Meta 报告的 0-shot macro_avg/acc。
80.5%%github.com/meta-llama ↗
GPQA Diamond
指令微调模型评测;Meta 报告的 0-shot accuracy。
69.8%%github.com/meta-llama ↗
MATH
预训练模型评测;Meta 报告的 4-shot em_maj1@1。
61.2%%github.com/meta-llama ↗
MMMU
指令微调图像推理评测;Meta 报告的 0-shot accuracy。
73.4%%github.com/meta-llama ↗
MathVista
指令微调图像推理评测;Meta 报告的 0-shot accuracy。
73.7%%github.com/meta-llama ↗
ChartQA
指令微调图像理解评测;Meta 报告的 0-shot relaxed_accuracy。
90.0%%github.com/meta-llama ↗
MBPP
预训练代码评测;Meta 报告的 3-shot pass@1。
77.6%%github.com/meta-llama ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "meta/llama-4-maverick",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

Chat 调用

标准 OpenAI 兼容的 chat 接口,只需修改 baseURL 和模型名,无需更改 SDK。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "meta/llama-4-maverick",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

meta 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-04-05

Meta 发布 Llama 4 Maverick 与 Scout——开放多模态 MoE 系列

Meta 于 2025 年 4 月 5 日推出 Llama 4 系列,发布了两款开放权重多模态模型:Maverick(17Bx128E,4000 亿总参数,100 万 token 上下文)和 Scout(17Bx16E,1090 亿总参数,1000 万 token 上下文)。两者均采用早期融合 MoE 架构,支持原生图像与文本推理,训练 token 数量分别约为 22 万亿和 40 万亿,知识截止日期为 2024 年 8 月。此次发布确立了 Meta 作为竞争性开放权重多模态模型的地位。

TheRouter 编辑重写ai.meta.com ↗

常见问题

Llama 4 Maverick 和 Llama 4 Scout 有什么区别?

两者均有 170 亿激活参数,但 Maverick 有 128 个专家(总参数 4000 亿),而 Scout 只有 16 个专家(总参数 1090 亿),使 Maverick 在复杂推理、编码和多模态任务上表现明显更强。Scout 则以 10 倍更长的上下文窗口(1000 万 vs. 100 万 token)和更低的推理成本作为补偿,在上下文范围比单 token 推理质量更重要的超长文档任务中更为合适。

我可以自托管 Llama 4 Maverick 吗?

可以——权重在 Hugging Face 上以 Llama 4 社区许可证公开提供,允许商业使用。由于总参数量为 4000 亿、每次前向传递 170 亿激活参数,Maverick 需要分布式推理基础设施(通常通过 vLLM 或 TensorRT-LLM 等框架进行多 GPU 服务)。对于希望通过托管 API 访问而无需承担基础设施负担的团队,TheRouter 提供按需访问,价格为每百万 token $0.30/$1.25,无需自行运维 GPU。

每次 API 请求最多可以发送多少张图片?

Meta 的模型卡指出,Llama 4 Maverick 的图像理解测试覆盖每次请求最多 5 张输入图片。超过 5 张图片的请求在技术上可行,但超出了经验证的范围——结果可能下降,Meta 对此类使用不承担责任。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期huggingface.co ↗2026-06-10已核实
架构ai.meta.com ↗2026-06-10已核实
总参数量huggingface.co ↗2026-06-10已核实
每次前向传递激活参数量ai.meta.com ↗2026-06-10已核实
上下文窗口huggingface.co ↗2026-06-10已核实
训练 token 数量huggingface.co ↗2026-06-10已核实
训练数据截止huggingface.co ↗2026-06-10已核实
支持语言huggingface.co ↗2026-06-10已核实
许可github.com/meta-llama ↗2026-06-10已核实
多模态输入支持huggingface.co ↗2026-06-10已核实
MMLUgithub.com/meta-llama ↗2026-08-09已核实
MMLU Progithub.com/meta-llama ↗2026-08-09已核实
GPQA Diamondgithub.com/meta-llama ↗2026-08-09已核实
MATHgithub.com/meta-llama ↗2026-08-09已核实
MMMUgithub.com/meta-llama ↗2026-08-09已核实
MathVistagithub.com/meta-llama ↗2026-08-09已核实
ChartQAgithub.com/meta-llama ↗2026-08-09已核实
MBPPgithub.com/meta-llama ↗2026-08-09已核实
Meta 发布 Llama 4 Maverick 与 Scout——开放多模态 MoE 系列ai.meta.com ↗2026-06-10已核实
Llama 4 Maverick 和 Llama 4 Scout 有什么区别?huggingface.co ↗2026-06-10待核实
我可以自托管 Llama 4 Maverick 吗?github.com/meta-llama ↗2026-06-10待核实
每次 API 请求最多可以发送多少张图片?huggingface.co ↗2026-06-10待核实
帮助与联系