NVIDIA 发布 Nemotron 3 Super — 面向智能体推理的开源混合 MoE 模型
NVIDIA 开源发布了 Nemotron 3 Super(120B-A12B),这是一款混合 Mamba-2 + Attention + LatentMoE 模型,原生支持 1M 上下文。专为多智能体系统构建,具备多 Token 预测、面向 Blackwell 的 NVFP4 预训练,以及覆盖 21 种配置的多环境强化学习后训练。发布当日即支持通过 AWS Bedrock 使用。
NVIDIA's hybrid LatentMoE model (120B total, 12B active). Mamba-2 + Attention + MoE architecture with 1M context. Multi-Token Prediction for fast inference.
NVIDIA Nemotron 3 Super(120B 总参数量 / 12B 激活参数量)是一款开源的混合 LatentMoE 模型,专为智能体推理、编程及长上下文多智能体工作流而设计。该模型于 2026 年 3 月发布,是 NVIDIA Nemotron 3 系列的旗舰模型——也是首款采用 LatentMoE 架构的模型,通过将 Token 表示压缩后再进行专家路由,在相同推理成本下激活 4 倍的专家数量。模型原生支持 1M Token 的上下文窗口,使 AI 智能体能够在代码库、文档集合和长时间的多轮工具使用会话中保持长期记忆。
该模型交错使用 Mamba-2 状态空间层(高效长序列处理)和注意力层(精确关联召回),并采用多 Token 预测(MTP)技术在每次前向传播中预测多个未来 Token——从而实现内建推测解码。模型经过超过 25T Token 的预训练,并通过多环境强化学习(超过 120 万次 NeMo Gym 回滚)微调,在 PinchBench(85.6%)、SWE-Bench Verified 和 Terminal-Bench 等智能体基准中表现优异,且吞吐量相比前代提升最高 5 倍。在 TheRouter 上,该模型通过 AWS Bedrock 路由,模型 ID 为 nvidia.nemotron-super-3-120b。
NVIDIA 将 Nemotron 3 Super 作为开放权重、数据集、训练配方、NIM 部署和原生 1M Token 上下文模型发布。AWS Bedrock 以 nvidia.nemotron-super-3-120b 提供同一模型,开放 256K 上下文、32K 最大输出、纯文本输入输出、Chat Completions、Invoke、Converse、流式响应、结构化输出、guardrails 和客户端工具调用。
TheRouter 将其作为 nvidia/nemotron-super-120b 通过 OpenAI 兼容 /v1/chat/completions 暴露。面向客户的上下文、输出、价格、模态和支持参数以 TheRouter 实时 catalog 为准;本页面记录上游 Bedrock 模型卡比 NVIDIA 原生 1M 上下文更窄,并说明 snippets 在运营者付费验证前保持封顶状态。
| 类型 | 费率 |
|---|---|
| 输入 | $0.162 每百万 Tokens |
| 输出 | $0.702 每百万 Tokens |
| 发布日期 | 2026-03-11developer.nvidia.com ↗ | 已核实 |
| 架构 | 混合 LatentMoE — Mamba-2 SSM + Attention + MoE(120B 总参数量,12B 激活参数)research.nvidia.com ↗ | 已核实 |
| 原生上下文长度 | 1,000,000 Token(1M)developer.nvidia.com ↗ | 已核实 |
| AWS Bedrock 上下文 | 256K Token(AWS Bedrock 开放原生 1M 的子集)docs.aws.amazon.com ↗ | 已核实 |
| 最大输出 (TheRouter) | 262,144 Tokendocs.aws.amazon.com ↗ | 已核实 |
| 训练数据 | 25T+ Token — 爬取和合成的代码、数学、科学、通用知识;数据集完全公开build.nvidia.com ↗ | 已核实 |
| 后训练 | 多环境强化学习(超过 120 万次 NeMo Gym 回滚,21 个环境)developer.nvidia.com ↗ | 已核实 |
| 许可协议 | NVIDIA 开源模型许可www.nvidia.com ↗ | 已核实 |
| 支持的语言 | 英语、法语、德语、意大利语、日语、西班牙语、中文aws.amazon.com ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
PinchBench 智能体编排基准 — 发布时同类最佳开源模型 | 85.6%% | developer.nvidia.com ↗ | |
AIME 2025 | — | 未公开披露 | — |
MMLU-Pro | 83.73% | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | |
GPQA (with tools) | 82.70%% | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | |
Arena-Hard V2 低于专用对话模型 — 模型针对智能体执行优化,非对话 | 73.88%% | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | |
RULER 长上下文检索基准 — 每任务 100 个样本,针堆里捞针表现优异 | High (leading open model) | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | |
TerminalBench 2.0 | 31.00points | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | |
SWE-Bench Verified AWS 博客强调在 SWE-Bench 及其多语言变体上表现优异,但未发布精确分数 | — | 未公开披露 | — |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "nvidia/nemotron-super-120b",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'Nemotron 3 Super 通过 TheRouter API 支持与 OpenAI 兼容的 Chat Completion。模型支持工具调用、tool_choice、response_format(JSON 模式)、stop 序列、temperature、top_p 和 max_tokens。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-super-120b",
"messages": [
{"role": "system", "content": "You are a helpful AI assistant."},
{"role": "user", "content": "Write a Python function to recursively find all .py files in a directory."}
],
"temperature": 0.3,
"max_tokens": 4096
}'NVIDIA 开源发布了 Nemotron 3 Super(120B-A12B),这是一款混合 Mamba-2 + Attention + LatentMoE 模型,原生支持 1M 上下文。专为多智能体系统构建,具备多 Token 预测、面向 Blackwell 的 NVFP4 预训练,以及覆盖 21 种配置的多环境强化学习后训练。发布当日即支持通过 AWS Bedrock 使用。
AWS 发布了在 Bedrock 上运行 Nemotron 3 Super 的详细指南,涵盖从软件开发到安全分类的用例。该模型通过 bedrock-runtime 和 bedrock-mantle 端点提供服务,支持 Standard、Priority 和 Flex 层。
DeepInfra 宣布支持 Nemotron 3 Super 并提供优化推理。该平台强调了其 LatentMoE 架构和 1M 上下文窗口作为智能体 AI 工作负载的关键差异化优势。
在标准 MoE 中,Token 以完整隐藏维度路由到专家,随着模型增大会产生计算瓶颈。LatentMoE 在路由之前将 Token 嵌入压缩到低秩潜在空间,从而在相同推理成本下最多可咨询 4 倍的专家数量。这实现了更细粒度的专家专业化——例如,为 Python 语法和 SQL 逻辑分别使用不同的专家——仅在需要时激活。
模型的原生架构支持 1M Token 的上下文窗口,但具体暴露的上限取决于服务平台。在 AWS Bedrock(TheRouter 当前对该模型的路由后端)上,配置为 256K Token 上下文和 32K 最大输出。模型的 Mamba-2 层使完整的 1M 上下文在计算上切实可行,不像纯注意力模型那样长上下文会二次方地降低吞吐量。
Nemotron 3 Super 是 Nemotron 3 系列的第一款模型。它的前身是早期的 Nemotron Super 模型(稠密 120B)。3 Super 通过混合 MoE 架构(稠密 → 12B 激活)实现了最高 5 倍的吞吐量提升,引入 LatentMoE 实现 4 倍专家路由,使用多 Token 预测进行推测解码,并支持原生 1M 上下文。更小的兄弟模型(Nano 30B,3.5B 激活)于 2025 年 12 月为边缘部署发布。
它可以用于聊天,但其 Arena-Hard V2 分数(73.88%)表明它落后于专用对话模型。Nemotron 3 Super 针对智能体、多轮问题求解进行了优化,在这些场景中工具使用、长上下文和高吞吐量最为重要。对于开放性创意对话,建议考虑 deepseek/deepseek-v3.1 或 meta/llama-4-maverick。
Nemotron 3 Super 支持 temperature、max_tokens、top_p、tools(函数调用)、tool_choice、response_format(JSON 模式)和 stop 序列。支持流式调用。模型通过 TheRouter 的 v1/chat/completions OpenAI 兼容端点经 AWS Bedrock 路由。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | developer.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 架构 | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 原生上下文长度 | developer.nvidia.com ↗ | 2026-05-28 | 已核实 |
| AWS Bedrock 上下文 | docs.aws.amazon.com ↗ | 2026-05-28 | 已核实 |
| 最大输出 (TheRouter) | docs.aws.amazon.com ↗ | 2026-05-28 | 已核实 |
| 训练数据 | build.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 后训练 | developer.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 许可协议 | www.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 支持的语言 | aws.amazon.com ↗ | 2026-05-28 | 已核实 |
| PinchBench | developer.nvidia.com ↗ | 2026-05-28 | 已核实 |
| AIME 2025 | aws.amazon.com ↗ | 2026-05-28 | 未知 |
| MMLU-Pro | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | 2026-08-25 | 已核实 |
| GPQA (with tools) | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | 2026-08-25 | 已核实 |
| Arena-Hard V2 | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | 2026-08-25 | 已核实 |
| RULER | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | 2026-08-25 | 已核实 |
| TerminalBench 2.0 | NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗ | 2026-08-25 | 已核实 |
| SWE-Bench Verified | aws.amazon.com ↗ | 2026-05-28 | 未知 |
| NVIDIA 发布 Nemotron 3 Super — 面向智能体推理的开源混合 MoE 模型 | developer.nvidia.com ↗ | 2026-05-28 | 已核实 |
| AWS Bedrock 推出 Nemotron 3 Super,提供全托管推理 | aws.amazon.com ↗ | 2026-05-28 | 已核实 |
| DeepInfra 提供 Nemotron 3 Super,支持快速推理 | deepinfra.com ↗ | 2026-05-28 | 已核实 |
| LatentMoE 与标准 MoE 有何不同? | developer.nvidia.com ↗ | 2026-05-28 | 待核实 |
| Nemotron 3 Super 实际支持多长的上下文窗口? | docs.aws.amazon.com ↗ | 2026-05-28 | 待核实 |
| Nemotron 3 Super 与 NVIDIA 之前的模型相比如何? | developer.nvidia.com ↗ | 2026-05-28 | 待核实 |
| Nemotron 3 Super 适合单轮聊天机器人使用吗? | llm-stats.com ↗ | 2026-05-28 | 待核实 |
| TheRouter API 支持哪些工具/参数? | docs.aws.amazon.com ↗ | 2026-05-28 | 待核实 |