返回模型列表

Nemotron Super 120B

nvidianvidia/nemotron-super-120b

NVIDIA's hybrid LatentMoE model (120B total, 12B active). Mamba-2 + Attention + MoE architecture with 1M context. Multi-Token Prediction for fast inference.

NVIDIA Nemotron 3 Super(120B 总参数量 / 12B 激活参数量)是一款开源的混合 LatentMoE 模型,专为智能体推理、编程及长上下文多智能体工作流而设计。该模型于 2026 年 3 月发布,是 NVIDIA Nemotron 3 系列的旗舰模型——也是首款采用 LatentMoE 架构的模型,通过将 Token 表示压缩后再进行专家路由,在相同推理成本下激活 4 倍的专家数量。模型原生支持 1M Token 的上下文窗口,使 AI 智能体能够在代码库、文档集合和长时间的多轮工具使用会话中保持长期记忆。

该模型交错使用 Mamba-2 状态空间层(高效长序列处理)和注意力层(精确关联召回),并采用多 Token 预测(MTP)技术在每次前向传播中预测多个未来 Token——从而实现内建推测解码。模型经过超过 25T Token 的预训练,并通过多环境强化学习(超过 120 万次 NeMo Gym 回滚)微调,在 PinchBench(85.6%)、SWE-Bench Verified 和 Terminal-Bench 等智能体基准中表现优异,且吞吐量相比前代提升最高 5 倍。在 TheRouter 上,该模型通过 AWS Bedrock 路由,模型 ID 为 nvidia.nemotron-super-3-120b。

适合使用
  • • 自主智能体编排 — 模型的高吞吐量(12B 激活参数)和长达 1M Token 的上下文使其非常适合多智能体系统,其中监督智能体将子任务分配给专门的智能体、路由工具调用并合并密集的推理链条。
  • • 长上下文代码分析与生成 — Mamba-2 层使 10 万 Token 以上的上下文成为实际可行,支持全仓库推理、差异比较生成以及跨大型代码库的重构。
  • • 网络安全分类与恶意软件分析 — 多环境强化学习训练使模型能够高度可靠地处理多样化的网络安全工具链。
不适合使用
  • • 对话/创意生成 — Arena-Hard V2 分数(73.88%)低于专用对话模型。对于开放式对话或内容创作,建议路由到 deepseek/deepseek-v3.1 或 anthropic/claude-sonnet-4 等模型。
  • • 轻量实时任务 — 120B 参数量(12B 激活)比 Mistral Small 4 或 Gemma-4 等精简替代方案更重。对于延迟敏感的边缘部署,建议路由到更小的模型。

供应商自营与 TheRouter 服务形态的差异

供应商自己运营时

NVIDIA 将 Nemotron 3 Super 作为开放权重、数据集、训练配方、NIM 部署和原生 1M Token 上下文模型发布。AWS Bedrock 以 nvidia.nemotron-super-3-120b 提供同一模型,开放 256K 上下文、32K 最大输出、纯文本输入输出、Chat Completions、Invoke、Converse、流式响应、结构化输出、guardrails 和客户端工具调用。

在 TheRouter 上

TheRouter 将其作为 nvidia/nemotron-super-120b 通过 OpenAI 兼容 /v1/chat/completions 暴露。面向客户的上下文、输出、价格、模态和支持参数以 TheRouter 实时 catalog 为准;本页面记录上游 Bedrock 模型卡比 NVIDIA 原生 1M 上下文更窄,并说明 snippets 在运营者付费验证前保持封顶状态。

上下文长度
1M
最大输出
262K
输入价格每百万 tokens
$0.162每百万 Tokens
输出价格每百万 tokens
$0.702每百万 Tokens

模态能力

文本→文本

价格明细

类型费率
输入$0.162 每百万 Tokens
输出$0.702 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

模型规格

发布日期2026-03-11developer.nvidia.com ↗已核实
架构混合 LatentMoE — Mamba-2 SSM + Attention + MoE(120B 总参数量,12B 激活参数)research.nvidia.com ↗已核实
原生上下文长度1,000,000 Token(1M)developer.nvidia.com ↗已核实
AWS Bedrock 上下文256K Token(AWS Bedrock 开放原生 1M 的子集)docs.aws.amazon.com ↗已核实
最大输出 (TheRouter)262,144 Tokendocs.aws.amazon.com ↗已核实
训练数据25T+ Token — 爬取和合成的代码、数学、科学、通用知识;数据集完全公开build.nvidia.com ↗已核实
后训练多环境强化学习(超过 120 万次 NeMo Gym 回滚,21 个环境)developer.nvidia.com ↗已核实
许可协议NVIDIA 开源模型许可www.nvidia.com ↗已核实
支持的语言英语、法语、德语、意大利语、日语、西班牙语、中文aws.amazon.com ↗已核实

基准成绩

BenchmarkDistributionScoreSource
PinchBench
智能体编排基准 — 发布时同类最佳开源模型
85.6%%developer.nvidia.com ↗
AIME 2025
—未公开披露—
MMLU-Pro
83.73%NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
GPQA (with tools)
82.70%%NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
Arena-Hard V2
低于专用对话模型 — 模型针对智能体执行优化,非对话
73.88%%NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
RULER
长上下文检索基准 — 每任务 100 个样本,针堆里捞针表现优异
High (leading open model)NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
TerminalBench 2.0
31.00pointsNVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
SWE-Bench Verified
AWS 博客强调在 SWE-Bench 及其多语言变体上表现优异,但未发布精确分数
—未公开披露—

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "nvidia/nemotron-super-120b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

Chat 调用

Nemotron 3 Super 通过 TheRouter API 支持与 OpenAI 兼容的 Chat Completion。模型支持工具调用、tool_choice、response_format(JSON 模式)、stop 序列、temperature、top_p 和 max_tokens。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-super-120b",
    "messages": [
      {"role": "system", "content": "You are a helpful AI assistant."},
      {"role": "user", "content": "Write a Python function to recursively find all .py files in a directory."}
    ],
    "temperature": 0.3,
    "max_tokens": 4096
  }'

nvidia 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2026-03-11

NVIDIA 发布 Nemotron 3 Super — 面向智能体推理的开源混合 MoE 模型

NVIDIA 开源发布了 Nemotron 3 Super(120B-A12B),这是一款混合 Mamba-2 + Attention + LatentMoE 模型,原生支持 1M 上下文。专为多智能体系统构建,具备多 Token 预测、面向 Blackwell 的 NVFP4 预训练,以及覆盖 21 种配置的多环境强化学习后训练。发布当日即支持通过 AWS Bedrock 使用。

TheRouter 编辑重写developer.nvidia.com ↗
2026-03-19

AWS Bedrock 推出 Nemotron 3 Super,提供全托管推理

AWS 发布了在 Bedrock 上运行 Nemotron 3 Super 的详细指南,涵盖从软件开发到安全分类的用例。该模型通过 bedrock-runtime 和 bedrock-mantle 端点提供服务,支持 Standard、Priority 和 Flex 层。

TheRouter 编辑重写aws.amazon.com ↗
2026-05-26

DeepInfra 提供 Nemotron 3 Super,支持快速推理

DeepInfra 宣布支持 Nemotron 3 Super 并提供优化推理。该平台强调了其 LatentMoE 架构和 1M 上下文窗口作为智能体 AI 工作负载的关键差异化优势。

TheRouter 编辑重写deepinfra.com ↗

常见问题

LatentMoE 与标准 MoE 有何不同?

在标准 MoE 中,Token 以完整隐藏维度路由到专家,随着模型增大会产生计算瓶颈。LatentMoE 在路由之前将 Token 嵌入压缩到低秩潜在空间,从而在相同推理成本下最多可咨询 4 倍的专家数量。这实现了更细粒度的专家专业化——例如,为 Python 语法和 SQL 逻辑分别使用不同的专家——仅在需要时激活。

TheRouter 编辑重写developer.nvidia.com ↗
Nemotron 3 Super 实际支持多长的上下文窗口?

模型的原生架构支持 1M Token 的上下文窗口,但具体暴露的上限取决于服务平台。在 AWS Bedrock(TheRouter 当前对该模型的路由后端)上,配置为 256K Token 上下文和 32K 最大输出。模型的 Mamba-2 层使完整的 1M 上下文在计算上切实可行,不像纯注意力模型那样长上下文会二次方地降低吞吐量。

TheRouter 编辑重写docs.aws.amazon.com ↗
Nemotron 3 Super 与 NVIDIA 之前的模型相比如何?

Nemotron 3 Super 是 Nemotron 3 系列的第一款模型。它的前身是早期的 Nemotron Super 模型(稠密 120B)。3 Super 通过混合 MoE 架构(稠密 → 12B 激活)实现了最高 5 倍的吞吐量提升,引入 LatentMoE 实现 4 倍专家路由,使用多 Token 预测进行推测解码,并支持原生 1M 上下文。更小的兄弟模型(Nano 30B,3.5B 激活)于 2025 年 12 月为边缘部署发布。

TheRouter 编辑重写developer.nvidia.com ↗
Nemotron 3 Super 适合单轮聊天机器人使用吗?

它可以用于聊天,但其 Arena-Hard V2 分数(73.88%)表明它落后于专用对话模型。Nemotron 3 Super 针对智能体、多轮问题求解进行了优化,在这些场景中工具使用、长上下文和高吞吐量最为重要。对于开放性创意对话,建议考虑 deepseek/deepseek-v3.1 或 meta/llama-4-maverick。

TheRouter 编辑重写llm-stats.com ↗
TheRouter API 支持哪些工具/参数?

Nemotron 3 Super 支持 temperature、max_tokens、top_p、tools(函数调用)、tool_choice、response_format(JSON 模式)和 stop 序列。支持流式调用。模型通过 TheRouter 的 v1/chat/completions OpenAI 兼容端点经 AWS Bedrock 路由。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期developer.nvidia.com ↗2026-05-28已核实
架构research.nvidia.com ↗2026-05-28已核实
原生上下文长度developer.nvidia.com ↗2026-05-28已核实
AWS Bedrock 上下文docs.aws.amazon.com ↗2026-05-28已核实
最大输出 (TheRouter)docs.aws.amazon.com ↗2026-05-28已核实
训练数据build.nvidia.com ↗2026-05-28已核实
后训练developer.nvidia.com ↗2026-05-28已核实
许可协议www.nvidia.com ↗2026-05-28已核实
支持的语言aws.amazon.com ↗2026-05-28已核实
PinchBenchdeveloper.nvidia.com ↗2026-05-28已核实
AIME 2025aws.amazon.com ↗2026-05-28未知
MMLU-ProNVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25已核实
GPQA (with tools)NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25已核实
Arena-Hard V2NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25已核实
RULERNVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25已核实
TerminalBench 2.0NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25已核实
SWE-Bench Verifiedaws.amazon.com ↗2026-05-28未知
NVIDIA 发布 Nemotron 3 Super — 面向智能体推理的开源混合 MoE 模型developer.nvidia.com ↗2026-05-28已核实
AWS Bedrock 推出 Nemotron 3 Super,提供全托管推理aws.amazon.com ↗2026-05-28已核实
DeepInfra 提供 Nemotron 3 Super,支持快速推理deepinfra.com ↗2026-05-28已核实
LatentMoE 与标准 MoE 有何不同?developer.nvidia.com ↗2026-05-28待核实
Nemotron 3 Super 实际支持多长的上下文窗口?docs.aws.amazon.com ↗2026-05-28待核实
Nemotron 3 Super 与 NVIDIA 之前的模型相比如何?developer.nvidia.com ↗2026-05-28待核实
Nemotron 3 Super 适合单轮聊天机器人使用吗?llm-stats.com ↗2026-05-28待核实
TheRouter API 支持哪些工具/参数?docs.aws.amazon.com ↗2026-05-28待核实
帮助与联系