NVIDIA 发布 Nemotron 3 系列 — Nano、Super、Ultra
NVIDIA 发布 Nemotron 3 开源模型系列,首发 Nano(31.6B 总 / 3.6B 激活),采用 Mamba-2-Transformer 混合 MoE 架构、1M token 上下文窗口,权重、数据和训练配方全部开源。
NVIDIA's efficient hybrid model (30B total, 3.5B active MoE). Mamba-2 + Attention layers with 1M context for edge deployment.
Nemotron 3 Nano 是 NVIDIA Nemotron 3 系列中开源的轻量级模型,于 2025 年 12 月 15 日发布。总参数量 31.6B,每 token 仅激活 3.6B(含嵌入层),采用 Mamba-2 + Transformer 混合 MoE 架构,专为智能体工作负载(工具调用、结构化输出、多轮推理、长上下文处理)优化。其原生 1M token 上下文窗口得益于混合架构的效率:Mamba-2 层低成本处理长程依赖,稀疏 Transformer 层保留关系型精度。
对于 TheRouter 路由层用户,Nemotron 3 Nano 是其参数级别中吞吐效率最高的开源模型。NVIDIA 声称单张 H200(8K/16K 设置)吞吐量是 Qwen3-30B-A3B 的 3.3 倍、GPT-OSS-20B 的 2.2 倍。在编程、数学和指令遵循基准上达到或超过同类小型 MoE 模型,同时通过 TheRouter 仅需 $0.06/M 输入 token。模型权重(FP8 和 BF16)、训练配方、数据集(Nemotron-CC-v2.1)和 NeMo Gym RL 环境全部开源,是同规模下文档最透明的模型之一。
| 类型 | 费率 |
|---|---|
| 输入 | $0.0648 每百万 Tokens |
| 输出 | $0.2592 每百万 Tokens |
| 发布日期 | 2025-12-15research.nvidia.com ↗ | 已核实 |
| 架构 | 混合 Mamba-2-Transformer MoEresearch.nvidia.com ↗ | 已核实 |
| 总参数量 | 31.6Bresearch.nvidia.com ↗ | 已核实 |
| 激活参数量 | 3.2B(含嵌入层 3.6B)research.nvidia.com ↗ | 已核实 |
| 训练数据截止 | 2025 年 6 月 25 日(预训练);2025 年 11 月 28 日(后训练)build.nvidia.com ↗ | 已核实 |
| 许可 | NVIDIA Open Model License(开源权重、训练配方和数据)huggingface.co ↗ | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
MMLU-Pro Nemotron 3 Nano(后训练,思维链精确匹配,5-shot)—— 对比 Qwen3-30B-A3B-Thinking-2507 相近设置 | 65.05%% | research.nvidia.com ↗ | |
AGIEval-En 后训练,思维链准确率,3/5-shot | 68.32%% | research.nvidia.com ↗ | |
HumanEval 0-shot pass@1 | 78.05%% | research.nvidia.com ↗ | |
MBPP-Sanitized 3-shot pass@1 | 75.49%% | research.nvidia.com ↗ | |
GSM8K 8-shot,准确率 | 92.34%% | research.nvidia.com ↗ | |
MATH 4-shot 准确率。显著领先同类小型 MoE 模型(如 Qwen3-30B-A3B 的 61.14%) | 82.88%% | research.nvidia.com ↗ | |
AIME 2025 无工具辅助 — 超过 Qwen3-30B-A3B (85.0%),略低于 GPT-OSS-20B (91.7%) | 89.1%% | research.nvidia.com ↗ | |
GPQA Diamond 由 Awesome Agents / 公开合成测试测得(2026 年 2 月) | 84.2%% | awesomeagents.ai ↗ | |
RULER (64K) 64K token 长上下文检索准确率 — 混合 Mamba 架构在长文档上的优势 | 87.5%% | llm-stats.com ↗ |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
curl https://api.therouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "nvidia/nemotron-nano-30b",
"messages": [
{"role": "user", "content": "Summarize the key points from this input."}
]
}'标准 OpenAI 兼容的 chat completion — 通过 TheRouter 调用 Nemotron Nano 最简单的方式。
curl https://api.therouter.ai/v1/chat/completions \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-nano-30b",
"messages": [
{"role": "user", "content": "What are the key design goals of the Nemotron 3 architecture?"}
]
}'NVIDIA 发布 Nemotron 3 开源模型系列,首发 Nano(31.6B 总 / 3.6B 激活),采用 Mamba-2-Transformer 混合 MoE 架构、1M token 上下文窗口,权重、数据和训练配方全部开源。
NVIDIA 发布详细技术博客,涵盖混合 MoE 架构、NeMo Gym 多环境 RL 训练、1M token 上下文处理技术以及驱动 Nemotron 3 的透明数据管道。
NVIDIA 发布 Nemotron-3-Nano 的 Omni 变体,新增视频理解、语音理解、GUI 交互和 OCR 能力,保持 30B-A3B MoE 紧凑规格。
基于 Nemotron 3 Nano 架构的 Cascade 2 使用级联智能体管道,在单个消费级 GPU 上运行,实现了 GPT-OSS-120B 级别的编程和推理性能。
Nemotron 3 Nano 使用混合 Mamba-2-Transformer 骨干网络而非纯 Transformer。这使其能够处理长达 1M token 的上下文,内存开销远低于密集注意力机制,同时 MoE 层将每 token 激活参数控制在 3.6B。结果是在基准测试上与远大于它的模型匹敌,同时可在边缘硬件上部署。
MATH(4-shot)上 Nemotron 3 Nano 得分 82.88%,Qwen3-30B-A3B 为 61.14%。AIME 2025 上 Nemotron 达到 89.1%,Qwen3 为 85.0%,GPT-OSS-20B 为 91.7%。NVIDIA 声称单 H200 吞吐量比 Qwen3-30B-A3B 高 3.3 倍、比 GPT-OSS-20B 高 2.2 倍。总体而言 Nemotron 在数学和吞吐效率上最强,GPT-OSS-20B 在竞赛级数学上略微领先。
是的,这正是其主要设计目标。模型通过 NVIDIA NeMo Gym 中的多交互环境 RL 后训练,涵盖了工具调用、多步规划、代码执行和结构化输出生成。TheRouter 的 supported_params 包含 tools、tool_choice 和 response_format,确认完整 function calling 能力。
是的。NVIDIA 发布了模型权重(FP8 和 BF16)、基座预训练检查点、Nemotron-CC-v2.1 数据集(2.5 万亿 token)、Nemotron-CC-Code-v1(428B 代码 token)以及 NeMo Gym RL 环境套件,均采用 NVIDIA Open Model License。
输入 $0.06/百万 token,输出 $0.16/百万 token。这是 TheRouter 支持模型中最低的价格区间之一,体现了该模型 MoE 架构(每 token 仅 3.6B 激活参数)的效率。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 架构 | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 总参数量 | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 激活参数量 | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 训练数据截止 | build.nvidia.com ↗ | 2026-05-28 | 已核实 |
| 许可 | huggingface.co ↗ | 2026-05-28 | 已核实 |
| MMLU-Pro | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| AGIEval-En | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| HumanEval | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| MBPP-Sanitized | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| GSM8K | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| MATH | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| AIME 2025 | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| GPQA Diamond | awesomeagents.ai ↗ | 2026-05-28 | 待核实 |
| RULER (64K) | llm-stats.com ↗ | 2026-05-28 | 待核实 |
| NVIDIA 发布 Nemotron 3 系列 — Nano、Super、Ultra | research.nvidia.com ↗ | 2026-05-28 | 已核实 |
| NVIDIA 技术博客:深入 Nemotron 3 — 技术、工具和数据 | developer.nvidia.com ↗ | 2026-05-28 | 已核实 |
| Nemotron-3-Nano-Omni 发布 — 带音频+视频理解的多模态版本 | huggingface.co/nvidia ↗ | 2026-05-28 | 已核实 |
| Nemotron-Cascade 2 — 30B 开源 MoE 单 GPU 运行,超越 120B 模型 | awesomeagents.ai ↗ | 2026-05-28 | 已核实 |
| Nemotron 3 Nano 与其他小型 MoE 模型有什么不同? | developer.nvidia.com ↗ | 2026-05-28 | 待核实 |
| Nemotron 3 Nano 与 Qwen3-30B-A3B 和 GPT-OSS-20B 相比如何? | research.nvidia.com ↗ | 2026-05-28 | 待核实 |
| Nemotron Nano 适合智能体 / 工具调用应用吗? | developer.nvidia.com ↗ | 2026-05-28 | 待核实 |
| Nemotron Nano 模型及其训练数据是开源的吗? | research.nvidia.com ↗ | 2026-05-28 | 待核实 |
| TheRouter 为 Nemotron Nano 提供什么价格? | www.therouter.ai ↗ | 2026-05-28 | 待核实 |