返回模型列表

Nemotron Nano 30B

nvidianvidia/nemotron-nano-30b

NVIDIA's efficient hybrid model (30B total, 3.5B active MoE). Mamba-2 + Attention layers with 1M context for edge deployment.

Nemotron 3 Nano 是 NVIDIA Nemotron 3 系列中开源的轻量级模型,于 2025 年 12 月 15 日发布。总参数量 31.6B,每 token 仅激活 3.6B(含嵌入层),采用 Mamba-2 + Transformer 混合 MoE 架构,专为智能体工作负载(工具调用、结构化输出、多轮推理、长上下文处理)优化。其原生 1M token 上下文窗口得益于混合架构的效率:Mamba-2 层低成本处理长程依赖,稀疏 Transformer 层保留关系型精度。

对于 TheRouter 路由层用户,Nemotron 3 Nano 是其参数级别中吞吐效率最高的开源模型。NVIDIA 声称单张 H200(8K/16K 设置)吞吐量是 Qwen3-30B-A3B 的 3.3 倍、GPT-OSS-20B 的 2.2 倍。在编程、数学和指令遵循基准上达到或超过同类小型 MoE 模型,同时通过 TheRouter 仅需 $0.06/M 输入 token。模型权重(FP8 和 BF16)、训练配方、数据集(Nemotron-CC-v2.1)和 NeMo Gym RL 环境全部开源,是同规模下文档最透明的模型之一。

适合使用
  • • 智能体 AI 管道:工具调用、结构化输出、多步规划和多智能体协调,低延迟高吞吐。
  • • 高吞吐量对话部署场景:对单 token 延迟敏感但不需要极端推理深度,3.6B 激活参数即使在普通硬件上也能保持高速推理。
  • • 边缘 / 本地部署:在 NVIDIA Jetson 和消费级 GPU 上运行,受益于紧凑的激活参数和 FP8 量化支持。
  • • 长上下文检索增强生成(RAG)——1M token 窗口借助 Mamba-2 层处理大型文档集,无需位置嵌入分片。
不适合使用
  • • 竞赛级复杂多步数学推理——虽然表现不错,但更大的模型如 Nemotron Super (120B/12B active) 在 AIME/GPQA 上得分更高。
  • • 多模态任务(视觉、音频、视频)——此为纯文本模型。同样尺寸的多模态可选 Nemotron-3-Nano-Omni 或 Google Gemini / Qwen-VL。
  • • 高吞吐多语言工作负载——训练数据以英语为主。多语言支持方面 Qwen3 或 DeepSeek-V3 更优。
上下文长度
1M
最大输出
262K
输入价格每百万 tokens
$0.0648每百万 Tokens
输出价格每百万 tokens
$0.2592每百万 Tokens

模态能力

文本→文本

价格明细

类型费率
输入$0.0648 每百万 Tokens
输出$0.2592 每百万 Tokens

支持参数

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

模型规格

发布日期2025-12-15research.nvidia.com ↗已核实
架构混合 Mamba-2-Transformer MoEresearch.nvidia.com ↗已核实
总参数量31.6Bresearch.nvidia.com ↗已核实
激活参数量3.2B(含嵌入层 3.6B)research.nvidia.com ↗已核实
训练数据截止2025 年 6 月 25 日(预训练);2025 年 11 月 28 日(后训练)build.nvidia.com ↗已核实
许可NVIDIA Open Model License(开源权重、训练配方和数据)huggingface.co ↗已核实

基准成绩

BenchmarkDistributionScoreSource
MMLU-Pro
Nemotron 3 Nano(后训练,思维链精确匹配,5-shot)—— 对比 Qwen3-30B-A3B-Thinking-2507 相近设置
65.05%%research.nvidia.com ↗
AGIEval-En
后训练,思维链准确率,3/5-shot
68.32%%research.nvidia.com ↗
HumanEval
0-shot pass@1
78.05%%research.nvidia.com ↗
MBPP-Sanitized
3-shot pass@1
75.49%%research.nvidia.com ↗
GSM8K
8-shot,准确率
92.34%%research.nvidia.com ↗
MATH
4-shot 准确率。显著领先同类小型 MoE 模型(如 Qwen3-30B-A3B 的 61.14%)
82.88%%research.nvidia.com ↗
AIME 2025
无工具辅助 — 超过 Qwen3-30B-A3B (85.0%),略低于 GPT-OSS-20B (91.7%)
89.1%%research.nvidia.com ↗
GPQA Diamond
由 Awesome Agents / 公开合成测试测得(2026 年 2 月)
84.2%%awesomeagents.ai ↗
RULER (64K)
64K token 长上下文检索准确率 — 混合 Mamba 架构在长文档上的优势
87.5%%llm-stats.com ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "nvidia/nemotron-nano-30b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

API 使用指南

完整 API 参考 →

Chat 调用

标准 OpenAI 兼容的 chat completion — 通过 TheRouter 调用 Nemotron Nano 最简单的方式。

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-nano-30b",
    "messages": [
      {"role": "user", "content": "What are the key design goals of the Nemotron 3 architecture?"}
    ]
  }'

nvidia 其他模型

同类模型

跨供应商的相似能力档位

动态与变更

2025-12-15

NVIDIA 发布 Nemotron 3 系列 — Nano、Super、Ultra

NVIDIA 发布 Nemotron 3 开源模型系列,首发 Nano(31.6B 总 / 3.6B 激活),采用 Mamba-2-Transformer 混合 MoE 架构、1M token 上下文窗口,权重、数据和训练配方全部开源。

TheRouter 编辑重写research.nvidia.com ↗
2026-01-12

NVIDIA 技术博客:深入 Nemotron 3 — 技术、工具和数据

NVIDIA 发布详细技术博客,涵盖混合 MoE 架构、NeMo Gym 多环境 RL 训练、1M token 上下文处理技术以及驱动 Nemotron 3 的透明数据管道。

TheRouter 编辑重写developer.nvidia.com ↗
2026-04-27

Nemotron-3-Nano-Omni 发布 — 带音频+视频理解的多模态版本

NVIDIA 发布 Nemotron-3-Nano 的 Omni 变体,新增视频理解、语音理解、GUI 交互和 OCR 能力,保持 30B-A3B MoE 紧凑规格。

TheRouter 编辑重写huggingface.co/nvidia ↗
2026-04-08

Nemotron-Cascade 2 — 30B 开源 MoE 单 GPU 运行,超越 120B 模型

基于 Nemotron 3 Nano 架构的 Cascade 2 使用级联智能体管道,在单个消费级 GPU 上运行,实现了 GPT-OSS-120B 级别的编程和推理性能。

TheRouter 编辑重写awesomeagents.ai ↗

常见问题

Nemotron 3 Nano 与其他小型 MoE 模型有什么不同?

Nemotron 3 Nano 使用混合 Mamba-2-Transformer 骨干网络而非纯 Transformer。这使其能够处理长达 1M token 的上下文,内存开销远低于密集注意力机制,同时 MoE 层将每 token 激活参数控制在 3.6B。结果是在基准测试上与远大于它的模型匹敌,同时可在边缘硬件上部署。

TheRouter 编辑重写developer.nvidia.com ↗
Nemotron 3 Nano 与 Qwen3-30B-A3B 和 GPT-OSS-20B 相比如何?

MATH(4-shot)上 Nemotron 3 Nano 得分 82.88%,Qwen3-30B-A3B 为 61.14%。AIME 2025 上 Nemotron 达到 89.1%,Qwen3 为 85.0%,GPT-OSS-20B 为 91.7%。NVIDIA 声称单 H200 吞吐量比 Qwen3-30B-A3B 高 3.3 倍、比 GPT-OSS-20B 高 2.2 倍。总体而言 Nemotron 在数学和吞吐效率上最强,GPT-OSS-20B 在竞赛级数学上略微领先。

TheRouter 编辑重写research.nvidia.com ↗
Nemotron Nano 适合智能体 / 工具调用应用吗?

是的,这正是其主要设计目标。模型通过 NVIDIA NeMo Gym 中的多交互环境 RL 后训练,涵盖了工具调用、多步规划、代码执行和结构化输出生成。TheRouter 的 supported_params 包含 tools、tool_choice 和 response_format,确认完整 function calling 能力。

TheRouter 编辑重写developer.nvidia.com ↗
Nemotron Nano 模型及其训练数据是开源的吗?

是的。NVIDIA 发布了模型权重(FP8 和 BF16)、基座预训练检查点、Nemotron-CC-v2.1 数据集(2.5 万亿 token)、Nemotron-CC-Code-v1(428B 代码 token)以及 NeMo Gym RL 环境套件,均采用 NVIDIA Open Model License。

TheRouter 编辑重写research.nvidia.com ↗
TheRouter 为 Nemotron Nano 提供什么价格?

输入 $0.06/百万 token,输出 $0.16/百万 token。这是 TheRouter 支持模型中最低的价格区间之一,体现了该模型 MoE 架构(每 token 仅 3.6B 激活参数)的效率。

TheRouter 编辑重写www.therouter.ai ↗
事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
发布日期research.nvidia.com ↗2026-05-28已核实
架构research.nvidia.com ↗2026-05-28已核实
总参数量research.nvidia.com ↗2026-05-28已核实
激活参数量research.nvidia.com ↗2026-05-28已核实
训练数据截止build.nvidia.com ↗2026-05-28已核实
许可huggingface.co ↗2026-05-28已核实
MMLU-Proresearch.nvidia.com ↗2026-05-28已核实
AGIEval-Enresearch.nvidia.com ↗2026-05-28已核实
HumanEvalresearch.nvidia.com ↗2026-05-28已核实
MBPP-Sanitizedresearch.nvidia.com ↗2026-05-28已核实
GSM8Kresearch.nvidia.com ↗2026-05-28已核实
MATHresearch.nvidia.com ↗2026-05-28已核实
AIME 2025research.nvidia.com ↗2026-05-28已核实
GPQA Diamondawesomeagents.ai ↗2026-05-28待核实
RULER (64K)llm-stats.com ↗2026-05-28待核实
NVIDIA 发布 Nemotron 3 系列 — Nano、Super、Ultraresearch.nvidia.com ↗2026-05-28已核实
NVIDIA 技术博客:深入 Nemotron 3 — 技术、工具和数据developer.nvidia.com ↗2026-05-28已核实
Nemotron-3-Nano-Omni 发布 — 带音频+视频理解的多模态版本huggingface.co/nvidia ↗2026-05-28已核实
Nemotron-Cascade 2 — 30B 开源 MoE 单 GPU 运行,超越 120B 模型awesomeagents.ai ↗2026-05-28已核实
Nemotron 3 Nano 与其他小型 MoE 模型有什么不同?developer.nvidia.com ↗2026-05-28待核实
Nemotron 3 Nano 与 Qwen3-30B-A3B 和 GPT-OSS-20B 相比如何?research.nvidia.com ↗2026-05-28待核实
Nemotron Nano 适合智能体 / 工具调用应用吗?developer.nvidia.com ↗2026-05-28待核实
Nemotron Nano 模型及其训练数据是开源的吗?research.nvidia.com ↗2026-05-28待核实
TheRouter 为 Nemotron Nano 提供什么价格?www.therouter.ai ↗2026-05-28待核实
帮助与联系