Назад к моделям

Nemotron 3 Nano — флагманская открытая компактная модель семейства NVIDIA Nemotron 3, выпущенная 15 декабря 2025 года. 31,6B всего параметров, всего 3,6B активных на токен (с учётом эмбеддингов), гибридная Mamba-2-Transformer MoE-архитектура, оптимизированная для агентных AI-нагрузок — вызов инструментов, структурированный вывод, многошаговые рассуждения и обработка длинного контекста. Поддерживает нативное окно контекста в 1 млн токенов.

Для операторов TheRouter Nemotron 3 Nano — самая эффективная по пропускной способности открытая модель в своём классе. NVIDIA заявляет 3,3x выше пропускную способность, чем у Qwen3-30B-A3B, и 2,2x выше, чем у GPT-OSS-20B на одном H200 (8K/16K). Она соответствует или превосходит сопоставимые малые MoE-модели на бенчмарках кодинга, математики и следования инструкциям, cтоимость через TheRouter — всего $0,06/M входных токенов. Модель полностью открыта: веса (FP8 и BF16), рецепты обучения, датасеты (Nemotron-CC-v2.1) и среда RL NeMo Gym.

Когда выбирать
  • • Агентные AI-конвейеры: вызов инструментов, структурированный вывод, многошаговое планирование и координация нескольких агентов с низкой задержкой.
  • • Развёртывание чат-ботов с высокой пропускной способностью, где задержка на токен важнее глубины рассуждений — 3,6B активных параметров обеспечивают быстрый инференс даже на скромном оборудовании.
  • • Локальное развёртывание на NVIDIA Jetson и потребительских GPU благодаря компактному активному параметру и поддержке FP8-квантизации.
  • • Long-context RAG — окно в 1 млн токенов со слоями Mamba-2 обрабатывает большие наборы документов без фрагментации позиционных эмбеддингов.
Когда не выбирать
  • • Сложные многошаговые математические рассуждения уровня олимпиад — более глубокие модели, такие как Nemotron Super (120B/12B активных), дают более высокие финальные результаты AIME/GPQA.
  • • Мультимодальные задачи (изображения, аудио, видео) — это текстовая модель. Для мультимодальных задач аналогичного размера используйте Nemotron-3-Nano-Omni или Google Gemini / Qwen-VL.
  • • Высоконагруженные многоязычные задачи — обучающие данные преимущественно на английском. Для многоязычных вариантов лучше подходят Qwen3 или DeepSeek-V3.
Размер контекста
1M
Максимальный вывод
262K
Цена Входза 1M токенов
$0.0648за 1 млн токенов
Цена Выходза 1M токенов
$0.2592за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.0648 за 1 млн токенов
Выход$0.2592 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

Характеристики

Дата релиза2025-12-15research.nvidia.com ↗проверено
АрхитектураГибридный Mamba-2-Transformer MoEresearch.nvidia.com ↗проверено
Всего параметров31,6Bresearch.nvidia.com ↗проверено
Активных параметров3,2B (3,6B с эмбеддингами)research.nvidia.com ↗проверено
Дата отсечения данных25 июня 2025 (предобучение); 28 ноября 2025 (постобучение)build.nvidia.com ↗проверено
ЛицензияNVIDIA Open Model License (открытые веса, рецепт обучения и данные)huggingface.co ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
MMLU-Pro
Nemotron 3 Nano (Post-trained, CoT EM, 5-shot) — против Qwen3-30B-A3B-Thinking-2507 при сопоставимых настройках
65.05%%research.nvidia.com ↗
AGIEval-En
Post-trained, CoT accuracy, 3/5-shot
68.32%%research.nvidia.com ↗
HumanEval
0-shot pass@1
78.05%%research.nvidia.com ↗
MBPP-Sanitized
3-shot pass@1
75.49%%research.nvidia.com ↗
GSM8K
8-shot, accuracy
92.34%%research.nvidia.com ↗
MATH
4-shot accuracy. Значительно опережает сопоставимые малые MoE-модели (напр., Qwen3-30B-A3B с 61,14%)
82.88%%research.nvidia.com ↗
AIME 2025
Без инструментов — превосходит Qwen3-30B-A3B (85,0%), немного уступает GPT-OSS-20B (91,7%)
89.1%%research.nvidia.com ↗
GPQA Diamond
По данным Awesome Agents / публичного синтетического теста (февраль 2026)
84.2%%awesomeagents.ai ↗
RULER (64K)
Точность извлечения из длинного контекста при 64K токенов — преимущество гибридной архитектуры Mamba для длинных документов
87.5%%llm-stats.com ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "nvidia/nemotron-nano-30b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Chat completion

Стандартный OpenAI-совместимый chat completion — простейший способ вызвать Nemotron Nano через TheRouter.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-nano-30b",
    "messages": [
      {"role": "user", "content": "What are the key design goals of the Nemotron 3 architecture?"}
    ]
  }'

Ещё от nvidia

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-12-15

NVIDIA анонсировала семейство Nemotron 3 — Nano, Super, Ultra

NVIDIA выпустила семейство открытых моделей Nemotron 3, начиная с Nano (31,6B всего / 3,6B активных) с гибридной Mamba-2-Transformer MoE-архитектурой, контекстом 1M токенов и полностью открытыми весами, данными и рецептами обучения.

переработано TheRouterresearch.nvidia.com ↗
2026-01-12

Технический блог NVIDIA: внутри Nemotron 3 — техники, инструменты и данные

NVIDIA опубликовала подробный технический блог, охватывающий гибридную MoE-архитектуру, RL-обучение в NeMo Gym, обработку 1M-токенового контекста и прозрачные конвейеры данных, лежащие в основе Nemotron 3.

переработано TheRouterdeveloper.nvidia.com ↗
2026-04-27

Выпущен Nemotron-3-Nano-Omni — мультимодальная версия с пониманием аудио+видео

NVIDIA выпустила Omni-вариант Nemotron-3-Nano, добавляющий понимание видео, речи, GUI-взаимодействие и OCR, сохраняя компактный MoE-формат 30B-A3B.

переработано TheRouterhuggingface.co/nvidia ↗
2026-04-08

Nemotron-Cascade 2 — 30B открытая MoE работает на одном GPU, превосходит 120B модели

Построенная на архитектуре Nemotron 3 Nano, Cascade 2 использует каскадные агентные конвейеры для достижения результатов уровня GPT-OSS-120B на задачах кодинга и рассуждений, работая на одном потребительском GPU.

переработано TheRouterawesomeagents.ai ↗

Частые вопросы

Чем Nemotron 3 Nano отличается от других малых MoE-моделей?

Nemotron 3 Nano использует гибридный Mamba-2-Transformer backbone вместо чистого Transformer. Это позволяет обрабатывать длинные контексты (до 1 млн токенов) с гораздо меньшими накладными расходами памяти, а MoE-слои удерживают активные параметры на уровне 3,6B на токен. Результат — производительность на уровне гораздо более крупных моделей при развёртывании на edge-оборудовании.

переработано TheRouterdeveloper.nvidia.com ↗
Как Nemotron 3 Nano соотносится с Qwen3-30B-A3B и GPT-OSS-20B?

На MATH (4-shot) Nemotron 3 Nano набирает 82,88% против 61,14% у Qwen3-30B-A3B. На AIME 2025 — 89,1% против 85,0% у Qwen3 и 91,7% у GPT-OSS-20B. NVIDIA заявляет о 3,3x выше пропускной способности, чем Qwen3-30B-A3B, и 2,2x выше, чем GPT-OSS-20B, на одном H200. В целом Nemotron сильнее всего в математике и эффективности пропускной способности, GPT-OSS-20B немного опережает на олимпиадной математике.

переработано TheRouterresearch.nvidia.com ↗
Подходит ли Nemotron Nano для агентных приложений / вызова инструментов?

Да, это была основная цель дизайна. Модель проходила постобучение с помощью RL в нескольких интерактивных средах NeMo Gym от NVIDIA. Параметры supported_params в YAML TheRouter включают tools, tool_choice и response_format, что подтверждает поддержку function calling.

переработано TheRouterdeveloper.nvidia.com ↗
Являются ли модель Nemotron Nano и её обучающие данные открытыми?

Да. NVIDIA выпустила веса модели (FP8 и BF16), базовый предобученный чекпоинт, датасет Nemotron-CC-v2.1 (2,5 трлн токенов), Nemotron-CC-Code-v1 (428B токенов кода) и набор RL-сред NeMo Gym под лицензией NVIDIA Open Model License.

переработано TheRouterresearch.nvidia.com ↗
Какие цены на Nemotron Nano через TheRouter?

$0,06 за миллион входных токенов и $0,16 за миллион выходных токенов. Это одна из самых низких цен среди поддерживаемых моделей на TheRouter, отражающая эффективность MoE-архитектуры (всего 3,6B активных параметров на токен).

переработано TheRouterwww.therouter.ai ↗
Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаresearch.nvidia.com ↗2026-05-28проверено
Архитектураresearch.nvidia.com ↗2026-05-28проверено
Всего параметровresearch.nvidia.com ↗2026-05-28проверено
Активных параметровresearch.nvidia.com ↗2026-05-28проверено
Дата отсечения данныхbuild.nvidia.com ↗2026-05-28проверено
Лицензияhuggingface.co ↗2026-05-28проверено
MMLU-Proresearch.nvidia.com ↗2026-05-28проверено
AGIEval-Enresearch.nvidia.com ↗2026-05-28проверено
HumanEvalresearch.nvidia.com ↗2026-05-28проверено
MBPP-Sanitizedresearch.nvidia.com ↗2026-05-28проверено
GSM8Kresearch.nvidia.com ↗2026-05-28проверено
MATHresearch.nvidia.com ↗2026-05-28проверено
AIME 2025research.nvidia.com ↗2026-05-28проверено
GPQA Diamondawesomeagents.ai ↗2026-05-28к проверке
RULER (64K)llm-stats.com ↗2026-05-28к проверке
NVIDIA анонсировала семейство Nemotron 3 — Nano, Super, Ultraresearch.nvidia.com ↗2026-05-28проверено
Технический блог NVIDIA: внутри Nemotron 3 — техники, инструменты и данныеdeveloper.nvidia.com ↗2026-05-28проверено
Выпущен Nemotron-3-Nano-Omni — мультимодальная версия с пониманием аудио+видеоhuggingface.co/nvidia ↗2026-05-28проверено
Nemotron-Cascade 2 — 30B открытая MoE работает на одном GPU, превосходит 120B моделиawesomeagents.ai ↗2026-05-28проверено
Чем Nemotron 3 Nano отличается от других малых MoE-моделей?developer.nvidia.com ↗2026-05-28к проверке
Как Nemotron 3 Nano соотносится с Qwen3-30B-A3B и GPT-OSS-20B?research.nvidia.com ↗2026-05-28к проверке
Подходит ли Nemotron Nano для агентных приложений / вызова инструментов?developer.nvidia.com ↗2026-05-28к проверке
Являются ли модель Nemotron Nano и её обучающие данные открытыми?research.nvidia.com ↗2026-05-28к проверке
Какие цены на Nemotron Nano через TheRouter?www.therouter.ai ↗2026-05-28к проверке
Помощь и контакты