Назад к моделям

Nemotron Super 120B

nvidianvidia/nemotron-super-120b

NVIDIA's hybrid LatentMoE model (120B total, 12B active). Mamba-2 + Attention + MoE architecture with 1M context. Multi-Token Prediction for fast inference.

NVIDIA Nemotron 3 Super (120B всего, 12B активных) — это открытая гибридная LatentMoE-модель, созданная для агентного мышления, программирования и длительных многоконтекстных мультиагентных рабочих процессов. Выпущенная в марте 2026 года, это флагман поколения Nemotron 3 — первая модель, использующая архитектуру LatentMoE, которая сжимает представления токенов перед маршрутизацией к экспертам, активируя в 4 раза больше экспертов при той же стоимости инференса. Модель поддерживает родной контекст в 1M токенов, что даёт AI-агентам долгосрочную память при работе с кодовыми базами, документами и длительными сессиями с инструментами.

Модель чередует слои Mamba-2 для эффективной обработки длинных последовательностей с слоями внимания для точного ассоциативного поиска, и использует Multi-Token Prediction (MTP) для прогнозирования нескольких будущих токенов за один прямой проход — обеспечивая встроенное спекулятивное декодирование. Предобученная на 25T+ токенах и дообученная с помощью мультисреднего обучения с подкреплением (1.2M+ прогонов NeMo Gym), модель превосходна в агентных бенчмарках: PinchBench (85.6%), SWE-Bench Verified и Terminal-Bench, обеспечивая до 5× более высокую пропускную способность по сравнению с предшественником. На TheRouter модель маршрутизируется через AWS Bedrock как nvidia.nemotron-super-3-120b.

Когда выбирать
  • • Оркестровка автономных агентов — высокая пропускная способность (12B активных) и длинный контекст в 1M токенов делают модель идеальной для мультиагентных систем, где агент-супервизор делегирует подзадачи специализированным агентам, маршрутизирует вызовы инструментов и консолидирует длинные цепочки рассуждений.
  • • Анализ и генерация кода с длинным контекстом — слои Mamba-2 делают контексты 100K+ токенов практичными, обеспечивая рассуждение по всему репозиторию, генерацию diff'ов и рефакторинг больших кодовых баз.
  • • Триаж киберугроз и анализ вредоносного ПО — обучение с подкреплением в множестве сред дало модели способность надёжно работать с разнообразными инструментами кибербезопасности.
Когда не выбирать
  • • Разговорная / креативная генерация — показатель Arena-Hard V2 (73.88%) уступает специализированным чат-моделям. Для открытых диалогов или создания контента лучше использовать deepseek/deepseek-v3.1 или anthropic/claude-sonnet-4.
  • • Лёгкие задачи реального времени — при 120B параметров (12B активных) модель тяжелее дистиллированных альтернатив вроде Mistral Small 4 или Gemma-4. Для критичных к задержке периферийных развёртываний используйте меньшие модели.

Чем обслуживание в TheRouter отличается от вендорского

Как её эксплуатирует вендор

NVIDIA публикует Nemotron 3 Super как open weights, datasets, recipes, NIM deployment и модель с native 1M-token context. AWS Bedrock обслуживает ту же модель как nvidia.nemotron-super-3-120b с 256K context, 32K max output, text-only I/O, Chat Completions, Invoke, Converse, response streaming, structured outputs, guardrails и client-side tool calling.

На TheRouter

TheRouter отдаёт модель как OpenAI-compatible /v1/chat/completions под nvidia/nemotron-super-120b. Customer-facing context, output, pricing, modality и supported-parameter fields берутся из live catalog TheRouter; эта page фиксирует, что upstream Bedrock card уже, чем native 1M context NVIDIA, а snippets остаются capped до operator-funded verification.

Размер контекста
1M
Максимальный вывод
262K
Цена Входза 1M токенов
$0.162за 1 млн токенов
Цена Выходза 1M токенов
$0.702за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.162 за 1 млн токенов
Выход$0.702 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_ptoolstool_choiceresponse_formatstop

Характеристики

Дата релиза2026-03-11developer.nvidia.com ↗проверено
АрхитектураГибридная LatentMoE — Mamba-2 SSM + Attention + MoE (120B всего, 12B активных)research.nvidia.com ↗проверено
Родная длина контекста1,000,000 токенов (1M)developer.nvidia.com ↗проверено
Контекст на AWS Bedrock256K токенов (AWS Bedrock предоставляет подмножество родных 1M)docs.aws.amazon.com ↗проверено
Макс. вывод (TheRouter)262,144 токеновdocs.aws.amazon.com ↗проверено
Обучающие данные25T+ токенов — собранные и синтезированные данные: код, математика, наука, общие знания; наборы данных полностью раскрытыbuild.nvidia.com ↗проверено
Пост-обучениеМультисреднее RL (1.2M+ прогонов NeMo Gym, 21 среда)developer.nvidia.com ↗проверено
ЛицензияNVIDIA Open Model Licensewww.nvidia.com ↗проверено
Поддерживаемые языкиАнглийский, французский, немецкий, итальянский, японский, испанский, китайскийaws.amazon.com ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
PinchBench
Агентный бенчмарк — лучшая открытая модель в своём классе на момент запуска
85.6%%developer.nvidia.com ↗
AIME 2025
—Не раскрыто—
MMLU-Pro
83.73%NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
GPQA (with tools)
82.70%%NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
Arena-Hard V2
Ниже специализированных чат-моделей — модель оптимизирована для агентного выполнения, а не для диалога
73.88%%NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
RULER
Бенчмарк поиска в длинном контексте — 100 сэмплов на задачу, сильные результаты на 'иголка в стоге сена'
High (leading open model)NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
TerminalBench 2.0
31.00pointsNVIDIA NeMo Nemotron 3 Super evaluation recipe ↗
SWE-Bench Verified
Блог AWS отмечает высокую производительность на SWE-Bench и мультиязычных вариантах, точные цифры не опубликованы
—Не раскрыто—

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "nvidia/nemotron-super-120b",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Chat completion

Nemotron 3 Super поддерживает совместимые с OpenAI chat completions через API TheRouter. Модель поддерживает инструменты, tool_choice, response_format (JSON режим), stop-последовательности, temperature, top_p и max_tokens.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-super-120b",
    "messages": [
      {"role": "system", "content": "You are a helpful AI assistant."},
      {"role": "user", "content": "Write a Python function to recursively find all .py files in a directory."}
    ],
    "temperature": 0.3,
    "max_tokens": 4096
  }'

Ещё от nvidia

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2026-03-11

NVIDIA выпускает Nemotron 3 Super — открытую гибридную MoE для агентного мышления

NVIDIA выпустила в открытом доступе Nemotron 3 Super (120B-A12B) — гибридную модель Mamba-2 + Attention + LatentMoE с нативным контекстом в 1M. Разработана для мультиагентных систем, включает multi-token prediction, NVFP4 предобучение для Blackwell и мультисреднее RL-дообучение на 21 конфигурации. Доступна через AWS Bedrock с первого дня.

переработано TheRouterdeveloper.nvidia.com ↗
2026-03-19

AWS Bedrock запускает Nemotron 3 Super с полностью управляемым инференсом

AWS опубликовала подробное руководство по запуску Nemotron 3 Super на Bedrock, охватывающее варианты использования от разработки ПО до триажа киберугроз. Модель доступна через эндпоинты bedrock-runtime и bedrock-mantle с уровнями Standard, Priority и Flex.

переработано TheRouteraws.amazon.com ↗
2026-05-26

DeepInfra добавляет Nemotron 3 Super с быстрым инференсом

DeepInfra объявила о поддержке Nemotron 3 Super с оптимизированным инференсом. Платформа отметила архитектуру LatentMoE и контекст 1M как ключевые отличия для агентных AI-нагрузок.

переработано TheRouterdeepinfra.com ↗

Частые вопросы

Чем LatentMoE отличается от стандартной MoE?

В стандартной MoE токены направляются к экспертам в полном скрытом измерении, что создаёт вычислительное узкое место по мере роста модели. LatentMoE сжимает эмбеддинги токенов в низкоранговое латентное пространство перед маршрутизацией, позволяя задействовать до 4× больше экспертов при той же стоимости инференса. Это обеспечивает более тонкую специализацию экспертов — например, отдельные эксперты для синтаксиса Python против SQL-логики — активируемые только при необходимости.

переработано TheRouterdeveloper.nvidia.com ↗
Какой контекст Nemotron 3 Super поддерживает на самом деле?

Нативная архитектура модели поддерживает контекст в 1M токенов, но точный предел зависит от платформы. На AWS Bedrock (текущий бэкенд маршрутизации TheRouter для этой модели) настроено 256K токенов с макс. выводом 32K. Слои Mamba-2 делают полный контекст 1M вычислительно практичным, в отличие от моделей только на внимании, где длинный контекст квадратично ухудшает пропускную способность.

переработано TheRouterdocs.aws.amazon.com ↗
Как Nemotron 3 Super сравнивается с предыдущими моделями NVIDIA?

Nemotron 3 Super — первая модель поколения Nemotron 3. Её предшественником была ранняя Nemotron Super (плотная 120B). 3 Super обеспечивает до 5× повышение пропускной способности благодаря гибридной MoE-архитектуре, вводит LatentMoE для 4× более эффективной маршрутизации экспертов, использует multi-token prediction для спекулятивного декодирования и поддерживает нативный контекст 1M. Меньшая родственная модель (Nano 30B, 3.5B активных) вышла в декабре 2025 года для периферийного развёртывания.

переработано TheRouterdeveloper.nvidia.com ↗
Подходит ли Nemotron 3 Super для одноразовых чат-сессий?

Модель работает для чата, но показатель Arena-Hard V2 (73.88%) уступает специализированным чат-моделям. Nemotron 3 Super оптимизирована для агентного многопользовательского решения проблем, где важны вызов инструментов, длинный контекст и высокая пропускная способность. Для творческих бесед лучше использовать deepseek/deepseek-v3.1 или meta/llama-4-maverick.

переработано TheRouterllm-stats.com ↗
Какие инструменты/параметры поддерживаются через TheRouter API?

Nemotron 3 Super поддерживает temperature, max_tokens, top_p, tools (function calling), tool_choice, response_format (JSON mode) и stop-последовательности. Поддерживается стриминг. Модель работает через совместимый с OpenAI эндпоинт TheRouter v1/chat/completions, маршрутизируемый через AWS Bedrock.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаdeveloper.nvidia.com ↗2026-05-28проверено
Архитектураresearch.nvidia.com ↗2026-05-28проверено
Родная длина контекстаdeveloper.nvidia.com ↗2026-05-28проверено
Контекст на AWS Bedrockdocs.aws.amazon.com ↗2026-05-28проверено
Макс. вывод (TheRouter)docs.aws.amazon.com ↗2026-05-28проверено
Обучающие данныеbuild.nvidia.com ↗2026-05-28проверено
Пост-обучениеdeveloper.nvidia.com ↗2026-05-28проверено
Лицензияwww.nvidia.com ↗2026-05-28проверено
Поддерживаемые языкиaws.amazon.com ↗2026-05-28проверено
PinchBenchdeveloper.nvidia.com ↗2026-05-28проверено
AIME 2025aws.amazon.com ↗2026-05-28неизвестно
MMLU-ProNVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25проверено
GPQA (with tools)NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25проверено
Arena-Hard V2NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25проверено
RULERNVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25проверено
TerminalBench 2.0NVIDIA NeMo Nemotron 3 Super evaluation recipe ↗2026-08-25проверено
SWE-Bench Verifiedaws.amazon.com ↗2026-05-28неизвестно
NVIDIA выпускает Nemotron 3 Super — открытую гибридную MoE для агентного мышленияdeveloper.nvidia.com ↗2026-05-28проверено
AWS Bedrock запускает Nemotron 3 Super с полностью управляемым инференсомaws.amazon.com ↗2026-05-28проверено
DeepInfra добавляет Nemotron 3 Super с быстрым инференсомdeepinfra.com ↗2026-05-28проверено
Чем LatentMoE отличается от стандартной MoE?developer.nvidia.com ↗2026-05-28к проверке
Какой контекст Nemotron 3 Super поддерживает на самом деле?docs.aws.amazon.com ↗2026-05-28к проверке
Как Nemotron 3 Super сравнивается с предыдущими моделями NVIDIA?developer.nvidia.com ↗2026-05-28к проверке
Подходит ли Nemotron 3 Super для одноразовых чат-сессий?llm-stats.com ↗2026-05-28к проверке
Какие инструменты/параметры поддерживаются через TheRouter API?docs.aws.amazon.com ↗2026-05-28к проверке
Помощь и контакты