NVIDIA Nemotron 3 Ultra 550B: что изменилось для рынка агентного ИИ

Новости


Анонс на Computex 2026

На выставке Computex 2026 NVIDIA представила семейство нейронных сетей Nemotron 3 Ultra — модели с открытыми весами, созданные специально для координации долгоживущих ИИ-агентов. Центральное место в линейке занимает Nemotron 3 Ultra 550B: модель насчитывает 550 миллиардов параметров суммарно и 55 миллиардов активных, построена на принципе Mixture of Experts (MoE).

Одновременно с флагманом вышли ещё два инструмента:

  • Nemotron 3.5 Content Safety — компактная 4-миллиардная модель, обеспечивающая контентную фильтрацию на 12 языках;
  • Nemotron 3.5 ASR — потоковое распознавание речи на 40+ языках с задержкой ниже 100 мс.

Веса всех трёх моделей находятся в открытом доступе на Hugging Face и совместимы с несколькими средами развёртывания NVIDIA.


Архитектурные решения: Transformer-Mamba и LatentMoE

Nemotron 3 Ultra 550B проектировалась под агентные задачи, где необходим глубокий многошаговый анализ. Ключевая идея — разделение ответственности: флагман подключается только на сложных этапах рассуждения, а более лёгкие модели берут на себя рутинные вызовы инструментов и верификацию промежуточных результатов. Это снижает суммарный расход токенов и ускоряет работу агентного конвейера.

Архитектурную основу составляет гибридная схема Transformer-Mamba:

  • трансформерные блоки извлекают и упорядочивают информацию;
  • блоки Mamba обрабатывают длинные последовательности без экспоненциального роста вычислительных затрат.

Среди других технических решений выделяются три ключевых:

  • NVFP4-квантование — единая контрольная точка совместима с GPU трёх поколений: Ampere, Hopper и Blackwell; на Blackwell пропускная способность вырастает в 5 раз относительно BF16;
  • LatentMoE — интеллектуальная маршрутизация между блоками рассуждений, генерации кода и вызовов инструментов;
  • Мультитокеновое предсказание (MTP) — ускоряет вывод длинных цепочек ответов и уменьшает число шагов инференса.

Данные и методология обучения

Предобучение Nemotron 3 Ultra 550B велось на корпусе из 10 триллионов основных токенов, дополненном 212 миллиардами специализированных токенов по профильным областям. Постобучение объединило:

  • тонкую настройку (SFT) на размеченных примерах;
  • масштабное обучение с подкреплением (RL).

NVIDIA опубликовала не только веса, но и весь обучающий датасет — редкий шаг для моделей подобного масштаба, открывающий возможности для независимого аудита и дообучения.


Производительность: цифры и бенчмарки

На ключевых отраслевых и агентных тестах Nemotron 3 Ultra 550B показала следующие результаты:

Бенчмарк Показатель
PinchBench (агентная оценка) 91% — паритет с Kimi K2.6 (1T параметров), выше Qwen3.5 (89%) и GLM 5.1 (84%)
EnterpriseOps-Gym (долгосрочное планирование) 33%
Terminal-Bench 2.0 54%
IFBench (следование инструкциям) 82%
ProfBench 56%

Не менее важны показатели эффективности инференса:

  • Контекстное окно — 1 млн токенов, тогда как большинство моделей сопоставимого размера ограничены 256 тыс. токенов;
  • По данным Artificial Analysis, Nemotron 3 Ultra 550B работает в 5 раз быстрее других открытых моделей того же класса;
  • Расход токенов на задачу сокращается приблизительно на 30% — подтверждено на SWE-bench и Terminal-Bench 2.0.

Остальные модели семейства Nemotron 3

Вместе с флагманом NVIDIA выпустила два узкоспециализированных инструмента для производственных систем.

Nemotron 3.5 Content Safety — модератор выходных данных основной LLM: распознаёт более 23 категорий нежелательного контента, поддерживает пользовательские политики безопасности и генерирует объясняющие цепочки рассуждений для каждого решения.

Nemotron 3.5 ASR — потоковая модель с задержкой ниже 100 мс и охватом свыше 40 языков, рассчитанная на голосовые интерфейсы в режиме реального времени.


Варианты развёртывания и доступность

Модели семейства Nemotron 3 поддерживают несколько способов запуска:

  • Ручное развёртывание с весами, загруженными напрямую с Hugging Face;
  • Агентные среды: Hermes Agent, OpenClaw, OpenShell, NemoClaw;
  • NIM-микросервис NVIDIA для бесшовной интеграции в продакшен-инфраструктуру;
  • Тонкая настройка через платформу NeMo.

Модели доступны у ведущих облачных провайдеров: AWS, Google Cloud, Microsoft Foundry, CoreWeave, DeepInfra, DigitalOcean, Fireworks AI, Together AI и других. Опробовать флагман можно через Perplexity Pro, OpenRouter или build.nvidia.com.

Поддерживаемые форматы весов: базовая модель и квантованные версии NVFP4, FP8 и FP16.

Всё семейство Nemotron 3 распространяется под лицензией OpenMDW-1.1 Linux Foundation.


Итог

Nemotron 3 Ultra 550B задаёт новую точку отсчёта для открытых моделей в сегменте агентного ИИ. Пятикратный выигрыш в скорости инференса, экономия токенов на уровне 30%, контекстное окно в 1 миллион токенов и полностью открытый стек — от весов и обучающих данных до рецептов RL — предоставляют разработчикам максимальный контроль без привязки к закрытым API.

Параллельный выход Content Safety и ASR закрывает два принципиальных периметра: безопасность генерируемого контента и голосовые взаимодействия. В результате семейство Nemotron 3 формируется как полноценная платформа для продакшен-агентов, способных вести рассуждения в течение длительного времени, работать с внешними инструментами и удерживать контекст разговора на протяжении миллиона токенов.

Если вас интересует серверная инфраструктура для локального развёртывания моделей такого масштаба — обратитесь к специалистам СервакМастер: подберём оптимальную конфигурацию под ваши задачи и бюджет.