NVIDIA Nemotron 3 Ultra 550B: что изменилось для рынка агентного ИИ
Новости
Анонс на Computex 2026
На выставке Computex 2026 NVIDIA представила семейство нейронных сетей Nemotron 3 Ultra — модели с открытыми весами, созданные специально для координации долгоживущих ИИ-агентов. Центральное место в линейке занимает Nemotron 3 Ultra 550B: модель насчитывает 550 миллиардов параметров суммарно и 55 миллиардов активных, построена на принципе Mixture of Experts (MoE).
Одновременно с флагманом вышли ещё два инструмента:
- Nemotron 3.5 Content Safety — компактная 4-миллиардная модель, обеспечивающая контентную фильтрацию на 12 языках;
- Nemotron 3.5 ASR — потоковое распознавание речи на 40+ языках с задержкой ниже 100 мс.
Веса всех трёх моделей находятся в открытом доступе на Hugging Face и совместимы с несколькими средами развёртывания NVIDIA.
Архитектурные решения: Transformer-Mamba и LatentMoE
Nemotron 3 Ultra 550B проектировалась под агентные задачи, где необходим глубокий многошаговый анализ. Ключевая идея — разделение ответственности: флагман подключается только на сложных этапах рассуждения, а более лёгкие модели берут на себя рутинные вызовы инструментов и верификацию промежуточных результатов. Это снижает суммарный расход токенов и ускоряет работу агентного конвейера.
Архитектурную основу составляет гибридная схема Transformer-Mamba:
- трансформерные блоки извлекают и упорядочивают информацию;
- блоки Mamba обрабатывают длинные последовательности без экспоненциального роста вычислительных затрат.
Среди других технических решений выделяются три ключевых:
- NVFP4-квантование — единая контрольная точка совместима с GPU трёх поколений: Ampere, Hopper и Blackwell; на Blackwell пропускная способность вырастает в 5 раз относительно BF16;
- LatentMoE — интеллектуальная маршрутизация между блоками рассуждений, генерации кода и вызовов инструментов;
- Мультитокеновое предсказание (MTP) — ускоряет вывод длинных цепочек ответов и уменьшает число шагов инференса.
Данные и методология обучения
Предобучение Nemotron 3 Ultra 550B велось на корпусе из 10 триллионов основных токенов, дополненном 212 миллиардами специализированных токенов по профильным областям. Постобучение объединило:
- тонкую настройку (SFT) на размеченных примерах;
- масштабное обучение с подкреплением (RL).
NVIDIA опубликовала не только веса, но и весь обучающий датасет — редкий шаг для моделей подобного масштаба, открывающий возможности для независимого аудита и дообучения.
Производительность: цифры и бенчмарки
На ключевых отраслевых и агентных тестах Nemotron 3 Ultra 550B показала следующие результаты:
| Бенчмарк | Показатель |
|---|---|
| PinchBench (агентная оценка) | 91% — паритет с Kimi K2.6 (1T параметров), выше Qwen3.5 (89%) и GLM 5.1 (84%) |
| EnterpriseOps-Gym (долгосрочное планирование) | 33% |
| Terminal-Bench 2.0 | 54% |
| IFBench (следование инструкциям) | 82% |
| ProfBench | 56% |
Не менее важны показатели эффективности инференса:
- Контекстное окно — 1 млн токенов, тогда как большинство моделей сопоставимого размера ограничены 256 тыс. токенов;
- По данным Artificial Analysis, Nemotron 3 Ultra 550B работает в 5 раз быстрее других открытых моделей того же класса;
- Расход токенов на задачу сокращается приблизительно на 30% — подтверждено на SWE-bench и Terminal-Bench 2.0.
Остальные модели семейства Nemotron 3
Вместе с флагманом NVIDIA выпустила два узкоспециализированных инструмента для производственных систем.
Nemotron 3.5 Content Safety — модератор выходных данных основной LLM: распознаёт более 23 категорий нежелательного контента, поддерживает пользовательские политики безопасности и генерирует объясняющие цепочки рассуждений для каждого решения.
Nemotron 3.5 ASR — потоковая модель с задержкой ниже 100 мс и охватом свыше 40 языков, рассчитанная на голосовые интерфейсы в режиме реального времени.
Варианты развёртывания и доступность
Модели семейства Nemotron 3 поддерживают несколько способов запуска:
- Ручное развёртывание с весами, загруженными напрямую с Hugging Face;
- Агентные среды: Hermes Agent, OpenClaw, OpenShell, NemoClaw;
- NIM-микросервис NVIDIA для бесшовной интеграции в продакшен-инфраструктуру;
- Тонкая настройка через платформу NeMo.
Модели доступны у ведущих облачных провайдеров: AWS, Google Cloud, Microsoft Foundry, CoreWeave, DeepInfra, DigitalOcean, Fireworks AI, Together AI и других. Опробовать флагман можно через Perplexity Pro, OpenRouter или build.nvidia.com.
Поддерживаемые форматы весов: базовая модель и квантованные версии NVFP4, FP8 и FP16.
Всё семейство Nemotron 3 распространяется под лицензией OpenMDW-1.1 Linux Foundation.
Итог
Nemotron 3 Ultra 550B задаёт новую точку отсчёта для открытых моделей в сегменте агентного ИИ. Пятикратный выигрыш в скорости инференса, экономия токенов на уровне 30%, контекстное окно в 1 миллион токенов и полностью открытый стек — от весов и обучающих данных до рецептов RL — предоставляют разработчикам максимальный контроль без привязки к закрытым API.
Параллельный выход Content Safety и ASR закрывает два принципиальных периметра: безопасность генерируемого контента и голосовые взаимодействия. В результате семейство Nemotron 3 формируется как полноценная платформа для продакшен-агентов, способных вести рассуждения в течение длительного времени, работать с внешними инструментами и удерживать контекст разговора на протяжении миллиона токенов.
Если вас интересует серверная инфраструктура для локального развёртывания моделей такого масштаба — обратитесь к специалистам СервакМастер: подберём оптимальную конфигурацию под ваши задачи и бюджет.
