Обзор серверных экосистем NVIDIA
NVIDIA давно перестала быть просто производителем видеокарт для геймеров. Сегодня компания формирует фундамент вычислительной инфраструктуры для искусственного интеллекта, научных симуляций и высокопроизводительных вычислений по всему миру. Чтобы охватить разные сегменты рынка — от исследовательских лабораторий до облачных провайдеров — NVIDIA выстроила три самостоятельных направления: DGX, HGX и MGX. Каждое из них решает свою задачу и рассчитано на определённый тип заказчика. В этом материале СервакМастер подробно рассматривает все три платформы: что внутри, для кого предназначены и чем принципиально отличаются.
Платформа NVIDIA DGX: сервер «под ключ»
NVIDIA DGX — это законченные серверные системы, которые компания проектирует и поставляет полностью укомплектованными. Внутри каждого DGX всё подобрано и настроено производителем: GPU-ускорители в форм-факторе SXM, серверные процессоры, сетевые карты ConnectX, системы охлаждения, операционная среда и весь необходимый программный стек — от драйверов CUDA до библиотек глубокого обучения.
Для заказчика это означает минимум организационных усилий: не нужно тратить время на выбор совместимых компонентов, их тестирование и тонкую настройку. Система приходит готовой к работе. Именно поэтому DGX-серверы популярны в академической среде, у крупных технологических компаний и государственных исследовательских структур, где ценится скорость запуска проекта, а не гибкость в конфигурировании.
Ключевое: в основе каждого DGX-сервера лежит GPU-модуль HGX. Иными словами, DGX — это HGX плюс тщательно подобранное окружение и готовая программная среда.
Ценовой диапазон DGX-систем
Актуальные модели DGX строятся на ускорителях архитектур Ampere и Hopper. Наибольшим спросом среди корпоративных клиентов пользуется NVIDIA DGX H200 на базе ускорителей H200 с архитектурой Hopper. В зависимости от конфигурации, количества GPU и объёма памяти стоимость таких систем составляет от $300 000 до $400 000.
При этом важно понимать, что DGX — это нишевый продукт: по оценкам, около 90% продаж серверного оборудования NVIDIA приходится на платформу HGX, а не DGX. Причина проста — HGX-решения дают производителям оборудования значительно больше свободы в выборе компонентов и масштабировании систем под конкретные требования заказчика.
Платформа NVIDIA HGX: GPU-модуль для партнёрских систем
NVIDIA HGX — это специализированный аппаратный базис: многопроцессорная плата с 8 ускорителями в форм-факторе SXM, соединёнными через высокоскоростной интерконнект NVLink/NVSwitch. Именно это аппаратное ядро и называется HGX-модулем.
Принципиальное отличие от DGX состоит в том, что HGX NVIDIA не продаёт конечным пользователям: модуль передаётся партнёрам-производителям серверного оборудования — Supermicro, Dell, HPE, Lenovo, H3C и другим. Каждый из них самостоятельно решает, какие CPU, DPU и корпусные решения использовать. Результат — десятки уникальных серверных конфигураций на единой аппаратной базе.
Наличие NVSwitch отличает HGX от стандартных систем с PCIe-ускорителями: скорость обмена данными между GPU внутри HGX-модуля несравнимо выше, что критически важно при обучении крупных моделей с миллиардами параметров.
Поколения платформы HGX
HGX A100 — поколение Ampere
Платформа HGX A100 вышла в июне 2021 года и стала первым массовым решением NVIDIA для коммерческого рынка глубокого обучения. Поддержка форматов вычислений с пониженной точностью позволила существенно ускорить обучение нейронных сетей без критических потерь точности. Охлаждение — только воздушное.
Технические характеристики HGX A100:
- GPU — до 8 ускорителей NVIDIA A100 80 GB
- Совокупный объём памяти — до 640 GB HBM2
Типичный пример серверного решения на базе HGX A100 — Supermicro GPU SuperServer SYS-420GP-TNAR+, активно применяемый в задачах машинного обучения, обработки больших данных и инференса моделей компьютерного зрения.
HGX H100 и H200 — поколение Hopper
HGX H100 поступила в продажу в ноябре 2022 года, HGX H200 — в 2023-м. Архитектура Hopper принесла значимые улучшения: поддержку формата FP8, рост пропускной способности памяти и обновлённый Transformer Engine, повышающий эффективность работы с трансформерными моделями.
В поколении H100 впервые появился вариант с жидкостным охлаждением («Delta Next»), который решает проблему тепловыделения в высокоплотных датацентрах, где воздушное охлаждение уже не справляется.
Технические характеристики HGX H200:
- GPU — до 8 ускорителей NVIDIA H200 141 GB
- Совокупный объём памяти — до 1128 GB HBM3E
Характерный представитель этого поколения — Dell PowerEdge XE9680 на процессорах Intel Xeon Platinum, широко используемый для обучения и инференса крупных языковых моделей в промышленных средах.
HGX B100 и B200 — поколение Blackwell
HGX B100 и B200 — следующий эволюционный шаг, построенный на архитектуре Blackwell. Выход на рынок запланирован на первый квартал 2025 года. Ключевое нововведение — поддержка форматов FP4 и FP6, позволяющих обрабатывать значительно больше параметров модели при той же потребляемой мощности.
Ожидаемые характеристики HGX B200:
- GPU — до 8 ускорителей NVIDIA B200 180 GB
- Совокупный объём памяти — до 1440 GB HBM3E
Supermicro уже анонсировала сервер AS-A126GS-TNBR на базе HGX B200 в связке с процессорами AMD EPYC Turin — одна из первых систем, объединяющих флагманскую платформу NVIDIA с новейшим поколением серверных CPU от AMD.
Платформа NVIDIA MGX: модульная гибкость
NVIDIA MGX — это совершенно иная по идеологии платформа, представленная компанией в 2023 году. Если HGX — это конкретный GPU-модуль, а DGX — готовый сервер, то MGX — это открытый стандарт сборки, позволяющий формировать серверную систему практически с чистого листа.
Работа с MGX строится поэтапно: сначала выбирается архитектура шасси, затем из одобренного каталога NVIDIA подбираются CPU, GPU, DPU и прочие компоненты. При этом возможно сочетание ускорителей разных поколений в пределах одного шасси — функция, принципиально недоступная в HGX-конфигурациях.
Особого внимания заслуживает поддержка процессоров NVIDIA Grace — CPU на архитектуре ARM, которые невозможно использовать в традиционных HGX-системах. Суперчип GB200 NVL2, объединяющий 2 процессора Grace и 2 GPU Blackwell в одном узле, станет основой MGX-серверов следующего поколения.
Благодаря модульной концепции платформа MGX поддерживает более 100 различных конфигураций. Это открывает её для широчайшего круга задач: разработка и развёртывание моделей ИИ, высокопроизводительные научные вычисления, облачные сервисы, обработка видеопотоков, периферийные вычисления (edge computing) и облачный гейминг.
Сильные стороны MGX
- Широкая применимость — платформа выходит за рамки ИИ и HPC: здравоохранение, медиапроизводство, телеком, краевые вычисления.
- Конфигурирование под задачу — заказчик платит ровно за ту производительность, которая нужна, без переплаты за избыток.
- Совместимость поколений GPU — возможность заменить ускорители на более новые без смены всей системы снижает совокупную стоимость владения.
- Поддержка NVIDIA Grace CPU — открывает сценарии, недоступные для HGX-архитектуры.
- Масштабируемость для СМБ — модульная архитектура позволяет начать с небольшой конфигурации и наращивать мощность по мере роста потребностей.
Ограничения MGX
Главный технический изъян MGX — ограниченная поддержка NVLink. В HGX весь массив из 8 ускорителей соединён через NVSwitch, обеспечивая высокую полосу пропускания между всеми GPU одновременно. В MGX NVLink работает только внутри суперчипа (например, Grace Blackwell), тогда как связь между суперчипами идёт через PCIe — что существенно сужает межпроцессорную пропускную способность.
Это делает MGX менее подходящим выбором для задач, требующих плотного взаимодействия большого числа ускорителей, — в частности, для предобучения крупных языковых моделей с триллионами параметров. В таких сценариях HGX по-прежнему сохраняет преимущество благодаря полному NVLink-мешу.
Итог: как выбрать нужную платформу
Три платформы занимают разные ниши и не конкурируют напрямую:
NVIDIA DGX — для тех, кому нужна максимальная производительность «из коробки» без затрат на интеграцию. Отличный выбор для исследовательских центров и корпораций, у которых нет ресурсов или желания заниматься сборкой и настройкой.
NVIDIA HGX — основа подавляющего большинства коммерческих ИИ-серверов. Идеален для крупных нагрузок по обучению нейронных сетей и HPC, где требуется максимальная межпроцессорная пропускная способность и возможность выбрать оптимальное CPU-окружение.
NVIDIA MGX — универсальная модульная платформа для тех, кому нужна гибкость. Подходит как небольшим компаниям, начинающим с ограниченного бюджета, так и организациям с нестандартными рабочими нагрузками вне традиционного ИИ/HPC-стека.
Если вы выбираете инфраструктуру для задач ИИ или высокопроизводительных вычислений и хотите получить экспертную рекомендацию — обращайтесь в СервакМастер. Мы поможем подобрать конфигурацию, которая точно соответствует вашим требованиям и бюджету.
