Серверы NVIDIA HGX: 4× и 8× A100/H100 SXM — каталог «СервакМастер»

Товаров: 3

Серверы NVIDIA HGX: профессиональные GPU-платформы для ИИ и научных вычислений

Платформа NVIDIA HGX стала отраслевым стандартом для построения вычислительных узлов в задачах машинного обучения, обучения крупных языковых моделей и высокопроизводительных научных расчётов. В каталоге «СервакМастер» представлены серверные конфигурации на базе HGX с ускорителями A100 и H100 в исполнении SXM — от компактных 4-GPU-систем до восьмикарточных узлов максимальной плотности.

Архитектура платформы NVIDIA HGX

В основе HGX лежит специализированная базовая плата (baseboard), на которой монтируются от 4 до 16 ускорителей серии A100 или H100. Вместо стандартной шины PCIe все GPU внутри одного узла соединены через NVLink и NVSwitch, обеспечивая полносвязную топологию без узких мест.

Ключевые принципы архитектуры:

  • NVLink третьего поколения (A100) обеспечивает пропускную способность до 600 ГБ/с между ускорителями.
  • NVLink четвёртого поколения (H100) поднимает этот показатель до 900 ГБ/с.
  • NVSwitch в 8-GPU-конфигурациях позволяет каждому ускорителю напрямую обращаться к остальным семи без промежуточной маршрутизации.
  • InfiniBand HDR/NDR используется для связи между несколькими узлами HGX при построении многоузловых GPU-кластеров.

Серверы на базе HGX выпускают ведущие производители — Supermicro, Dell, ASUS и другие партнёры NVIDIA — в форм-факторах от 4U до 10U с воздушным и прямым жидкостным охлаждением.

Конфигурации, доступные в «СервакМастер»

Серверы на NVIDIA HGX A100 (архитектура Ampere)

  • 4× NVIDIA A100 SXM4 80 ГБ — сбалансированный вариант для среднего ML-кластера или нескольких изолированных рабочих нагрузок через MIG; суммарный объём GPU-памяти — 320 ГБ.
  • 8× NVIDIA A100 SXM4 80 ГБ — флагманская конфигурация поколения Ampere с полной NVSwitch-связностью; суммарно 640 ГБ GPU-памяти; оптимальна для обучения трансформерных моделей среднего масштаба.

Серверы на NVIDIA HGX H100 (архитектура Hopper)

  • 4× NVIDIA H100 SXM5 80 ГБ — следующее поколение с архитектурой Hopper и аппаратным Transformer Engine; производительность до 4 PFLOPS FP8 на узел при 320 ГБ суммарной GPU-памяти.
  • 8× NVIDIA H100 SXM5 80 ГБ — максимальная производительность в рамках одного сервера; 640 ГБ GPU-памяти; предпочтительный выбор для крупномасштабного обучения LLM и высоконагруженного инференса.

Сравнительные характеристики ускорителей

Параметр A100 SXM4 80 ГБ H100 SXM5 80 ГБ
Архитектура Ampere Hopper
Объём памяти (HBM2e / HBM3) 80 ГБ 80 ГБ
Пропускная способность памяти 2 ТБ/с 3,35 ТБ/с
Производительность FP16 / TF32 312 ТFLOPS 989 ТFLOPS
TDP 400 Вт 700 Вт
NVLink 3.0 / 600 ГБ/с 4.0 / 900 ГБ/с

Где применяются GPU-серверы NVIDIA HGX

Платформа HGX рассчитана на профессиональные корпоративные и научные задачи:

  • Обучение больших языковых моделей (LLM) — архитектуры GPT-класса, многомодальные модели, модели с десятками и сотнями миллиардов параметров.
  • Высоконагруженный инференс — обслуживание API с жёсткими требованиями по задержке и пропускной способности.
  • Компьютерное зрение и обработка изображений — медицинская диагностика, промышленный контроль качества, автономные системы.
  • Молекулярное моделирование и биоинформатика — расчёт структур белков, геномный анализ, физические симуляции.
  • Генеративный ИИ и рендеринг — диффузионные модели, синтез видео и изображений, 3D-рендеринг.
  • Финансовое моделирование — симуляции Монте-Карло, рискоаналитика, портфельная оптимизация.

Требования к инфраструктуре

Сервер с восемью ускорителями H100 потребляет до 10–12 кВт, что требует соответствующего планирования электропитания и охлаждения. «СервакМастер» предлагает оба варианта:

  • Воздушное охлаждение — подходит для ЦОД с нормой на стойку от 20 кВт и выше.
  • Прямое жидкостное охлаждение (DLC) — снижает нагрузку на системы кондиционирования, позволяет увеличить плотность размещения GPU-узлов и сократить расходы на электроэнергию.

Как выбрать подходящую конфигурацию HGX

При подборе сервера рекомендуем опираться на несколько ключевых параметров:

  1. Размер модели и требуемая GPU-память. Обучение модели с 70 млрд параметров в формате BF16 требует ~140 ГБ GPU-памяти — это минимум 2 ускорителя A100/H100 80 ГБ; модели в 175 млрд параметров — уже 8 GPU.
  2. Характер рабочей нагрузки. Для параллельного обучения нескольких независимых задач подходит MIG-режим на A100/H100; для единой крупной модели нужна полная NVSwitch-связность 8-GPU-узла.
  3. Планируемое масштабирование. Если кластер будет расти, заранее выберите сетевую фабрику InfiniBand, совместимую с будущими узлами.
  4. Совокупная стоимость владения. Учитывайте расходы на электроэнергию, охлаждение и коммутационное оборудование — для H100-систем они существенно выше, чем для A100.

Специалисты «СервакМастер» помогут рассчитать оптимальную конфигурацию под ваши задачи и бюджет — обращайтесь за консультацией.

Доставка, гарантия и поддержка

«СервакМастер» доставляет GPU-серверы NVIDIA HGX в Москву, Санкт-Петербург и другие города России. На всё поставляемое оборудование распространяется официальная гарантия производителя. По запросу доступна услуга инсталляции и пусконаладки с выездом специалиста.