Нет в наличии
Серверы NVIDIA HGX: 4× и 8× A100/H100 SXM — каталог «СервакМастер»
Серверы NVIDIA HGX: профессиональные GPU-платформы для ИИ и научных вычислений
Платформа NVIDIA HGX стала отраслевым стандартом для построения вычислительных узлов в задачах машинного обучения, обучения крупных языковых моделей и высокопроизводительных научных расчётов. В каталоге «СервакМастер» представлены серверные конфигурации на базе HGX с ускорителями A100 и H100 в исполнении SXM — от компактных 4-GPU-систем до восьмикарточных узлов максимальной плотности.
Архитектура платформы NVIDIA HGX
В основе HGX лежит специализированная базовая плата (baseboard), на которой монтируются от 4 до 16 ускорителей серии A100 или H100. Вместо стандартной шины PCIe все GPU внутри одного узла соединены через NVLink и NVSwitch, обеспечивая полносвязную топологию без узких мест.
Ключевые принципы архитектуры:
- NVLink третьего поколения (A100) обеспечивает пропускную способность до 600 ГБ/с между ускорителями.
- NVLink четвёртого поколения (H100) поднимает этот показатель до 900 ГБ/с.
- NVSwitch в 8-GPU-конфигурациях позволяет каждому ускорителю напрямую обращаться к остальным семи без промежуточной маршрутизации.
- InfiniBand HDR/NDR используется для связи между несколькими узлами HGX при построении многоузловых GPU-кластеров.
Серверы на базе HGX выпускают ведущие производители — Supermicro, Dell, ASUS и другие партнёры NVIDIA — в форм-факторах от 4U до 10U с воздушным и прямым жидкостным охлаждением.
Конфигурации, доступные в «СервакМастер»
Серверы на NVIDIA HGX A100 (архитектура Ampere)
- 4× NVIDIA A100 SXM4 80 ГБ — сбалансированный вариант для среднего ML-кластера или нескольких изолированных рабочих нагрузок через MIG; суммарный объём GPU-памяти — 320 ГБ.
- 8× NVIDIA A100 SXM4 80 ГБ — флагманская конфигурация поколения Ampere с полной NVSwitch-связностью; суммарно 640 ГБ GPU-памяти; оптимальна для обучения трансформерных моделей среднего масштаба.
Серверы на NVIDIA HGX H100 (архитектура Hopper)
- 4× NVIDIA H100 SXM5 80 ГБ — следующее поколение с архитектурой Hopper и аппаратным Transformer Engine; производительность до 4 PFLOPS FP8 на узел при 320 ГБ суммарной GPU-памяти.
- 8× NVIDIA H100 SXM5 80 ГБ — максимальная производительность в рамках одного сервера; 640 ГБ GPU-памяти; предпочтительный выбор для крупномасштабного обучения LLM и высоконагруженного инференса.
Сравнительные характеристики ускорителей
| Параметр | A100 SXM4 80 ГБ | H100 SXM5 80 ГБ |
|---|---|---|
| Архитектура | Ampere | Hopper |
| Объём памяти (HBM2e / HBM3) | 80 ГБ | 80 ГБ |
| Пропускная способность памяти | 2 ТБ/с | 3,35 ТБ/с |
| Производительность FP16 / TF32 | 312 ТFLOPS | 989 ТFLOPS |
| TDP | 400 Вт | 700 Вт |
| NVLink | 3.0 / 600 ГБ/с | 4.0 / 900 ГБ/с |
Где применяются GPU-серверы NVIDIA HGX
Платформа HGX рассчитана на профессиональные корпоративные и научные задачи:
- Обучение больших языковых моделей (LLM) — архитектуры GPT-класса, многомодальные модели, модели с десятками и сотнями миллиардов параметров.
- Высоконагруженный инференс — обслуживание API с жёсткими требованиями по задержке и пропускной способности.
- Компьютерное зрение и обработка изображений — медицинская диагностика, промышленный контроль качества, автономные системы.
- Молекулярное моделирование и биоинформатика — расчёт структур белков, геномный анализ, физические симуляции.
- Генеративный ИИ и рендеринг — диффузионные модели, синтез видео и изображений, 3D-рендеринг.
- Финансовое моделирование — симуляции Монте-Карло, рискоаналитика, портфельная оптимизация.
Требования к инфраструктуре
Сервер с восемью ускорителями H100 потребляет до 10–12 кВт, что требует соответствующего планирования электропитания и охлаждения. «СервакМастер» предлагает оба варианта:
- Воздушное охлаждение — подходит для ЦОД с нормой на стойку от 20 кВт и выше.
- Прямое жидкостное охлаждение (DLC) — снижает нагрузку на системы кондиционирования, позволяет увеличить плотность размещения GPU-узлов и сократить расходы на электроэнергию.
Как выбрать подходящую конфигурацию HGX
При подборе сервера рекомендуем опираться на несколько ключевых параметров:
- Размер модели и требуемая GPU-память. Обучение модели с 70 млрд параметров в формате BF16 требует ~140 ГБ GPU-памяти — это минимум 2 ускорителя A100/H100 80 ГБ; модели в 175 млрд параметров — уже 8 GPU.
- Характер рабочей нагрузки. Для параллельного обучения нескольких независимых задач подходит MIG-режим на A100/H100; для единой крупной модели нужна полная NVSwitch-связность 8-GPU-узла.
- Планируемое масштабирование. Если кластер будет расти, заранее выберите сетевую фабрику InfiniBand, совместимую с будущими узлами.
- Совокупная стоимость владения. Учитывайте расходы на электроэнергию, охлаждение и коммутационное оборудование — для H100-систем они существенно выше, чем для A100.
Специалисты «СервакМастер» помогут рассчитать оптимальную конфигурацию под ваши задачи и бюджет — обращайтесь за консультацией.
Доставка, гарантия и поддержка
«СервакМастер» доставляет GPU-серверы NVIDIA HGX в Москву, Санкт-Петербург и другие города России. На всё поставляемое оборудование распространяется официальная гарантия производителя. По запросу доступна услуга инсталляции и пусконаладки с выездом специалиста.