GPU-сервер ASUS ESC8000A-E13 DR на базе 8× Nvidia RTX PRO 6000 Blackwell Server Edition 96GB и AMD EPYC 9554

Теги: AMD · Нейросети · Nvidia · RTX PRO 6000

Дата публикации: 23.04.2026


Состав конфигурации

  • Серверная платформа — ASUS ESC8000A-E13 DR, поддержка до 8 GPU, блоки питания 4 × 2700W по схеме 3+1, платформа SP5 — 1 шт.
  • Процессоры — AMD EPYC 9554, 64 ядра / 128 потоков, 3.1–3.75 GHz, 360W — 2 шт.
  • Оперативная память — 32GB DDR5 ECC REG SK Hynix 4800 MHz 1Rx4 [HMCG84MEBRA174N] — 24 шт. (общий объём 768 GB).
  • Видеокарты — Nvidia VVDN RTX PRO 6000 Blackwell Server Edition 96GB GDDR7 [900-2G153-0210-301] — 8 шт. (общий объём видеопамяти 768 GB).
  • Накопители — SSD Solidigm D7-PS1010 1.92TB 2.5" [SB5PH27X019T] — 4 шт. (общий объём 7.68 TB).
  • Сетевая карта — Mellanox MCX653106A-HDAT, 2 × QSFP56, 200GbE — 1 шт.

О проекте

Этот высокоплотный GPU-сервер был собран командой СервакМастер для клиентов, которым нужна максимальная вычислительная мощность в одном корпусе. Платформа ASUS ESC8000A-E13 DR — одно из наиболее ёмких серверных шасси, способных принять полный комплект из восьми профессиональных GPU одновременно. Конфигурация ориентирована на сценарии, где определяющую роль играют параллельные вычисления, устойчивость под многочасовой нагрузкой и высокая пропускная способность: обучение и инференс нейросетей, HPC-симуляции, крупномасштабная аналитика и промышленная обработка визуального контента.

Суммарный объём видеопамяти — 768 GB — делает этот сервер одним из наиболее оснащённых однонодовых решений для AI-задач, доступных на рынке.


Процессорная подсистема: AMD EPYC 9554

В основе сервера — пара процессоров AMD EPYC 9554 архитектуры Zen 4. Каждый несёт 64 физических ядра и 128 потоков, а в дуальной конфигурации суммарный пул составляет 128 ядер и 256 потоков при тактовых частотах 3.1–3.75 GHz и TDP 360W на сокет.

В GPU-сервере такого класса процессор решает несколько параллельных задач:

  • Координация GPU-нагрузок — CPU управляет очередями задач, распределяет потоки данных между восемью ускорителями и не допускает возникновения узких мест в пайплайне.
  • Предобработка и аугментация данных — ресурсоёмкие ETL-операции, токенизация и трансформация датасетов выполняются прямо на сервере, без обращения к внешним вычислительным узлам.
  • Виртуализация и мультиарендность — платформа SP5 поддерживает создание изолированных вычислительных доменов: несколько проектов или арендаторов могут работать на одном сервере с разделением GPU-ресурсов.
  • Корпоративные инфраструктурные сервисы — сервер способен одновременно обслуживать вычислительные и административные нагрузки, не теряя производительности на каждом направлении.

AMD EPYC 9554 поддерживает многоканальную DDR5 и большое количество линий PCIe 5.0 — это напрямую влияет на скорость обмена данными между CPU и GPU, который является одним из ключевых параметров в AI/HPC-системах.


Оперативная память: 768 GB DDR5 ECC REG

Подсистема памяти построена на 24 модулях SK Hynix HMCG84MEBRA174N ёмкостью 32 GB каждый. Итоговый объём — 768 GB с поддержкой коррекции ошибок ECC Registered.

Характеристики модулей:

  • Тип: DDR5 ECC Registered
  • Частота: 4800 MHz
  • Конфигурация: 1Rx4
  • Производитель: SK Hynix

768 GB оперативной памяти — это не технический излишек, а осмысленное проектное решение для серверов с восемью GPU. Такой объём позволяет:

  • Хранить крупные обучающие датасеты целиком в RAM, сводя к минимуму обращения к дискам в процессе тренировки моделей.
  • Поддерживать длинные многоступенчатые пайплайны с большим числом промежуточных состояний.
  • Обеспечивать стабильную работу в ходе многосуточных вычислительных сессий без риска переполнения памяти.
  • Одновременно развёртывать несколько независимых рабочих окружений на одном сервере.

ECC-коррекция критически важна для серверов, работающих в режиме 24/7 под высокой нагрузкой: она предотвращает накопление битовых ошибок, которые в системах без ECC приводят к непредсказуемым сбоям и потере данных.


Ускорители: 8× Nvidia RTX PRO 6000 Blackwell Server Edition 96GB

Центральный элемент этой конфигурации — восемь профессиональных GPU Nvidia RTX PRO 6000 Blackwell Server Edition (артикул 900-2G153-0210-301). Каждый ускоритель оснащён 96 GB видеопамяти GDDR7, суммарный объём видеопамяти в сервере достигает 768 GB.

Чем Server Edition отличается от обычной версии RTX PRO 6000?

Server Edition — это GPU, оптимизированный специально для серверного применения:

  • Пассивная система охлаждения вместо активной: воздушный поток обеспечивают серверные вентиляторы шасси, а не кулер карты. Это повышает надёжность и упрощает обслуживание.
  • Расширенный диапазон рабочих температур и повышенный допустимый ресурс по циклам включения и выключения.
  • Углублённая поддержка корпоративных гарантий и расширенные сроки сервиса для ЦОД-применения.
  • Совместимость с системами мониторинга и управления GPU через IPMI/BMC.

Что открывают 96 GB GDDR7 на каждом GPU?

Объём видеопамяти — один из наиболее дефицитных ресурсов при работе с современными AI-моделями. 96 GB на один ускоритель позволяют:

  • Загружать и запускать крупные языковые модели с десятками и сотнями миллиардов параметров без квантизации или принудительного разбиения по нескольким картам.
  • Работать с высокоразрешёнными 3D-сценами, рендерингом и физическими симуляциями в рамках единого буфера.
  • Реализовывать multi-GPU обучение с тензорным и конвейерным параллелизмом без жёстких ограничений по размеру батча.
  • Держать в памяти GPU несколько моделей одновременно для мгновенного переключения между задачами инференса.

При суммарных 768 GB видеопамяти этот сервер способен обслуживать многотенантные AI-платформы или выступать ведущим GPU-узлом в вычислительном кластере, принимающим наиболее тяжёлые задачи.


Хранилище: 4× SSD Solidigm D7-PS1010 1.92TB

Дисковая подсистема реализована на четырёх enterprise-накопителях Solidigm D7-PS1010 форм-фактора 2.5" ёмкостью 1.92 TB каждый (артикул SB5PH27X019T). Суммарный объём хранилища — 7.68 TB.

D7-PS1010 входит в серверную линейку Solidigm для дата-центров: высокие скорости последовательного чтения и записи, поддержка глубины очереди команд 64K, оптимизированный ресурс записи для смешанных рабочих нагрузок. В GPU-сервере такого класса локальные SSD выполняют несколько функций:

  • Рабочие датасеты — быстрая загрузка обучающих данных без задержек от сети.
  • Кеш и чекпоинты — промежуточное сохранение весов и состояний моделей в процессе тренировки.
  • Системный раздел и контейнеры — быстрый старт рабочих окружений и компонентов Docker/Kubernetes.
  • Буфер обмена данными — временное хранение при передаче между узлами кластера.

Сетевое подключение: Mellanox MCX653106A-HDAT 200GbE

Сетевой адаптер Mellanox MCX653106A-HDAT обеспечивает два порта QSFP56 с пропускной способностью 200 GbE на каждый. Это решение класса InfiniBand/Ethernet, которое позволяет:

  • Интегрировать сервер в высокоскоростную сетевую инфраструктуру ЦОД без ограничений на уровне передачи данных.
  • Поддерживать RDMA (Remote Direct Memory Access) для снижения задержек в распределённых вычислительных сценариях.
  • Обеспечивать стабильный пропускной канал при передаче крупных датасетов между узлами кластера.
  • Работать с GPUDirect для прямой передачи данных между GPU разных серверов без участия CPU и системной памяти.

Для GPU-сервера с восемью ускорителями и 768 GB видеопамяти сеть 200GbE — это минимально достаточный уровень подключения, не становящийся узким местом при интенсивном межузловом обмене.


Система питания: 4× 2700W по схеме 3+1

Четыре блока питания по 2700W с резервированием 3+1 — это архитектурное решение в интересах надёжности, а не просто суммарная мощность. При выходе одного PSU из строя система продолжает работу без прерывания; горячая замена блока питания позволяет устранить неисправность без остановки сервера.

Суммарная рабочая мощность — 8100W (три активных блока по 2700W) — обеспечивает стабильное питание всех восьми GPU под полной нагрузкой с учётом пиков потребления процессоров, памяти и дисковой подсистемы. В реальных сценариях обучения нейросетей GPU-серверы нередко работают при 80–95% от пикового TDP часами и сутками подряд — схема 3+1 делает такую эксплуатацию предсказуемой и безопасной.


Для каких задач подходит эта конфигурация

Сфера применения Почему подходит
Обучение LLM и диффузионных моделей 768 GB видеопамяти позволяют работать с моделями любого масштаба без ограничений
Инференс AI-сервисов Высокая плотность GPU-памяти даёт возможность держать несколько моделей одновременно
HPC и научные симуляции 256 потоков CPU + 8 GPU для смешанных вычислительных задач любой сложности
Рендеринг и 3D-визуализация RTX PRO Blackwell с RT-ядрами ускоряет трассировку лучей и физический рендеринг
Аналитика больших данных Объём RAM и быстрые SSD позволяют обрабатывать датасеты целиком в памяти
GPU-кластеры и распределённые вычисления 200GbE + RDMA обеспечивают быстрый обмен данными между узлами кластера

Почему СервакМастер

СервакМастер специализируется на подборе, сборке и поставке серверного оборудования для задач искусственного интеллекта, HPC и корпоративных вычислений. Каждая конфигурация тестируется перед отгрузкой, а в каталоге представлены решения от одиночных GPU-узлов до многоузловых кластеров под ключ.

Если вас интересует аналогичная или адаптированная под ваши задачи конфигурация — свяжитесь с нами, и наши специалисты подберут оптимальное решение с учётом ваших требований по производительности, бюджету и инфраструктуре.


Фотографии