GPU-сервер ASUS ESC8000A-E13 DR на базе 8× Nvidia RTX PRO 6000 Blackwell Server Edition 96GB и AMD EPYC 9554
Теги: AMD · Нейросети · Nvidia · RTX PRO 6000
Дата публикации: 23.04.2026
Состав конфигурации
- Серверная платформа — ASUS ESC8000A-E13 DR, поддержка до 8 GPU, блоки питания 4 × 2700W по схеме 3+1, платформа SP5 — 1 шт.
- Процессоры — AMD EPYC 9554, 64 ядра / 128 потоков, 3.1–3.75 GHz, 360W — 2 шт.
- Оперативная память — 32GB DDR5 ECC REG SK Hynix 4800 MHz 1Rx4 [HMCG84MEBRA174N] — 24 шт. (общий объём 768 GB).
- Видеокарты — Nvidia VVDN RTX PRO 6000 Blackwell Server Edition 96GB GDDR7 [900-2G153-0210-301] — 8 шт. (общий объём видеопамяти 768 GB).
- Накопители — SSD Solidigm D7-PS1010 1.92TB 2.5" [SB5PH27X019T] — 4 шт. (общий объём 7.68 TB).
- Сетевая карта — Mellanox MCX653106A-HDAT, 2 × QSFP56, 200GbE — 1 шт.
О проекте
Этот высокоплотный GPU-сервер был собран командой СервакМастер для клиентов, которым нужна максимальная вычислительная мощность в одном корпусе. Платформа ASUS ESC8000A-E13 DR — одно из наиболее ёмких серверных шасси, способных принять полный комплект из восьми профессиональных GPU одновременно. Конфигурация ориентирована на сценарии, где определяющую роль играют параллельные вычисления, устойчивость под многочасовой нагрузкой и высокая пропускная способность: обучение и инференс нейросетей, HPC-симуляции, крупномасштабная аналитика и промышленная обработка визуального контента.
Суммарный объём видеопамяти — 768 GB — делает этот сервер одним из наиболее оснащённых однонодовых решений для AI-задач, доступных на рынке.
Процессорная подсистема: AMD EPYC 9554
В основе сервера — пара процессоров AMD EPYC 9554 архитектуры Zen 4. Каждый несёт 64 физических ядра и 128 потоков, а в дуальной конфигурации суммарный пул составляет 128 ядер и 256 потоков при тактовых частотах 3.1–3.75 GHz и TDP 360W на сокет.
В GPU-сервере такого класса процессор решает несколько параллельных задач:
- Координация GPU-нагрузок — CPU управляет очередями задач, распределяет потоки данных между восемью ускорителями и не допускает возникновения узких мест в пайплайне.
- Предобработка и аугментация данных — ресурсоёмкие ETL-операции, токенизация и трансформация датасетов выполняются прямо на сервере, без обращения к внешним вычислительным узлам.
- Виртуализация и мультиарендность — платформа SP5 поддерживает создание изолированных вычислительных доменов: несколько проектов или арендаторов могут работать на одном сервере с разделением GPU-ресурсов.
- Корпоративные инфраструктурные сервисы — сервер способен одновременно обслуживать вычислительные и административные нагрузки, не теряя производительности на каждом направлении.
AMD EPYC 9554 поддерживает многоканальную DDR5 и большое количество линий PCIe 5.0 — это напрямую влияет на скорость обмена данными между CPU и GPU, который является одним из ключевых параметров в AI/HPC-системах.
Оперативная память: 768 GB DDR5 ECC REG
Подсистема памяти построена на 24 модулях SK Hynix HMCG84MEBRA174N ёмкостью 32 GB каждый. Итоговый объём — 768 GB с поддержкой коррекции ошибок ECC Registered.
Характеристики модулей:
- Тип: DDR5 ECC Registered
- Частота: 4800 MHz
- Конфигурация: 1Rx4
- Производитель: SK Hynix
768 GB оперативной памяти — это не технический излишек, а осмысленное проектное решение для серверов с восемью GPU. Такой объём позволяет:
- Хранить крупные обучающие датасеты целиком в RAM, сводя к минимуму обращения к дискам в процессе тренировки моделей.
- Поддерживать длинные многоступенчатые пайплайны с большим числом промежуточных состояний.
- Обеспечивать стабильную работу в ходе многосуточных вычислительных сессий без риска переполнения памяти.
- Одновременно развёртывать несколько независимых рабочих окружений на одном сервере.
ECC-коррекция критически важна для серверов, работающих в режиме 24/7 под высокой нагрузкой: она предотвращает накопление битовых ошибок, которые в системах без ECC приводят к непредсказуемым сбоям и потере данных.
Ускорители: 8× Nvidia RTX PRO 6000 Blackwell Server Edition 96GB
Центральный элемент этой конфигурации — восемь профессиональных GPU Nvidia RTX PRO 6000 Blackwell Server Edition (артикул 900-2G153-0210-301). Каждый ускоритель оснащён 96 GB видеопамяти GDDR7, суммарный объём видеопамяти в сервере достигает 768 GB.
Чем Server Edition отличается от обычной версии RTX PRO 6000?
Server Edition — это GPU, оптимизированный специально для серверного применения:
- Пассивная система охлаждения вместо активной: воздушный поток обеспечивают серверные вентиляторы шасси, а не кулер карты. Это повышает надёжность и упрощает обслуживание.
- Расширенный диапазон рабочих температур и повышенный допустимый ресурс по циклам включения и выключения.
- Углублённая поддержка корпоративных гарантий и расширенные сроки сервиса для ЦОД-применения.
- Совместимость с системами мониторинга и управления GPU через IPMI/BMC.
Что открывают 96 GB GDDR7 на каждом GPU?
Объём видеопамяти — один из наиболее дефицитных ресурсов при работе с современными AI-моделями. 96 GB на один ускоритель позволяют:
- Загружать и запускать крупные языковые модели с десятками и сотнями миллиардов параметров без квантизации или принудительного разбиения по нескольким картам.
- Работать с высокоразрешёнными 3D-сценами, рендерингом и физическими симуляциями в рамках единого буфера.
- Реализовывать multi-GPU обучение с тензорным и конвейерным параллелизмом без жёстких ограничений по размеру батча.
- Держать в памяти GPU несколько моделей одновременно для мгновенного переключения между задачами инференса.
При суммарных 768 GB видеопамяти этот сервер способен обслуживать многотенантные AI-платформы или выступать ведущим GPU-узлом в вычислительном кластере, принимающим наиболее тяжёлые задачи.
Хранилище: 4× SSD Solidigm D7-PS1010 1.92TB
Дисковая подсистема реализована на четырёх enterprise-накопителях Solidigm D7-PS1010 форм-фактора 2.5" ёмкостью 1.92 TB каждый (артикул SB5PH27X019T). Суммарный объём хранилища — 7.68 TB.
D7-PS1010 входит в серверную линейку Solidigm для дата-центров: высокие скорости последовательного чтения и записи, поддержка глубины очереди команд 64K, оптимизированный ресурс записи для смешанных рабочих нагрузок. В GPU-сервере такого класса локальные SSD выполняют несколько функций:
- Рабочие датасеты — быстрая загрузка обучающих данных без задержек от сети.
- Кеш и чекпоинты — промежуточное сохранение весов и состояний моделей в процессе тренировки.
- Системный раздел и контейнеры — быстрый старт рабочих окружений и компонентов Docker/Kubernetes.
- Буфер обмена данными — временное хранение при передаче между узлами кластера.
Сетевое подключение: Mellanox MCX653106A-HDAT 200GbE
Сетевой адаптер Mellanox MCX653106A-HDAT обеспечивает два порта QSFP56 с пропускной способностью 200 GbE на каждый. Это решение класса InfiniBand/Ethernet, которое позволяет:
- Интегрировать сервер в высокоскоростную сетевую инфраструктуру ЦОД без ограничений на уровне передачи данных.
- Поддерживать RDMA (Remote Direct Memory Access) для снижения задержек в распределённых вычислительных сценариях.
- Обеспечивать стабильный пропускной канал при передаче крупных датасетов между узлами кластера.
- Работать с GPUDirect для прямой передачи данных между GPU разных серверов без участия CPU и системной памяти.
Для GPU-сервера с восемью ускорителями и 768 GB видеопамяти сеть 200GbE — это минимально достаточный уровень подключения, не становящийся узким местом при интенсивном межузловом обмене.
Система питания: 4× 2700W по схеме 3+1
Четыре блока питания по 2700W с резервированием 3+1 — это архитектурное решение в интересах надёжности, а не просто суммарная мощность. При выходе одного PSU из строя система продолжает работу без прерывания; горячая замена блока питания позволяет устранить неисправность без остановки сервера.
Суммарная рабочая мощность — 8100W (три активных блока по 2700W) — обеспечивает стабильное питание всех восьми GPU под полной нагрузкой с учётом пиков потребления процессоров, памяти и дисковой подсистемы. В реальных сценариях обучения нейросетей GPU-серверы нередко работают при 80–95% от пикового TDP часами и сутками подряд — схема 3+1 делает такую эксплуатацию предсказуемой и безопасной.
Для каких задач подходит эта конфигурация
| Сфера применения | Почему подходит |
|---|---|
| Обучение LLM и диффузионных моделей | 768 GB видеопамяти позволяют работать с моделями любого масштаба без ограничений |
| Инференс AI-сервисов | Высокая плотность GPU-памяти даёт возможность держать несколько моделей одновременно |
| HPC и научные симуляции | 256 потоков CPU + 8 GPU для смешанных вычислительных задач любой сложности |
| Рендеринг и 3D-визуализация | RTX PRO Blackwell с RT-ядрами ускоряет трассировку лучей и физический рендеринг |
| Аналитика больших данных | Объём RAM и быстрые SSD позволяют обрабатывать датасеты целиком в памяти |
| GPU-кластеры и распределённые вычисления | 200GbE + RDMA обеспечивают быстрый обмен данными между узлами кластера |
Почему СервакМастер
СервакМастер специализируется на подборе, сборке и поставке серверного оборудования для задач искусственного интеллекта, HPC и корпоративных вычислений. Каждая конфигурация тестируется перед отгрузкой, а в каталоге представлены решения от одиночных GPU-узлов до многоузловых кластеров под ключ.
Если вас интересует аналогичная или адаптированная под ваши задачи конфигурация — свяжитесь с нами, и наши специалисты подберут оптимальное решение с учётом ваших требований по производительности, бюджету и инфраструктуре.