Всё больше клиентов приходят в «СервакМастер» с одним и тем же запросом: нужна недорогая система для работы с нейросетями, причём без переплаты за брендовое шасси. Для таких задач мы подготовили авторские сборки с лучшим балансом цены и производительности. В их основе лежат серверные материнские платы и конструктив «майнинг-рига». Ниже разберём, из чего состоит такая машина, сколько она потребляет и в каких случаях ей стоит предпочесть готовый сервер.

Почему риг, а не обычный корпус

Главная цель сборки для обучения моделей — вместить как можно больше ускорителей при минимальных накладных расходах. Потребительские корпуса и стоечные шасси здесь мешают: они ограничивают число карт, высоту кулера и воздушный поток. Риг — это открытый каркас, где видеокарты стоят в один этаж и подключены к плате через райзеры. Такая компоновка даёт высокую масштабируемость по GPU и свободный доступ к каждому PCI-E разъёму.

Платформа

Материнская плата

Для рига нужна плата с большим числом линий PCI-E 4.0 и сокетом под современные производительные процессоры. Наш выбор — Supermicro H12SSL-i: серверная плата с поддержкой PCI-E 4.0 и обилием PCI-E слотов.

Процессор

Для стабильной работы ИИ-нагрузок важен баланс между количеством ядер и скоростью каждого из них. Поэтому мы выбираем оптимальные модели AMD EPYC второго и третьего поколений:

Модель Ядра/потоки Частота TDP L3-кэш
AMD EPYC 7513 32/64 2.6–3.6 GHz 200 Вт 128 МБ
AMD EPYC 7413 24/48 2.65–3.6 GHz 180 Вт 128 МБ
AMD EPYC 7542 32/64 2.9–3.4 GHz 225 Вт 128 МБ

Все три процессора имеют оптимальное число вычислительных потоков и высокие частоты, так что вычислениям ничто не мешает.

Оперативная память

Для обучения большинства нейросетей хватает 64 ГБ RAM. Мы собираем этот объём из восьми модулей: 8 шт. по 8 ГБ DDR4 ECC REG SkHynix 3200 МГц 1Rx8. Восемь планок нужны не ради объёма, а чтобы задействовать все каналы памяти процессора. Так контроллер памяти работает с максимальной пропускной способностью, а это напрямую влияет на скорость обучения.

Охлаждение процессора

В риге нет ограничения по высоте системы охлаждения, поэтому ставим тихий 4U-кулер с запасом по TDP: COOLSERVER SNK-P0064AP4 (4U, активный, LGA4094 / Socket SP3, 280 Вт). Он обеспечивает работу сервера 24/7 в любых сценариях.

Накопители

Для постоянного хранилища берём U.2-накопители на PCI-E 4.0. Рекомендуем покупать сразу пару и собирать RAID 1 для сохранности данных: 2 шт. SSD Samsung PM1733 1.92 TB (MZWLJ1T9HBJR-00007). Накопители U.3 и U.2 на базе PCI-E отличаются максимальными показателями IOPS и большим ресурсом перезаписи.

Видеокарты: главный узел сборки

GPU — ключевой компонент любой системы для искусственного интеллекта. Для лучшего опыта обучения рекомендуем ускорители последнего поколения RTX с максимальным объёмом видеопамяти и мощным чипом. Есть три ценовых направления.

Серия RTX (Quadro)

Если бюджет позволяет, стоит смотреть профессиональную серию RTX (Quadro): она построена на топовых чипах и несёт вдвое больший объём видеопамяти.

Модель Память Особенности Цена в исходной публикации
NVIDIA RTX A5000 [900-5G132-2200-000] 24 ГБ GDDR6 серверная карта с поддержкой NVLink 198 700 руб.
NVIDIA RTX A6000 [900-5G133-2200-000] 48 ГБ GDDR6 для графических приложений, 4x DisplayPort 1.4a 784 300 руб.
NVIDIA RTX 6000 Ada [900-5G133-2250-000] 48 ГБ GDDR6 для графических приложений, 4x mini-DisplayPort 1.4a 1 181 000 руб.

Серия Tesla

Если нужно получить максимум VRAM при минимальном бюджете, подойдут ускорители Tesla. За вменяемые деньги они дают необходимый объём видеопамяти, что заметно ускоряет обучение.

Модель Память Состояние Цена в исходной публикации
NVIDIA A100 OEM [900-21001-0000-000] 40 ГБ HBM2e новая 639 700 руб.
NVIDIA Tesla V100 [900-2G500-0010-000] 32 ГБ HBM2 б/у 169 800 руб.
NVIDIA Tesla P40 [900-2G610-0000-000] 24 ГБ GDDR5X б/у 24 900 руб.
NVIDIA Tesla P100 PCIe [900-2H400-0000-000] 16 ГБ HBM2 б/у 12 900 руб.

Б/у карты — это восстановленное оборудование, прошедшее проверку качества и стресс-тесты; оно дешевле новых и продаётся с гарантией. На все позиции в карточках указана гарантия 1 год с заменой компонентов. Цены приведены на момент публикации оригинала и могут измениться, а актуальные наличие и стоимость уточняйте у менеджера.

Tesla V100 бывает в версиях с 32 ГБ и 16 ГБ сверхскоростной памяти HBM2. На борту у неё тензорные ядра, которые кратно ускоряют процесс обучения.

Дорогие ускорители Tesla на современных архитектурах мы здесь не рассматриваем: о них мы писали отдельно в материале про выбор сервера для нейросетей.

Корпус, райзеры и адаптеры

Чтобы работали несколько ускорителей, нужен каркас, рассчитанный на такое число GPU. Рекомендуем модели на 8 GPU с однорядной компоновкой и свободным доступом к PCI-E разъёмам карт. Хорошо, когда в комплекте уже есть вентиляторы для обдува видеокарт.

Для корректной работы системы понадобятся:

  • 7 шт. гибких райзеров PCI-E 4.0 длиной 60 см;
  • 2 шт. адаптеров PCI-E X8 to PCI-E X16;
  • синхронизатор блоков питания;
  • кабель SFF8654-8i to 2x U2 (SFF8639), 1 м.

Райзеры лучше брать именно гибкие: они меньше подвержены повреждению при изгибе.

Питание: считаем с запасом

Мощность оцениваем грубо и в большую сторону:

Компонент Потребление
Материнская плата и ОЗУ ~150 Вт
Процессор ~240 Вт
Накопители ~30 Вт
Видеокарты ~450 Вт × 7 = 3150 Вт

В пике получается 3570 Вт. Поэтому для питания используем два блока по 2000 Вт: 2 шт. GreatWall Black Dragon 2000W (80Plus Gold, модульные, с нативным 12VHPWR для новых видеокарт). Сертификат 80Plus Gold — лучший выбор для сильно загруженных систем.

Дополнительные расходы на вентиляцию

Несмотря на плюсы рига, ускорители из-за очень высокого TDP нередко перегреваются. Чтобы этого избежать, добавьте мощные серверные вентиляторы: они выдувают горячий воздух и дают картам «дышать».

Что получается в итоге

После сборки мы имеем отзывчивую систему, в которой практически все GPU работают на 100% своих возможностей. Распределение линий PCI-E 4.0 такое:

GPU Режим
GPU1 16 линий 4.0
GPU2 16 линий 4.0
GPU3 16 линий 4.0
GPU4 16 линий 4.0
GPU5 8 линий 4.0
GPU6 16 линий 4.0
GPU7 8 линий 4.0

Работа в режиме X8 лишь незначительно скажется на производительности: пропускной способности PCI-E 4.0 достаточно для интенсивной нагрузки на GPU и в таком режиме.

Операционную систему выбирайте под задачу: Windows Server 2022, Ubuntu Server, Debian или CentOS. На ней вы развернёте своё приложение для работы с ИИ.

Как расширить систему

Конфигурация гибкая и допускает доработку под потребности:

  • сетевой адаптер Mellanox или Intel для высокоскоростного Ethernet или кластеризации по Infiniband;
  • RAID-контроллер для аппаратного RAID на SAS HDD, если нужен дисковый пул большой ёмкости.

Если поставить 100-гигабитный адаптер Mellanox с поддержкой Infiniband, можно объединять такие системы в кластер и масштабироваться дальше.

Недостатки такого способа сборки

  • низкая надёжность гибких райзеров;
  • сложность транспортировки;
  • невозможность монтажа в стойку.

Обычно эти минусы терпимы: серверные корпуса либо не позволяют разместить столько GPU, либо кратно удорожают сборку из-за дорогого шасси.

Кастомная система или готовая от производителя

Специалисты «СервакМастер» отвечают на этот вопрос так.

  • Вы только начинаете работать с ИИ и бюджет ограничен. Берите кастомную систему: она сэкономит средства и станет хорошей точкой входа в тему.
  • Опыт уже есть, и компания успешно монетизирует свои разработки. Мы рекомендуем готовые решения Supermicro, DELL, HPE, H3C. За дополнительную стоимость они позволяют легко наращивать число систем и без проблем размещать их на колокейшн в ведущих дата-центрах.

В наличии есть специализированные платформы для установки до 10 GPU NVIDIA Tesla. Они монтируются в стойку и имеют ряд преимуществ перед кастомными аналогами. Подобрать готовый вариант можно в разделах серверов и ИИ-серверов.

Вывод

Рынок ИИ-технологий растёт, и всё больше компаний развивают собственные проекты для решения бизнес-задач. Сборка своего сервера для ИИ оправдана: она даёт разработчику простор для экспериментов, позволяет обучать модели быстро, оптимизировать обучение под архитектуру системы и менять саму архитектуру под нужды программного обеспечения. Физический сервер решает задачи, которые не решить на выделенном сервере, арендованном у поставщика IT-услуг.

Специалисты «СервакМастер» готовы ответить на вопросы о сборке серверов для обучения нейросетей: задайте их в онлайн-чате на сайте или через страницу контактов.