Всё больше клиентов приходят в «СервакМастер» с одним и тем же запросом: нужна недорогая система для работы с нейросетями, причём без переплаты за брендовое шасси. Для таких задач мы подготовили авторские сборки с лучшим балансом цены и производительности. В их основе лежат серверные материнские платы и конструктив «майнинг-рига». Ниже разберём, из чего состоит такая машина, сколько она потребляет и в каких случаях ей стоит предпочесть готовый сервер.
Почему риг, а не обычный корпус
Главная цель сборки для обучения моделей — вместить как можно больше ускорителей при минимальных накладных расходах. Потребительские корпуса и стоечные шасси здесь мешают: они ограничивают число карт, высоту кулера и воздушный поток. Риг — это открытый каркас, где видеокарты стоят в один этаж и подключены к плате через райзеры. Такая компоновка даёт высокую масштабируемость по GPU и свободный доступ к каждому PCI-E разъёму.
Платформа
Материнская плата
Для рига нужна плата с большим числом линий PCI-E 4.0 и сокетом под современные производительные процессоры. Наш выбор — Supermicro H12SSL-i: серверная плата с поддержкой PCI-E 4.0 и обилием PCI-E слотов.
Процессор
Для стабильной работы ИИ-нагрузок важен баланс между количеством ядер и скоростью каждого из них. Поэтому мы выбираем оптимальные модели AMD EPYC второго и третьего поколений:
| Модель | Ядра/потоки | Частота | TDP | L3-кэш |
|---|---|---|---|---|
| AMD EPYC 7513 | 32/64 | 2.6–3.6 GHz | 200 Вт | 128 МБ |
| AMD EPYC 7413 | 24/48 | 2.65–3.6 GHz | 180 Вт | 128 МБ |
| AMD EPYC 7542 | 32/64 | 2.9–3.4 GHz | 225 Вт | 128 МБ |
Все три процессора имеют оптимальное число вычислительных потоков и высокие частоты, так что вычислениям ничто не мешает.
Оперативная память
Для обучения большинства нейросетей хватает 64 ГБ RAM. Мы собираем этот объём из восьми модулей: 8 шт. по 8 ГБ DDR4 ECC REG SkHynix 3200 МГц 1Rx8. Восемь планок нужны не ради объёма, а чтобы задействовать все каналы памяти процессора. Так контроллер памяти работает с максимальной пропускной способностью, а это напрямую влияет на скорость обучения.
Охлаждение процессора
В риге нет ограничения по высоте системы охлаждения, поэтому ставим тихий 4U-кулер с запасом по TDP: COOLSERVER SNK-P0064AP4 (4U, активный, LGA4094 / Socket SP3, 280 Вт). Он обеспечивает работу сервера 24/7 в любых сценариях.
Накопители
Для постоянного хранилища берём U.2-накопители на PCI-E 4.0. Рекомендуем покупать сразу пару и собирать RAID 1 для сохранности данных: 2 шт. SSD Samsung PM1733 1.92 TB (MZWLJ1T9HBJR-00007). Накопители U.3 и U.2 на базе PCI-E отличаются максимальными показателями IOPS и большим ресурсом перезаписи.
Видеокарты: главный узел сборки
GPU — ключевой компонент любой системы для искусственного интеллекта. Для лучшего опыта обучения рекомендуем ускорители последнего поколения RTX с максимальным объёмом видеопамяти и мощным чипом. Есть три ценовых направления.
Серия RTX (Quadro)
Если бюджет позволяет, стоит смотреть профессиональную серию RTX (Quadro): она построена на топовых чипах и несёт вдвое больший объём видеопамяти.
| Модель | Память | Особенности | Цена в исходной публикации |
|---|---|---|---|
| NVIDIA RTX A5000 [900-5G132-2200-000] | 24 ГБ GDDR6 | серверная карта с поддержкой NVLink | 198 700 руб. |
| NVIDIA RTX A6000 [900-5G133-2200-000] | 48 ГБ GDDR6 | для графических приложений, 4x DisplayPort 1.4a | 784 300 руб. |
| NVIDIA RTX 6000 Ada [900-5G133-2250-000] | 48 ГБ GDDR6 | для графических приложений, 4x mini-DisplayPort 1.4a | 1 181 000 руб. |
Серия Tesla
Если нужно получить максимум VRAM при минимальном бюджете, подойдут ускорители Tesla. За вменяемые деньги они дают необходимый объём видеопамяти, что заметно ускоряет обучение.
| Модель | Память | Состояние | Цена в исходной публикации |
|---|---|---|---|
| NVIDIA A100 OEM [900-21001-0000-000] | 40 ГБ HBM2e | новая | 639 700 руб. |
| NVIDIA Tesla V100 [900-2G500-0010-000] | 32 ГБ HBM2 | б/у | 169 800 руб. |
| NVIDIA Tesla P40 [900-2G610-0000-000] | 24 ГБ GDDR5X | б/у | 24 900 руб. |
| NVIDIA Tesla P100 PCIe [900-2H400-0000-000] | 16 ГБ HBM2 | б/у | 12 900 руб. |
Б/у карты — это восстановленное оборудование, прошедшее проверку качества и стресс-тесты; оно дешевле новых и продаётся с гарантией. На все позиции в карточках указана гарантия 1 год с заменой компонентов. Цены приведены на момент публикации оригинала и могут измениться, а актуальные наличие и стоимость уточняйте у менеджера.
Tesla V100 бывает в версиях с 32 ГБ и 16 ГБ сверхскоростной памяти HBM2. На борту у неё тензорные ядра, которые кратно ускоряют процесс обучения.
Дорогие ускорители Tesla на современных архитектурах мы здесь не рассматриваем: о них мы писали отдельно в материале про выбор сервера для нейросетей.
Корпус, райзеры и адаптеры
Чтобы работали несколько ускорителей, нужен каркас, рассчитанный на такое число GPU. Рекомендуем модели на 8 GPU с однорядной компоновкой и свободным доступом к PCI-E разъёмам карт. Хорошо, когда в комплекте уже есть вентиляторы для обдува видеокарт.
Для корректной работы системы понадобятся:
- 7 шт. гибких райзеров PCI-E 4.0 длиной 60 см;
- 2 шт. адаптеров PCI-E X8 to PCI-E X16;
- синхронизатор блоков питания;
- кабель SFF8654-8i to 2x U2 (SFF8639), 1 м.
Райзеры лучше брать именно гибкие: они меньше подвержены повреждению при изгибе.
Питание: считаем с запасом
Мощность оцениваем грубо и в большую сторону:
| Компонент | Потребление |
|---|---|
| Материнская плата и ОЗУ | ~150 Вт |
| Процессор | ~240 Вт |
| Накопители | ~30 Вт |
| Видеокарты | ~450 Вт × 7 = 3150 Вт |
В пике получается 3570 Вт. Поэтому для питания используем два блока по 2000 Вт: 2 шт. GreatWall Black Dragon 2000W (80Plus Gold, модульные, с нативным 12VHPWR для новых видеокарт). Сертификат 80Plus Gold — лучший выбор для сильно загруженных систем.
Дополнительные расходы на вентиляцию
Несмотря на плюсы рига, ускорители из-за очень высокого TDP нередко перегреваются. Чтобы этого избежать, добавьте мощные серверные вентиляторы: они выдувают горячий воздух и дают картам «дышать».
Что получается в итоге
После сборки мы имеем отзывчивую систему, в которой практически все GPU работают на 100% своих возможностей. Распределение линий PCI-E 4.0 такое:
| GPU | Режим |
|---|---|
| GPU1 | 16 линий 4.0 |
| GPU2 | 16 линий 4.0 |
| GPU3 | 16 линий 4.0 |
| GPU4 | 16 линий 4.0 |
| GPU5 | 8 линий 4.0 |
| GPU6 | 16 линий 4.0 |
| GPU7 | 8 линий 4.0 |
Работа в режиме X8 лишь незначительно скажется на производительности: пропускной способности PCI-E 4.0 достаточно для интенсивной нагрузки на GPU и в таком режиме.
Операционную систему выбирайте под задачу: Windows Server 2022, Ubuntu Server, Debian или CentOS. На ней вы развернёте своё приложение для работы с ИИ.
Как расширить систему
Конфигурация гибкая и допускает доработку под потребности:
- сетевой адаптер Mellanox или Intel для высокоскоростного Ethernet или кластеризации по Infiniband;
- RAID-контроллер для аппаратного RAID на SAS HDD, если нужен дисковый пул большой ёмкости.
Если поставить 100-гигабитный адаптер Mellanox с поддержкой Infiniband, можно объединять такие системы в кластер и масштабироваться дальше.
Недостатки такого способа сборки
- низкая надёжность гибких райзеров;
- сложность транспортировки;
- невозможность монтажа в стойку.
Обычно эти минусы терпимы: серверные корпуса либо не позволяют разместить столько GPU, либо кратно удорожают сборку из-за дорогого шасси.
Кастомная система или готовая от производителя
Специалисты «СервакМастер» отвечают на этот вопрос так.
- Вы только начинаете работать с ИИ и бюджет ограничен. Берите кастомную систему: она сэкономит средства и станет хорошей точкой входа в тему.
- Опыт уже есть, и компания успешно монетизирует свои разработки. Мы рекомендуем готовые решения Supermicro, DELL, HPE, H3C. За дополнительную стоимость они позволяют легко наращивать число систем и без проблем размещать их на колокейшн в ведущих дата-центрах.
В наличии есть специализированные платформы для установки до 10 GPU NVIDIA Tesla. Они монтируются в стойку и имеют ряд преимуществ перед кастомными аналогами. Подобрать готовый вариант можно в разделах серверов и ИИ-серверов.
Вывод
Рынок ИИ-технологий растёт, и всё больше компаний развивают собственные проекты для решения бизнес-задач. Сборка своего сервера для ИИ оправдана: она даёт разработчику простор для экспериментов, позволяет обучать модели быстро, оптимизировать обучение под архитектуру системы и менять саму архитектуру под нужды программного обеспечения. Физический сервер решает задачи, которые не решить на выделенном сервере, арендованном у поставщика IT-услуг.
Специалисты «СервакМастер» готовы ответить на вопросы о сборке серверов для обучения нейросетей: задайте их в онлайн-чате на сайте или через страницу контактов.
