Советы по выбору сервера для ИИ: GPU-платформы, ускорители и конфигурации под LLM

В этом материале специалисты СервакМастер делятся практическими советами по выбору и комплектации GPU-серверов для задач инференса и обучения больших языковых моделей (LLM). Мы рассмотрим актуальные серверные платформы, сравним GPU-ускорители по ключевым характеристикам и предложим конкретные конфигурации для локального развёртывания LLAMA 3.2 11B, LLAMA 3.2 90B и наиболее требовательной LLAMA 3.1 405B*.


Почему GPU — отправная точка выбора

При проектировании ИИ-инфраструктуры первостепенное значение имеет графический процессор, а не серверное шасси. GPU определяет вычислительную мощь всей системы: именно он выполняет матричные операции, необходимые для обучения и инференса нейронных сетей. Серверная платформа играет роль масштабируемой несущей конструкции, объединяющей несколько ускорителей в единый высокопроизводительный узел.

Типы ускорителей для серверных систем

В серверные шасси устанавливаются ускорители с пассивным охлаждением — принудительный обдув обеспечивается вентиляционной системой самого корпуса. На рынке представлены два основных семейства:

  • NVIDIA Tesla — наиболее распространённое решение с зрелой экосистемой CUDA. Богатый выбор готовых библиотек, фреймворков и инструментов делает разработку ИИ-приложений значительно проще.
  • AMD Radeon Instinct — альтернатива на открытом стеке ROCm. Подходит для команд, предпочитающих открытые стандарты или работающих с инструментами, адаптированными под архитектуру AMD.

На практике ускорители Tesla занимают доминирующую долю рынка именно из-за зрелости экосистемы CUDA: большинство фреймворков — PyTorch, TensorFlow, vLLM — ориентированы прежде всего на неё.

Сравнительная таблица GPU-ускорителей

Наименование ускорителя Объём VRAM и тип Производительность FP32 Производительность FP16/BFLOAT16
NVIDIA Tesla P100 16 ГБ HBM2 10,6 TFLOPS 21,6 TFLOPS
NVIDIA Tesla P40 24 ГБ GDDR5 11,76 TFLOPS 183 GFLOPS
AMD Radeon Instinct MI50 16 ГБ HBM2 13 TFLOPS 28,8 TFLOPS
NVIDIA Tesla V100 16 ГБ HBM2 14 TFLOPS 112 TFLOPS
NVIDIA Tesla V100 32 ГБ HBM2 14 TFLOPS 112 TFLOPS
NVIDIA A100 40 ГБ HBM2e 312 TFLOPS 624 TFLOPS
NVIDIA L40 48 ГБ GDDR6 181 TFLOPS 362 TFLOPS
NVIDIA H100 80 ГБ HBM2e 989 TFLOPS 1979 TFLOPS

Как правильно интерпретировать характеристики

  • Объём видеопамяти (VRAM) — чем он больше, тем крупнее модели можно запускать без квантизации. Тип памяти также важен: HBM обеспечивает высокую пропускную способность, критичную для обучения.
  • Производительность FP32 — актуальна для неквантизированных моделей с максимальной точностью. Требует значительного объёма VRAM.
  • Производительность FP16 — самый распространённый рабочий режим для LLM. Снижает требования к VRAM вдвое при минимальной потере качества ответов.

Практический вывод: выбирайте ускоритель, отталкиваясь от трёх параметров — бюджета, необходимого объёма VRAM и производительности в режиме FP16.


Роль процессора в GPU-сервере для ИИ

Когда инференс выполняется непосредственно на GPU, процессор берёт на себя хост-функцию: управляет передачей данных между RAM, NVMe-хранилищем и ускорителями. При выборе CPU для GPU-сервера стоит ориентироваться на следующие параметры:

  • Количество ядер: не менее 16, чтобы обеспечить параллельную предобработку данных.
  • Тактовая частота: чем выше, тем быстрее передача заданий на GPU.
  • Количество линий PCI-E: определяет, сколько ускорителей можно подключить без потери полосы пропускания.
  • Объём кэш-памяти: влияет на эффективность буферизации данных при обмене между CPU и GPU.

Линейки процессоров Intel

Линейка процессоров Число линий PCI-E Версия PCI-E
Xeon E5 2600v4 40 3.0
Intel Xeon Scalable 1-го поколения 48 3.0
Intel Xeon Scalable 2-го поколения 48 3.0
Intel Xeon Scalable 3-го поколения 64 4.0
Intel Xeon Scalable 4-го поколения 80 5.0
Intel Xeon Scalable 5-го поколения 80 5.0
Xeon 6900 Performance 96 5.0

Линейки процессоров AMD

Линейка процессоров Число линий PCI-E Версия PCI-E
EPYC 7002 (Zen2) 128 4.0
EPYC 7003 (Zen3) 128 4.0
EPYC 9004 (Zen4) 128 5.0
EPYC 9005 (Zen5) 128 5.0

Рекомендация: для GPU-серверов под ИИ оптимальны процессоры AMD EPYC — 128 линий PCI-E с поддержкой актуального стандарта дают максимальную гибкость при масштабировании. Из линейки Intel наиболее сбалансированными по соотношению цены и возможностей являются Xeon Gold/Platinum 1–2-го поколений, а ещё лучше — 3–5-го. Старые процессоры Xeon E5 справляются с хост-ролью, однако ограничивают число подключаемых ускорителей и не рекомендуются в паре с GPU высокого ценового диапазона.


GPU-платформы на сокете LGA2011-3

Несколько шасси в ассортименте СервакМастер построены на процессорах Xeon E5 с шиной PCI-E 3.0. Это наиболее доступные по цене платформы — разумный старт для построения ИИ-инфраструктуры с ограниченным бюджетом.

Supermicro SuperServer 1028GR-TR: компактный 1U-сервер для инференса

Форм-фактор 1U при поддержке до трёх полноразмерных GPU делает 1028GR-TR привлекательным решением там, где важна высокая плотность размещения в стойке. Сервер хорошо подходит для задач инференса небольших и средних моделей, а компактные габариты снижают стоимость аренды стоечного пространства в дата-центре.

Ключевые характеристики:

  • Форм-фактор: 1U
  • Поддержка до 3 полноразмерных GPU
  • Сокет: LGA2011-3 (Xeon E5)
  • Шина: PCI-E 3.0

Supermicro SuperServer 4028GR-TR: восемь GPU на доступной платформе

SuperServer 4028GR-TR в форм-факторе 4U способен разместить до восьми ускорителей. Это один из наиболее экономичных способов набрать большой суммарный объём VRAM — критически важный параметр при работе с крупными языковыми моделями. Платформа привлекательна для организаций, стремящихся максимизировать вычислительную мощь при фиксированном бюджете.

Ключевые характеристики:

  • Форм-фактор: 4U
  • Поддержка до 8 GPU
  • Сокет: LGA2011-3 (Xeon E5)
  • Шина: PCI-E 3.0
  • Оптимален для бюджетных конфигураций с большим суммарным объёмом VRAM

GPU-платформы на сокете LGA3647

Переход к архитектурам Skylake-SP и Cascade Lake с разъёмом LGA3647 существенно расширил возможности GPU-серверов: улучшилась межкомпонентная пропускная способность, появилась полноценная поддержка NVMe-накопителей по шине PCI-E.

Supermicro SuperServer 2029GP-TR: производительное 2U-шасси

2029GP-TR — продвинутая двухюнитовая платформа, поддерживающая до шести GPU без деградации пропускной способности PCI-E. Сервер предлагает хороший баланс между вычислительной плотностью и гибкостью конфигурации, что делает его подходящим вариантом для инференса и тонкой настройки (fine-tuning) моделей среднего размера.

Ключевые характеристики:

  • Форм-фактор: 2U
  • До 6 GPU без деградации пропускной способности
  • Сокет: LGA3647 (Xeon Scalable 1–2-го поколений)
  • Шина: PCI-E 3.0

Supermicro SuperServer 4029GP-TRT2: обновлённый PCI-E Switch для многокарточных конфигураций

SuperServer 4029GP-TRT2 — развитие 4U-семейства на сокете LGA3647 с новым поколением PCI-E Switch. Обновлённый коммутатор снижает задержки при взаимодействии GPU между собой и с процессором, что особенно заметно в многокарточных конфигурациях при параллельном инференсе. Бэкплейн поддерживает до четырёх гибридных слотов U.2, позволяя разместить высокоскоростные NVMe-накопители прямо внутри сервера.

Ключевые характеристики:

  • Форм-фактор: 4U
  • До 8 GPU
  • Сокет: LGA3647 (Xeon Scalable 1–2-го поколений)
  • Новое поколение PCI-E Switch
  • До 4 слотов U.2 для NVMe

GPU-платформы на сокете SP3 (AMD EPYC)

Supermicro A+ Server 4124GS-TNR: топовая платформа для требовательных LLM

A+ Server 4124GS-TNR (4U, 24 SFF) — флагманское решение в линейке Supermicro для задач ИИ. Ключевое архитектурное преимущество: все GPU подключаются к процессору напрямую, без промежуточного PCI-E Switch. Это минимизирует задержки при обмене данными между ускорителями и существенно ускоряет как инференс, так и обучение. Процессоры AMD EPYC 7003 (Milan) обеспечивают 128 линий PCI-E 4.0, высокую пропускную способность памяти и надёжность под длительной нагрузкой.

Ключевые характеристики:

  • Форм-фактор: 4U, 24 SFF
  • До 8 GPU без PCI-E Switch
  • Сокет: SP3 (AMD EPYC 7003/Milan)
  • Шина: PCI-E 4.0
  • Прямое подключение GPU к CPU — минимальные задержки

Готовые конфигурации под конкретные LLM

Конфигурации под LLAMA 3.2 11B*

Для стабильной работы с LLAMA 3.2 11B* потребуется следующий объём VRAM в зависимости от точности:

  • FP32: ~180 ГБ VRAM для инференса, до 1,5 ТБ VRAM для обучения.
  • FP16: ~90 ГБ VRAM для инференса, до 750 ГБ VRAM для обучения.
  • FP8: ~22,5 ГБ VRAM для инференса, до 187,5 ГБ VRAM для обучения.
Режим Платформа Конфигурация Суммарный объём VRAM
LLAMA 11B* (FP32) SuperServer 4028GR-TR 4U CPU: 2× Xeon 2687Wv4 / RAM: 512 ГБ DDR4 ECC REG / GPU: 8× Tesla P40 24 ГБ 192 ГБ
LLAMA 11B* (FP16) SuperServer 2029GP-TR 2U CPU: 2× Xeon Gold 6154 / RAM: 256 ГБ DDR4 ECC REG / GPU: 3× Tesla V100 32 ГБ 96 ГБ
LLAMA 11B* (FP8) SuperServer 1028GR-TR 1U CPU: 2× Xeon 2687Wv4 / RAM: 128 ГБ DDR4 ECC REG / GPU: 3× Tesla P100 16 ГБ 48 ГБ

Конфигурации под LLAMA 3.2 90B*

Модель LLAMA 3.2 90B* предъявляет значительно более высокие требования к вычислительным ресурсам и требует ускорителей более высокого класса:

  • FP32: ~720 ГБ VRAM для инференса, до 2,5 ТБ VRAM для обучения.
  • FP16: ~360 ГБ VRAM для инференса, до 1,25 ТБ VRAM для обучения.
  • FP8: ~90 ГБ VRAM для инференса, до 375 ГБ VRAM для обучения.
Режим Платформа Конфигурация Суммарный объём VRAM
LLAMA 90B* (FP32) A+ Server 4124GS-TNR 4U CPU: 2× EPYC 75F3 / RAM: 2 ТБ DDR4 ECC REG / GPU: 8× Tesla H100 96 ГБ 768 ГБ
LLAMA 90B* (FP16) SuperServer 4029GP-TRT2 4U CPU: 2× Xeon Gold 6254 / RAM: 1024 ГБ DDR4 ECC REG / GPU: 6× Tesla H100 80 ГБ 480 ГБ
LLAMA 90B* (FP8) SuperServer 2029GP-TR 2U CPU: 2× Xeon 6246 / RAM: 512 ГБ DDR4 ECC REG / GPU: 6× Tesla V100 16 ГБ 96 ГБ

Конфигурации для LLAMA 3.1 405B*

LLAMA 3.1 405B* — наиболее требовательная текстовая LLM в этом обзоре. Модель обучена на текстовых данных, отличается высокой точностью и хорошо поддаётся тонкой настройке, однако требует колоссального объёма видеопамяти:

  • FP32: ~972 ГБ VRAM для инференса, до 1944 ГБ VRAM для обучения.
  • FP16: ~486 ГБ VRAM для инференса, до 972 ГБ VRAM для обучения.
  • FP8: ~243 ГБ VRAM для инференса, до 486 ГБ VRAM для обучения.
Режим Платформа Конфигурация Суммарный объём VRAM
LLAMA 405B* (FP32) A+ Server AS-8125GS-TNHR 8U CPU: 2× EPYC 9374F / RAM: 4 ТБ / GPU: H200 SXM 141 ГБ 1128 ГБ
LLAMA 405B* (FP16) A+ Server 4124GS-TNR 4U CPU: 2× EPYC 75F3 / RAM: 2 ТБ DDR4 ECC REG / GPU: 8× Instinct MI210 64 ГБ 512 ГБ
LLAMA 405B* (FP8) SuperServer 4029GP-TRT2 4U CPU: 2× Xeon Gold 6254 / RAM: 1024 ГБ DDR4 ECC REG / GPU: 6× Tesla L40 48 ГБ 288 ГБ

Заключение

Локальное развёртывание LLM становится стандартной практикой для компаний, которым важны контроль над корпоративными данными, возможность тонкой настройки под внутренние задачи и независимость от внешних облачных провайдеров. Грамотный выбор GPU-сервера позволяет существенно снизить стоимость инференса в долгосрочной перспективе по сравнению с облачными тарифами.

СервакМастер готов помочь с подбором оптимальной конфигурации — от экономичных решений на базе Xeon E5 с ускорителями Tesla P40 до топовых платформ на AMD EPYC с GPU H100 и H200. Если вас интересует сборка сервера под инференс или обучение моделей LLAMA*, StableDiffusion, Mistral или других LLM, обратитесь к специалистам СервакМастер — мы подберём решение с учётом ваших задач и бюджета.


*LLAMA 3.2 — проект Meta Platforms Inc.**, деятельность которой в России признана экстремистской и запрещена.

**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена.