Советы по выбору сервера для ИИ: GPU-платформы, ускорители и конфигурации под LLM
В этом материале специалисты СервакМастер делятся практическими советами по выбору и комплектации GPU-серверов для задач инференса и обучения больших языковых моделей (LLM). Мы рассмотрим актуальные серверные платформы, сравним GPU-ускорители по ключевым характеристикам и предложим конкретные конфигурации для локального развёртывания LLAMA 3.2 11B, LLAMA 3.2 90B и наиболее требовательной LLAMA 3.1 405B*.
Почему GPU — отправная точка выбора
При проектировании ИИ-инфраструктуры первостепенное значение имеет графический процессор, а не серверное шасси. GPU определяет вычислительную мощь всей системы: именно он выполняет матричные операции, необходимые для обучения и инференса нейронных сетей. Серверная платформа играет роль масштабируемой несущей конструкции, объединяющей несколько ускорителей в единый высокопроизводительный узел.
Типы ускорителей для серверных систем
В серверные шасси устанавливаются ускорители с пассивным охлаждением — принудительный обдув обеспечивается вентиляционной системой самого корпуса. На рынке представлены два основных семейства:
- NVIDIA Tesla — наиболее распространённое решение с зрелой экосистемой CUDA. Богатый выбор готовых библиотек, фреймворков и инструментов делает разработку ИИ-приложений значительно проще.
- AMD Radeon Instinct — альтернатива на открытом стеке ROCm. Подходит для команд, предпочитающих открытые стандарты или работающих с инструментами, адаптированными под архитектуру AMD.
На практике ускорители Tesla занимают доминирующую долю рынка именно из-за зрелости экосистемы CUDA: большинство фреймворков — PyTorch, TensorFlow, vLLM — ориентированы прежде всего на неё.
Сравнительная таблица GPU-ускорителей
| Наименование ускорителя | Объём VRAM и тип | Производительность FP32 | Производительность FP16/BFLOAT16 |
|---|---|---|---|
| NVIDIA Tesla P100 | 16 ГБ HBM2 | 10,6 TFLOPS | 21,6 TFLOPS |
| NVIDIA Tesla P40 | 24 ГБ GDDR5 | 11,76 TFLOPS | 183 GFLOPS |
| AMD Radeon Instinct MI50 | 16 ГБ HBM2 | 13 TFLOPS | 28,8 TFLOPS |
| NVIDIA Tesla V100 | 16 ГБ HBM2 | 14 TFLOPS | 112 TFLOPS |
| NVIDIA Tesla V100 | 32 ГБ HBM2 | 14 TFLOPS | 112 TFLOPS |
| NVIDIA A100 | 40 ГБ HBM2e | 312 TFLOPS | 624 TFLOPS |
| NVIDIA L40 | 48 ГБ GDDR6 | 181 TFLOPS | 362 TFLOPS |
| NVIDIA H100 | 80 ГБ HBM2e | 989 TFLOPS | 1979 TFLOPS |
Как правильно интерпретировать характеристики
- Объём видеопамяти (VRAM) — чем он больше, тем крупнее модели можно запускать без квантизации. Тип памяти также важен: HBM обеспечивает высокую пропускную способность, критичную для обучения.
- Производительность FP32 — актуальна для неквантизированных моделей с максимальной точностью. Требует значительного объёма VRAM.
- Производительность FP16 — самый распространённый рабочий режим для LLM. Снижает требования к VRAM вдвое при минимальной потере качества ответов.
Практический вывод: выбирайте ускоритель, отталкиваясь от трёх параметров — бюджета, необходимого объёма VRAM и производительности в режиме FP16.
Роль процессора в GPU-сервере для ИИ
Когда инференс выполняется непосредственно на GPU, процессор берёт на себя хост-функцию: управляет передачей данных между RAM, NVMe-хранилищем и ускорителями. При выборе CPU для GPU-сервера стоит ориентироваться на следующие параметры:
- Количество ядер: не менее 16, чтобы обеспечить параллельную предобработку данных.
- Тактовая частота: чем выше, тем быстрее передача заданий на GPU.
- Количество линий PCI-E: определяет, сколько ускорителей можно подключить без потери полосы пропускания.
- Объём кэш-памяти: влияет на эффективность буферизации данных при обмене между CPU и GPU.
Линейки процессоров Intel
| Линейка процессоров | Число линий PCI-E | Версия PCI-E |
|---|---|---|
| Xeon E5 2600v4 | 40 | 3.0 |
| Intel Xeon Scalable 1-го поколения | 48 | 3.0 |
| Intel Xeon Scalable 2-го поколения | 48 | 3.0 |
| Intel Xeon Scalable 3-го поколения | 64 | 4.0 |
| Intel Xeon Scalable 4-го поколения | 80 | 5.0 |
| Intel Xeon Scalable 5-го поколения | 80 | 5.0 |
| Xeon 6900 Performance | 96 | 5.0 |
Линейки процессоров AMD
| Линейка процессоров | Число линий PCI-E | Версия PCI-E |
|---|---|---|
| EPYC 7002 (Zen2) | 128 | 4.0 |
| EPYC 7003 (Zen3) | 128 | 4.0 |
| EPYC 9004 (Zen4) | 128 | 5.0 |
| EPYC 9005 (Zen5) | 128 | 5.0 |
Рекомендация: для GPU-серверов под ИИ оптимальны процессоры AMD EPYC — 128 линий PCI-E с поддержкой актуального стандарта дают максимальную гибкость при масштабировании. Из линейки Intel наиболее сбалансированными по соотношению цены и возможностей являются Xeon Gold/Platinum 1–2-го поколений, а ещё лучше — 3–5-го. Старые процессоры Xeon E5 справляются с хост-ролью, однако ограничивают число подключаемых ускорителей и не рекомендуются в паре с GPU высокого ценового диапазона.
GPU-платформы на сокете LGA2011-3
Несколько шасси в ассортименте СервакМастер построены на процессорах Xeon E5 с шиной PCI-E 3.0. Это наиболее доступные по цене платформы — разумный старт для построения ИИ-инфраструктуры с ограниченным бюджетом.
Supermicro SuperServer 1028GR-TR: компактный 1U-сервер для инференса
Форм-фактор 1U при поддержке до трёх полноразмерных GPU делает 1028GR-TR привлекательным решением там, где важна высокая плотность размещения в стойке. Сервер хорошо подходит для задач инференса небольших и средних моделей, а компактные габариты снижают стоимость аренды стоечного пространства в дата-центре.
Ключевые характеристики:
- Форм-фактор: 1U
- Поддержка до 3 полноразмерных GPU
- Сокет: LGA2011-3 (Xeon E5)
- Шина: PCI-E 3.0
Supermicro SuperServer 4028GR-TR: восемь GPU на доступной платформе
SuperServer 4028GR-TR в форм-факторе 4U способен разместить до восьми ускорителей. Это один из наиболее экономичных способов набрать большой суммарный объём VRAM — критически важный параметр при работе с крупными языковыми моделями. Платформа привлекательна для организаций, стремящихся максимизировать вычислительную мощь при фиксированном бюджете.
Ключевые характеристики:
- Форм-фактор: 4U
- Поддержка до 8 GPU
- Сокет: LGA2011-3 (Xeon E5)
- Шина: PCI-E 3.0
- Оптимален для бюджетных конфигураций с большим суммарным объёмом VRAM
GPU-платформы на сокете LGA3647
Переход к архитектурам Skylake-SP и Cascade Lake с разъёмом LGA3647 существенно расширил возможности GPU-серверов: улучшилась межкомпонентная пропускная способность, появилась полноценная поддержка NVMe-накопителей по шине PCI-E.
Supermicro SuperServer 2029GP-TR: производительное 2U-шасси
2029GP-TR — продвинутая двухюнитовая платформа, поддерживающая до шести GPU без деградации пропускной способности PCI-E. Сервер предлагает хороший баланс между вычислительной плотностью и гибкостью конфигурации, что делает его подходящим вариантом для инференса и тонкой настройки (fine-tuning) моделей среднего размера.
Ключевые характеристики:
- Форм-фактор: 2U
- До 6 GPU без деградации пропускной способности
- Сокет: LGA3647 (Xeon Scalable 1–2-го поколений)
- Шина: PCI-E 3.0
Supermicro SuperServer 4029GP-TRT2: обновлённый PCI-E Switch для многокарточных конфигураций
SuperServer 4029GP-TRT2 — развитие 4U-семейства на сокете LGA3647 с новым поколением PCI-E Switch. Обновлённый коммутатор снижает задержки при взаимодействии GPU между собой и с процессором, что особенно заметно в многокарточных конфигурациях при параллельном инференсе. Бэкплейн поддерживает до четырёх гибридных слотов U.2, позволяя разместить высокоскоростные NVMe-накопители прямо внутри сервера.
Ключевые характеристики:
- Форм-фактор: 4U
- До 8 GPU
- Сокет: LGA3647 (Xeon Scalable 1–2-го поколений)
- Новое поколение PCI-E Switch
- До 4 слотов U.2 для NVMe
GPU-платформы на сокете SP3 (AMD EPYC)
Supermicro A+ Server 4124GS-TNR: топовая платформа для требовательных LLM
A+ Server 4124GS-TNR (4U, 24 SFF) — флагманское решение в линейке Supermicro для задач ИИ. Ключевое архитектурное преимущество: все GPU подключаются к процессору напрямую, без промежуточного PCI-E Switch. Это минимизирует задержки при обмене данными между ускорителями и существенно ускоряет как инференс, так и обучение. Процессоры AMD EPYC 7003 (Milan) обеспечивают 128 линий PCI-E 4.0, высокую пропускную способность памяти и надёжность под длительной нагрузкой.
Ключевые характеристики:
- Форм-фактор: 4U, 24 SFF
- До 8 GPU без PCI-E Switch
- Сокет: SP3 (AMD EPYC 7003/Milan)
- Шина: PCI-E 4.0
- Прямое подключение GPU к CPU — минимальные задержки
Готовые конфигурации под конкретные LLM
Конфигурации под LLAMA 3.2 11B*
Для стабильной работы с LLAMA 3.2 11B* потребуется следующий объём VRAM в зависимости от точности:
- FP32: ~180 ГБ VRAM для инференса, до 1,5 ТБ VRAM для обучения.
- FP16: ~90 ГБ VRAM для инференса, до 750 ГБ VRAM для обучения.
- FP8: ~22,5 ГБ VRAM для инференса, до 187,5 ГБ VRAM для обучения.
| Режим | Платформа | Конфигурация | Суммарный объём VRAM |
|---|---|---|---|
| LLAMA 11B* (FP32) | SuperServer 4028GR-TR 4U | CPU: 2× Xeon 2687Wv4 / RAM: 512 ГБ DDR4 ECC REG / GPU: 8× Tesla P40 24 ГБ | 192 ГБ |
| LLAMA 11B* (FP16) | SuperServer 2029GP-TR 2U | CPU: 2× Xeon Gold 6154 / RAM: 256 ГБ DDR4 ECC REG / GPU: 3× Tesla V100 32 ГБ | 96 ГБ |
| LLAMA 11B* (FP8) | SuperServer 1028GR-TR 1U | CPU: 2× Xeon 2687Wv4 / RAM: 128 ГБ DDR4 ECC REG / GPU: 3× Tesla P100 16 ГБ | 48 ГБ |
Конфигурации под LLAMA 3.2 90B*
Модель LLAMA 3.2 90B* предъявляет значительно более высокие требования к вычислительным ресурсам и требует ускорителей более высокого класса:
- FP32: ~720 ГБ VRAM для инференса, до 2,5 ТБ VRAM для обучения.
- FP16: ~360 ГБ VRAM для инференса, до 1,25 ТБ VRAM для обучения.
- FP8: ~90 ГБ VRAM для инференса, до 375 ГБ VRAM для обучения.
| Режим | Платформа | Конфигурация | Суммарный объём VRAM |
|---|---|---|---|
| LLAMA 90B* (FP32) | A+ Server 4124GS-TNR 4U | CPU: 2× EPYC 75F3 / RAM: 2 ТБ DDR4 ECC REG / GPU: 8× Tesla H100 96 ГБ | 768 ГБ |
| LLAMA 90B* (FP16) | SuperServer 4029GP-TRT2 4U | CPU: 2× Xeon Gold 6254 / RAM: 1024 ГБ DDR4 ECC REG / GPU: 6× Tesla H100 80 ГБ | 480 ГБ |
| LLAMA 90B* (FP8) | SuperServer 2029GP-TR 2U | CPU: 2× Xeon 6246 / RAM: 512 ГБ DDR4 ECC REG / GPU: 6× Tesla V100 16 ГБ | 96 ГБ |
Конфигурации для LLAMA 3.1 405B*
LLAMA 3.1 405B* — наиболее требовательная текстовая LLM в этом обзоре. Модель обучена на текстовых данных, отличается высокой точностью и хорошо поддаётся тонкой настройке, однако требует колоссального объёма видеопамяти:
- FP32: ~972 ГБ VRAM для инференса, до 1944 ГБ VRAM для обучения.
- FP16: ~486 ГБ VRAM для инференса, до 972 ГБ VRAM для обучения.
- FP8: ~243 ГБ VRAM для инференса, до 486 ГБ VRAM для обучения.
| Режим | Платформа | Конфигурация | Суммарный объём VRAM |
|---|---|---|---|
| LLAMA 405B* (FP32) | A+ Server AS-8125GS-TNHR 8U | CPU: 2× EPYC 9374F / RAM: 4 ТБ / GPU: H200 SXM 141 ГБ | 1128 ГБ |
| LLAMA 405B* (FP16) | A+ Server 4124GS-TNR 4U | CPU: 2× EPYC 75F3 / RAM: 2 ТБ DDR4 ECC REG / GPU: 8× Instinct MI210 64 ГБ | 512 ГБ |
| LLAMA 405B* (FP8) | SuperServer 4029GP-TRT2 4U | CPU: 2× Xeon Gold 6254 / RAM: 1024 ГБ DDR4 ECC REG / GPU: 6× Tesla L40 48 ГБ | 288 ГБ |
Заключение
Локальное развёртывание LLM становится стандартной практикой для компаний, которым важны контроль над корпоративными данными, возможность тонкой настройки под внутренние задачи и независимость от внешних облачных провайдеров. Грамотный выбор GPU-сервера позволяет существенно снизить стоимость инференса в долгосрочной перспективе по сравнению с облачными тарифами.
СервакМастер готов помочь с подбором оптимальной конфигурации — от экономичных решений на базе Xeon E5 с ускорителями Tesla P40 до топовых платформ на AMD EPYC с GPU H100 и H200. Если вас интересует сборка сервера под инференс или обучение моделей LLAMA*, StableDiffusion, Mistral или других LLM, обратитесь к специалистам СервакМастер — мы подберём решение с учётом ваших задач и бюджета.
*LLAMA 3.2 — проект Meta Platforms Inc.**, деятельность которой в России признана экстремистской и запрещена.
**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена.
