Зачем вообще выбирать специализированный сервер для ИИ
Несколько лет назад ИИ-серверы занимали узкую нишу на рынке IT-оборудования. Сегодня это один из наиболее динамично растущих сегментов: нейросетевые модели всё глубже проникают в промышленность, медицину, финансы и кибербезопасность. Каждое новое поколение LLM требует больше памяти, выше пропускной способности и более точной синхронизации между ускорителями. В результате «просто взять мощный сервер» уже не работает — нужно понимать, под какую именно задачу собирается платформа.
Специалисты СервакМастер подготовили подробный разбор: какое железо необходимо для инференса, а какое — для полноценного обучения моделей, и на какие параметры ориентироваться в каждом сценарии.
Две принципиально разные задачи: инференс и обучение
Первый шаг при выборе сервера — определить класс задачи. Инференс — это запуск уже готовой модели для получения ответов на запросы пользователей или систем. Обучение — тренировка новой или дообучение существующей нейросети на собственных данных.
Большинству компаний требуется именно инференс: чат-боты, классификация документов, генерация текста, анализ изображений. Обучение — удел исследовательских центров и крупных организаций с серьёзными бюджетами, которые создают собственные модели или адаптируют открытые под корпоративную специфику.
Требования к оборудованию расходятся сразу по нескольким направлениям:
- Точность вычислений. Инференс использует квантизированные модели — форматы INT8, FP8, NF4 сокращают потребление VRAM в 4 раза при минимальной потере качества. Обучение ведётся исключительно в высокоточных форматах FP16, BF16, FP32, которые требуют в 4–10 раз больше видеопамяти.
- Масштабирование. При инференсе GPU работают независимо друг от друга, и высокоскоростные межсоединения NVLink не обязательны. При обучении требуется жёсткая синхронизация градиентов — ускорители объединяют через NVLink или коммутаторы NVSwitch в единый кластер.
- Актуальность моделей. Нейросети устаревают быстро. При инференсе достаточно переключиться на новый открытый релиз без потери вложенных ресурсов. При обучении месяцами дообучаемая модель рискует оказаться устаревшей к моменту выхода.
Рассмотрим каждый сценарий подробно.
Сервер для инференса: на что смотреть
Инференс-сервер должен обеспечивать минимальные задержки генерации и достаточную пропускную способность для обработки одновременных запросов. Основная нагрузка — на GPU, но остальные компоненты тоже влияют на итоговую производительность.
GPU: главный критерий — объём VRAM
Видеокарты — ключевой компонент сервера для инференса. Подходят как серверные ускорители (NVIDIA A100, L40, L4, RTX 6000 Blackwell), так и профессиональные потребительские решения с большим объёмом памяти — RTX 4090/5090 (32 ГБ).
Практические ориентиры по потребности в VRAM:
- Запуск Qwen3-30B-A3B в 4-битной квантизации — около 35–40 ГБ VRAM.
- Запуск Mistral 3 7B в формате INT8 — достаточно 10–12 ГБ VRAM.
Важно понимать: модель занимает не весь объём видеопамяти. Часть резервируется под KV-кэш (кэш ключей и значений, необходимый для генерации токенов), и его размер растёт пропорционально длине контекста. Для Qwen-3 14B с контекстом 4096 токенов KV-кэш составляет около 1 ГБ. На практике фактический объём VRAM должен превышать вес модели на 10–20% — плюс накладные расходы драйвера и ИИ-библиотек.
Ещё один нюанс: современные модели используют форматы точности (например, FP4), которые не поддерживаются GPU старых архитектур. Поэтому для инференса предпочтительны карты не старше 2–3 поколений. Тип охлаждения — турбинный или пассивный — выбирается исходя из условий монтажа: турбины эффективнее при плотной компоновке в стойке, пассивные требуют мощного принудительного обдува корпуса.
Помимо NVIDIA и AMD, заслуживают внимания альтернативные ИИ-ускорители — Huawei Ascend и Intel Arc Pro. Они предлагают привлекательные ценники и хорошую энергоэффективность, но работают на собственных фреймворках (CANN у Huawei, MESA у Intel), что усложняет интеграцию с привычными инструментами на базе CUDA и ROCm.
Для лёгкого потребительского инференса подойдёт AMD Radeon AI PRO R9700 AI TOP 32 ГБ, тогда как для запуска крупных LLM на 100+ миллиардов параметров потребуются ускорители уровня Nvidia RTX Pro 6000 Blackwell Workstation Edition.
CPU: требования скромные, но не нулевые
Для инференса с GPU достаточно современного процессора с поддержкой PCIe 4.0/5.0 и количеством ядер 8–16. Основная нагрузка приходится на видеокарты, процессор лишь подготавливает данные и управляет очередями запросов.
Если же планируется инференс исключительно на CPU (например, с движком llama.cpp), потребуется мощный процессор с 32+ ядрами, многоканальной высокочастотной памятью и большим объёмом ОЗУ. Скорость вывода при этом принципиально ниже, чем на GPU. Разумным компромиссом стали компактные ИИ-ПК с APU-чипами AMD Ryzen AI Max+ 395 или Nvidia GB10 с большим объёмом унифицированной памяти LPDDR5 — они позволяют запускать небольшие модели локально без отдельного GPU, а при объединении в кластер возможности инференса существенно расширяются.
Оперативная память: достаточно, но не сверх меры
При использовании GPU оперативная память нужна для загрузки модели перед передачей в VRAM и хранения сопутствующих данных — токенов, контекста. Для квантизированных моделей объёмом до 30–40 ГБ достаточно 64 ГБ ОЗУ. Если модель не помещается целиком во VRAM, часть данных остаётся в RAM — это резко замедляет генерацию из-за своппинга.
При инференсе на CPU оперативная память становится критически важным ресурсом: для запуска Qwen3.5-122B-A10B в формате Q4_K_M требуется 76,5 ГБ — с учётом накладных расходов рекомендуется не менее 96 ГБ ОЗУ.
NVMe-накопители: скорость загрузки моделей имеет значение
Современные LLM весят десятки и сотни гигабайт. Для быстрой загрузки в память при запуске или переключении между моделями необходимы NVMe SSD с высокой скоростью последовательного чтения. SATA SSD и тем более HDD создают неприемлемые задержки. Рекомендуется выделить отдельный быстрый накопитель или RAID-массив под библиотеку моделей. Для ориентира: загрузка Qwen3.5-122B-A10B занимает около 26 секунд на M.2 PCIe 3.0 — поэтому скоростная подсистема хранения является не опцией, а базовым требованием.
Серверная платформа: от рабочей станции до стоечного сервера
Сервер для инференса может быть реализован как рабочая станция (настольный корпус с 1–4 GPU) или как стоечный сервер высотой 2U–4U с поддержкой до 10 и более ускорителей. Для домашнего использования или малого бизнеса нередко достаточно мощной рабочей станции, тогда как SaaS-проектам нужны полноценные серверы с поддержкой горячей замены компонентов. Система охлаждения должна быть рассчитана на тепловыделение GPU — до 300–600 Вт каждая: перегрев неизбежно приводит к троттлингу и падению производительности.
Сервер для обучения нейросетей: другой уровень требований
Обучение нейросетей — задача принципиально иного масштаба. Здесь важны не только объёмы памяти, но и максимальная пропускная способность, и высокоскоростные соединения между ускорителями.
GPU: только профессиональные ускорители с HBM
Для обучения применяют ускорители с памятью HBM (High Bandwidth Memory). Минимальным актуальным стандартом является NVIDIA A100 (40 или 80 ГБ HBM2e). Более производительные варианты — Nvidia H100 (80–144 ГБ HBM3) и AMD MI210 на 64 ГБ HBM2e. Эти карты оснащены встроенными высокоскоростными интерфейсами — NVLink и Infinity Fabric — для объединения в кластер, а также поддерживают стандартные разъёмы PCIe.
Потребительские карты RTX 4090 и 5090 не имеют памяти HBM и быстрых межсоединений, поэтому для распределённого обучения крупных моделей они малопригодны. Для экспериментов с небольшими моделями до 20–30 млрд параметров на одной карте их применение вполне оправдано.
Связь между ускорителями: NVLink и NVSwitch
Для обучения критически важна возможность объединить несколько GPU в единое адресное пространство с минимальными задержками. NVLink обеспечивает скорость передачи данных до 900 ГБ/с между картами, а NVSwitch позволяет создать полностью связанную топологию, где 8 GPU взаимодействуют друг с другом напрямую без дополнительных задержек.
Карты в исполнении SXM (NVIDIA) или OAM (AMD) устанавливаются в специальные разъёмы на материнской плате и соединяются через коммутаторы, минуя шину PCIe. Это даёт возможность обучать модели, не помещающиеся в память одной карты, за счёт тензорного параллелизма.
Важно учитывать: в потребительском сегменте NVLink был доступен только на RTX 3090 и то в ограниченном виде. Начиная с серии RTX 40xx он отсутствует — объединить две RTX 4090 в кластер для распределённого обучения не получится.
Сетевой интерконнект: InfiniBand или RoCE
При обучении на нескольких серверах необходимы высокоскоростные сетевые интерфейсы — InfiniBand или RoCE со скоростью 200–400 Гбит/с с поддержкой RDMA для прямого обмена данными между GPU разных узлов. Применяются специализированные коммутаторы (например, Mellanox Spectrum) с неблокирующей топологией Fat-Tree. Без такой сети синхронизация градиентов становится узким местом, и эффективность всего кластера резко снижается.
Серверная платформа: от HGX до NVL72
Серверы для обучения выпускаются в виде специализированных платформ, например NVIDIA DGX/HGX, где 8 GPU уже установлены на одной плате с NVSwitch. Типичное энергопотребление такого сервера с 8×H100 достигает 10–12 кВт, что требует промышленной системы охлаждения и усиленного электропитания.
Отдельного внимания заслуживают серверные стойки NVIDIA NVL72 — они объединяют до 72 GPU NVIDIA (Blackwell, в перспективе — Rubin) с коммутаторами NVLink для связи без задержек. Это позволяет обучать модели с сотнями миллиардов или даже триллионами параметров, однако стоимость исчисляется миллионами долларов и подобные решения доступны лишь крупнейшим облачным гиперскейлерам. В планах NVIDIA — кластеры на 144 и 576 ускорителей с ещё более высоким уровнем производительности.
CPU: максимум ядер и линий PCIe
Для обучающих серверов требуется процессор с большим количеством ядер и поддержкой многочисленных линий PCIe — как правило, AMD EPYC 4-го/5-го поколения или Intel Xeon 6-го поколения. CPU отвечает за подготовку данных (data loading), управление кластером и координацию ввода-вывода. Ключевое требование — достаточное количество линий PCIe 5.0 для подключения GPU и высокоскоростных сетевых карт.
Оперативная память: с запасом
Объём ОЗУ должен быть достаточным для хранения датасетов и промежуточных состояний модели. Рекомендуется соотношение 1:2 или 1:4 от суммарной видеопамяти. Например, для конфигурации 8×A100 80 ГБ (640 ГБ суммарной VRAM) необходимо не менее 256–512 ГБ ОЗУ. В ряде сценариев часть модели может временно выгружаться в RAM, поэтому запас не будет лишним.
NVMe-массивы: максимальная скорость доступа к датасетам
Обучение требует сверхбыстрого доступа к обучающим данным. Применяются NVMe-массивы с RAID и суммарной пропускной способностью десятки гигабайт в секунду. Медленное хранилище приводит к простою GPU в ожидании новых батчей данных, что кратно увеличивает суммарное время обучения.
Итоги: как не ошибиться с выбором
Прежде чем вкладывать значительную сумму в ИИ-сервер, чётко определитесь с задачей — требования к железу для инференса и обучения кардинально различаются.
- Для инференса достаточно GPU с большим объёмом VRAM (от 32 ГБ), квантизированных моделей и умеренной инфраструктуры без огромных инвестиций.
- Для обучения потребуются профессиональные GPU с памятью HBM, поддержкой NVLink и высокоскоростным InfiniBand-интерконнектом — это уже совершенно иной бюджет.
Помните, что ИИ-индустрия развивается с огромной скоростью: конфигурация, актуальная сегодня, через год может тянуть лишь устаревшие модели. Чтобы собрать производительный ИИ-сервер, который долго будет поддерживать актуальные нейросети, обратитесь к специалистам СервакМастер. Мы подберём оптимальную конфигурацию под ваши задачи и бюджет, поможем с установкой и настройкой программного окружения — от выбора оборудования до успешного запуска.
