Серверы для запуска DeepSeek R1 671B — готовые AI-конфигурации в «СервакМастер»
Оборудование для инференса DeepSeek R1 671B
DeepSeek R1 671B — открытая языковая модель с 671 миллиардом параметров, построенная на архитектуре Mixture of Experts. По качеству рассуждений она конкурирует с ведущими проприетарными решениями, однако требует соответствующей аппаратной базы: достаточного объёма GPU-памяти, быстрых межузловых интерконнектов и надёжного охлаждения. В «СервакМастер» представлены как готовые конфигурации серверов, так и отдельные компоненты для построения инфраструктуры любого масштаба.
Требования модели к аппаратному обеспечению
Архитектура MoE активирует лишь часть экспертных блоков на каждом проходе, но всё множество весов должно оставаться доступным в памяти GPU. Практические требования:
- 340–380 ГБ GPU-памяти — минимум для хранения весов в FP8/INT8 без деградации точности
- 700 ГБ и более — при развёртывании в BF16 или FP16
- Высокоскоростной интерконнект — NVLink, InfiniBand или RoCEv2 для многоузловых конфигураций
- Быстрая дисковая подсистема — NVMe RAID для загрузки чекпоинтов за приемлемое время
Конфигурации серверов
Одноузловые системы: 8 GPU на один хост
Оптимальный вариант для задач с предсказуемой нагрузкой и ограниченным бюджетом:
- 8× NVIDIA H100 SXM5 80 ГБ — 640 ГБ HBM3 суммарно; NVLink четвёртого поколения обеспечивает полосу пропускания до 900 ГБ/с между ускорителями; достаточно для инференса в FP8 при батче до 32 запросов
- 8× NVIDIA H200 SXM 141 ГБ — 1128 ГБ HBM3e; модель полностью помещается в BF16, оставшийся запас памяти позволяет увеличить batch size и длину контекста
- 8× AMD Instinct MI300X 192 ГБ — 1536 ГБ HBM3; рекордный объём на один ускоритель, особенно выгоден при работе с длинными диалогами и крупными батчами
Платформы, которые мы рекомендуем для таких конфигураций: Supermicro SYS-821GE-TNHR, ASUS ESC N8-E11, Dell PowerEdge XE9680.
Многоузловые кластеры: 16–32 GPU и более
При необходимости обслуживать десятки и сотни одновременных запросов разумно распределить нагрузку по нескольким узлам:
- 2 узла × 8× H100 80 ГБ — 1280 ГБ суммарной GPU-памяти; тензорный параллелизм через InfiniBand HDR 200 Гбит/с
- 4 узла × 8× H100 80 ГБ — 2560 ГБ; конвейерный и тензорный параллелизм; пропускная способность от 5000 токенов/с при batch 128
- Сетевая коммутация: Mellanox Quantum-2 QM9700 или NVIDIA Spectrum-4 — оба варианта обеспечивают задержку менее микросекунды между узлами
Ключевые компоненты серверной платформы
Процессоры
- AMD EPYC 9654 (Genoa) — 96 ядер, TDP 360 Вт; связка с GPU через PCIe 5.0 x16 обеспечивает высокую пропускную способность хост–ускоритель
- Intel Xeon Platinum 8490H (Sapphire Rapids) — 60 ядер, опциональная поддержка HBM-памяти на плате; хороший выбор для гибридных CPU+GPU пайплайнов
Оперативная память
- Минимум 512 ГБ DDR5-4800 ECC на узел — для токенизатора, системных служб и оркестратора
- 1–2 ТБ DDR5 — рекомендуется при одновременном запуске нескольких моделей или тяжёлых preprocessing-конвейеров
Хранилище
- 4–8× NVMe U.2 PCIe 5.0 ёмкостью 7,68 ТБ в striped-конфигурации — последовательное чтение свыше 28 ГБ/с; полный чекпоинт DeepSeek R1 671B загружается за 30–60 секунд
- CXL-накопители — альтернатива для расширения пула адресуемой памяти без дополнительных GPU
Сетевые адаптеры
- NVIDIA ConnectX-7 NDR 400G InfiniBand — для кластерных инсталляций; задержка менее 600 нс
- ConnectX-7 200GbE RoCEv2 — более доступная альтернатива для однородных Ethernet-инфраструктур
Питание и охлаждение
- Резервированные блоки питания мощностью 3000–3600 Вт на каждый узел
- Жидкостное прямое охлаждение (DLC) снижает тепловую нагрузку на машинный зал и позволяет работать с GPU при суммарном TDP 700 Вт и выше без перегрева
Программный стек для высоконагруженного инференса
Аппаратная часть — только основа. Для эффективного запуска DeepSeek R1 671B «СервакМастер» рекомендует следующие инструменты:
- vLLM — зрелый фреймворк с поддержкой PagedAttention и DeepSeek R1 из коробки; оптимален для high-throughput сценариев
- SGLang — превосходит vLLM при длинном контексте и structured output; хорошо масштабируется горизонтально
- TensorRT-LLM — максимальная производительность на NVIDIA GPU благодаря FP8-квантизации и CUDA-графам
- DeepSpeed-FastGen — эффективная оптимизация пропускной способности через алгоритм Dynamic SplitFuse
Ориентиры производительности
| Сценарий использования | Конфигурация | Пропускная способность |
|---|---|---|
| Разработка и прототипирование | 1 узел, 8× H100 80 ГБ | 300–600 токенов/с |
| Корпоративный AI-ассистент | 1 узел, 8× H200 141 ГБ | 800–1200 токенов/с |
| Продакшн API (100+ RPS) | 2 узла, 16× H100 80 ГБ | 2000–3500 токенов/с |
| Массовый пакетный инференс | 4 узла, 32× H100 80 ГБ | 5000–8000 токенов/с |
Как приобрести оборудование в «СервакМастер»
- Выберите конфигурацию из каталога или опишите вашу задачу инженеру — подберём оптимальное решение под бюджет и нагрузку
- Получите коммерческое предложение с уточнёнными сроками поставки и стоимостью логистики
- Заключите договор — работаем с юридическими лицами и индивидуальными предпринимателями, оплата в рублях с НДС
- Примите оборудование — доставляем в Москву, Санкт-Петербург и в любой регион России; по запросу выполняем предварительную сборку и тестирование
Для технической консультации и подбора конфигурации под конкретные задачи воспользуйтесь формой обратной связи на сайте или свяжитесь с нами в разделе контактов «СервакМастер».

