Серверы для запуска DeepSeek R1 671B — готовые AI-конфигурации в «СервакМастер»

Оборудование для инференса DeepSeek R1 671B

DeepSeek R1 671B — открытая языковая модель с 671 миллиардом параметров, построенная на архитектуре Mixture of Experts. По качеству рассуждений она конкурирует с ведущими проприетарными решениями, однако требует соответствующей аппаратной базы: достаточного объёма GPU-памяти, быстрых межузловых интерконнектов и надёжного охлаждения. В «СервакМастер» представлены как готовые конфигурации серверов, так и отдельные компоненты для построения инфраструктуры любого масштаба.


Требования модели к аппаратному обеспечению

Архитектура MoE активирует лишь часть экспертных блоков на каждом проходе, но всё множество весов должно оставаться доступным в памяти GPU. Практические требования:

  • 340–380 ГБ GPU-памяти — минимум для хранения весов в FP8/INT8 без деградации точности
  • 700 ГБ и более — при развёртывании в BF16 или FP16
  • Высокоскоростной интерконнект — NVLink, InfiniBand или RoCEv2 для многоузловых конфигураций
  • Быстрая дисковая подсистема — NVMe RAID для загрузки чекпоинтов за приемлемое время

Конфигурации серверов

Одноузловые системы: 8 GPU на один хост

Оптимальный вариант для задач с предсказуемой нагрузкой и ограниченным бюджетом:

  • 8× NVIDIA H100 SXM5 80 ГБ — 640 ГБ HBM3 суммарно; NVLink четвёртого поколения обеспечивает полосу пропускания до 900 ГБ/с между ускорителями; достаточно для инференса в FP8 при батче до 32 запросов
  • 8× NVIDIA H200 SXM 141 ГБ — 1128 ГБ HBM3e; модель полностью помещается в BF16, оставшийся запас памяти позволяет увеличить batch size и длину контекста
  • 8× AMD Instinct MI300X 192 ГБ — 1536 ГБ HBM3; рекордный объём на один ускоритель, особенно выгоден при работе с длинными диалогами и крупными батчами

Платформы, которые мы рекомендуем для таких конфигураций: Supermicro SYS-821GE-TNHR, ASUS ESC N8-E11, Dell PowerEdge XE9680.

Многоузловые кластеры: 16–32 GPU и более

При необходимости обслуживать десятки и сотни одновременных запросов разумно распределить нагрузку по нескольким узлам:

  • 2 узла × 8× H100 80 ГБ — 1280 ГБ суммарной GPU-памяти; тензорный параллелизм через InfiniBand HDR 200 Гбит/с
  • 4 узла × 8× H100 80 ГБ — 2560 ГБ; конвейерный и тензорный параллелизм; пропускная способность от 5000 токенов/с при batch 128
  • Сетевая коммутация: Mellanox Quantum-2 QM9700 или NVIDIA Spectrum-4 — оба варианта обеспечивают задержку менее микросекунды между узлами

Ключевые компоненты серверной платформы

Процессоры

  • AMD EPYC 9654 (Genoa) — 96 ядер, TDP 360 Вт; связка с GPU через PCIe 5.0 x16 обеспечивает высокую пропускную способность хост–ускоритель
  • Intel Xeon Platinum 8490H (Sapphire Rapids) — 60 ядер, опциональная поддержка HBM-памяти на плате; хороший выбор для гибридных CPU+GPU пайплайнов

Оперативная память

  • Минимум 512 ГБ DDR5-4800 ECC на узел — для токенизатора, системных служб и оркестратора
  • 1–2 ТБ DDR5 — рекомендуется при одновременном запуске нескольких моделей или тяжёлых preprocessing-конвейеров

Хранилище

  • 4–8× NVMe U.2 PCIe 5.0 ёмкостью 7,68 ТБ в striped-конфигурации — последовательное чтение свыше 28 ГБ/с; полный чекпоинт DeepSeek R1 671B загружается за 30–60 секунд
  • CXL-накопители — альтернатива для расширения пула адресуемой памяти без дополнительных GPU

Сетевые адаптеры

  • NVIDIA ConnectX-7 NDR 400G InfiniBand — для кластерных инсталляций; задержка менее 600 нс
  • ConnectX-7 200GbE RoCEv2 — более доступная альтернатива для однородных Ethernet-инфраструктур

Питание и охлаждение

  • Резервированные блоки питания мощностью 3000–3600 Вт на каждый узел
  • Жидкостное прямое охлаждение (DLC) снижает тепловую нагрузку на машинный зал и позволяет работать с GPU при суммарном TDP 700 Вт и выше без перегрева

Программный стек для высоконагруженного инференса

Аппаратная часть — только основа. Для эффективного запуска DeepSeek R1 671B «СервакМастер» рекомендует следующие инструменты:

  • vLLM — зрелый фреймворк с поддержкой PagedAttention и DeepSeek R1 из коробки; оптимален для high-throughput сценариев
  • SGLang — превосходит vLLM при длинном контексте и structured output; хорошо масштабируется горизонтально
  • TensorRT-LLM — максимальная производительность на NVIDIA GPU благодаря FP8-квантизации и CUDA-графам
  • DeepSpeed-FastGen — эффективная оптимизация пропускной способности через алгоритм Dynamic SplitFuse

Ориентиры производительности

Сценарий использования Конфигурация Пропускная способность
Разработка и прототипирование 1 узел, 8× H100 80 ГБ 300–600 токенов/с
Корпоративный AI-ассистент 1 узел, 8× H200 141 ГБ 800–1200 токенов/с
Продакшн API (100+ RPS) 2 узла, 16× H100 80 ГБ 2000–3500 токенов/с
Массовый пакетный инференс 4 узла, 32× H100 80 ГБ 5000–8000 токенов/с

Как приобрести оборудование в «СервакМастер»

  1. Выберите конфигурацию из каталога или опишите вашу задачу инженеру — подберём оптимальное решение под бюджет и нагрузку
  2. Получите коммерческое предложение с уточнёнными сроками поставки и стоимостью логистики
  3. Заключите договор — работаем с юридическими лицами и индивидуальными предпринимателями, оплата в рублях с НДС
  4. Примите оборудование — доставляем в Москву, Санкт-Петербург и в любой регион России; по запросу выполняем предварительную сборку и тестирование

Для технической консультации и подбора конфигурации под конкретные задачи воспользуйтесь формой обратной связи на сайте или свяжитесь с нами в разделе контактов «СервакМастер».

13 935 600 руб.
Под заказ
Задать вопрос
Гарантия с заменой компонентов
Доставка СДЭК и ведущими службами доставки
Помощь в подборе конфигурации
Характеристики
ПроцессорAMD EPYC
ВидеокартаNVIDIA
СостояниеНовое

Есть вопросы?

Поможем выбрать, проконсультируем по всем услугам, расскажем о средствах решения ваших задач
Заказать консультацию