Серверы для инференса DeepSeek V4: GPU-конфигурации под MoE 670B — СервакМастер

Инференс DeepSeek V4: что это за модель и зачем нужно специализированное железо

DeepSeek V4 — большая языковая модель с открытым исходным кодом нового поколения, построенная по архитектуре MoE (Mixture of Experts). Суммарное число параметров модели превышает 670 миллиардов, однако при обработке каждого запроса задействуется лишь около 37 миллиардов активных параметров. Это принципиальное отличие от dense-моделей: вычислительная нагрузка при инференсе оказывается заметно ниже, что делает DeepSeek V4 привлекательным выбором для организаций с ограниченным бюджетом на GPU-инфраструктуру.

При этом говорить об «экономичности» в абсолютном смысле не приходится. Загрузка весов модели в формате FP8 требует от 700 до 800 ГБ видеопамяти при полном размещении в VRAM. Поддержка контекстного окна до 128 000 токенов создаёт дополнительную нагрузку на KV-кэш. Для стабильного production-инференса без ухудшения качества ответов необходимо профессиональное серверное оборудование с правильно подобранной конфигурацией GPU, CPU, ОЗУ и сетевой подсистемы.

В каталоге «СервакМастер» представлены серверы и AI-системы, протестированные специалистами под задачи инференса крупных языковых моделей. Мы работаем с оборудованием NVIDIA, Supermicro, Dell, ASUS и других ведущих производителей.


Ключевые требования к железу для DeepSeek V4

Прежде чем выбирать конфигурацию, важно понять, какие характеристики оборудования наиболее критичны для стабильной работы модели.

  • Объём GPU-памяти. Минимальный порог при применении квантизации INT4 — порядка 200–250 ГБ VRAM. Для работы в FP8 без существенной потери качества нужно 700+ ГБ суммарной VRAM. Именно поэтому для полного инференса без квантизации используются конфигурации на 8 × NVIDIA H100 80 ГБ SXM5 или аналоги.
  • Межузловая связь. При распределении модели между несколькими GPU критически важна пропускная способность интерконнекта. Оптимальны NVLink 4.0 внутри ноды и InfiniBand HDR (200 Гбит/с) или NDR (400 Гбит/с) между нодами кластера.
  • Процессорная мощность. Серверные процессоры AMD EPYC 9654 (96 ядер, базовая частота 2,4 ГГц) или EPYC 9354 (32 ядра, 3,25 ГГц) обеспечивают нужную пропускную способность для предобработки запросов, управления батчами и системной оркестрации. Альтернатива — Intel Xeon Scalable поколений Sapphire Rapids и Emerald Rapids.
  • Оперативная память. Минимум 512 ГБ DDR5-4800 ECC для конфигураций с квантизацией, 1,5–2 ТБ для полного инференса на крупных кластерах.
  • NVMe-хранилище. Для работы с длинными контекстами и кэширования KV-состояний рекомендуются накопители PCIe 4.0/5.0 суммарной ёмкостью от 15 ТБ на ноду.

Конфигурации серверов под разные задачи

Базовая сборка — инференс с квантизацией INT4/INT8

Оптимальна для исследовательских стендов, пилотных проектов и задач с умеренной нагрузкой:

  • GPU: 4 × NVIDIA A100 80 ГБ SXM или 4 × NVIDIA H100 80 ГБ SXM
  • CPU: 2 × AMD EPYC 9354 (32 ядра, 3,25 ГГц базовая)
  • ОЗУ: 512 ГБ DDR5-4800 ECC RDIMM
  • Хранилище: 2 × 7,68 ТБ NVMe PCIe 4.0
  • Сеть: 2 × 100G InfiniBand HDR100 + 2 × 25GbE
  • Платформа: Supermicro SYS-420GP-TNR или аналог

Рабочая конфигурация — полный инференс FP8/BF16

Для продуктивной среды с умеренным потоком запросов:

  • GPU: 8 × NVIDIA H100 80 ГБ SXM5 с NVLink 4.0
  • CPU: 2 × AMD EPYC 9654 (96 ядер, 2,4 ГГц базовая)
  • ОЗУ: 1,5 ТБ DDR5-4800 ECC RDIMM
  • Хранилище: 4 × 7,68 ТБ NVMe PCIe 5.0 в конфигурации RAID 0/10
  • Сеть: 2 × 200G InfiniBand HDR + управляющий 10GbE
  • Платформа: Dell PowerEdge XE9680 или Supermicro SYS-821GE-TNHR

Кластерное решение — enterprise-деплой под высокую нагрузку

Для параллельного обслуживания тысяч запросов в секунду с полным качеством модели:

  • GPU-ноды: 4–8 серверов по 8 × NVIDIA H100 или H200 80 ГБ SXM5
  • CPU: AMD EPYC 9754 (128 ядер) или Intel Xeon w9-3595X
  • ОЗУ на узел: 2 ТБ DDR5-5600
  • Межузловой коммутатор: NVIDIA Quantum-2 InfiniBand NDR (400 Гбит/с)
  • Хранилище: распределённая NVMe-сеть на базе NVMe-oF, суммарная ёмкость от 100 ТБ
  • Шасси: 42U стойки с резервированием питания (2N) и жидкостным/гибридным охлаждением

Программный стек для запуска DeepSeek V4

Аппаратная конфигурация — лишь половина успеха. Выбор фреймворка инференса напрямую влияет на производительность и латентность.

  • vLLM — де-факто стандарт для production-инференса LLM с открытым кодом. Поддерживает PagedAttention, continuous batching, tensor и pipeline parallelism. Хорошо работает с DeepSeek V4 на H100/A100.
  • SGLang — фреймворк с оптимизациями под MoE-архитектуры, разработанный при участии команды DeepSeek. Обеспечивает высокую пропускную способность при работе с длинными контекстами на GPU серии Hopper.
  • TensorRT-LLM — решение NVIDIA для максимальной скорости инференса на GPU Ampere и Hopper. Требует компиляции движка, но даёт наилучшую производительность на однородных кластерах.
  • llama.cpp — подходит для тестовых стендов и сценариев с агрессивной квантизацией GGUF. Позволяет запускать DeepSeek V4 на CPU+GPU при ограниченных ресурсах VRAM.
  • Triton Inference Server — масштабируемый serving-слой с поддержкой динамического батчинга, мониторинга через Prometheus и интеграции с Kubernetes.

Специалисты «СервакМастер» проконсультируют по выбору оптимального программного стека под конкретные требования к пропускной способности и латентности.


Почему DeepSeek V4 выгодна для российского рынка

  • Открытая лицензия MIT — свободное использование в коммерческих продуктах без роялти и ограничений на размещение весов на собственных серверах.
  • Эффективная MoE-архитектура — при 37 активных миллиардах параметров модель конкурирует по качеству с dense-аналогами на 70–100 млрд параметров, что снижает требования к GPU-ресурсам.
  • Контекст до 128 000 токенов — достаточно для обработки многостраничных документов, длинных диалогов, кодовых репозиториев и юридических текстов целиком.
  • Поддержка русского языка — модель демонстрирует высокое качество на русскоязычных задачах, что делает её практичным выбором для отечественных компаний.
  • Активное сообщество — регулярные обновления весов, новые квантизованные версии и оптимизации фреймворков появляются быстрее, чем у закрытых аналогов.

Условия поставки и сервис

«СервакМастер» доставляет серверное оборудование по всей России. В Москве и Санкт-Петербурге доступна курьерская доставка с подъёмом и самовывоз со склада. В регионы оборудование отправляется транспортными компаниями с профессиональной упаковкой и страхованием груза на всём маршруте.

Каждый сервер перед отгрузкой проходит предпродажное тестирование (burn-in test) и поставляется с официальной гарантией производителя. Для корпоративных заказчиков доступны расширенные сервисные контракты NBD (Next Business Day) с выездом инженера на объект, а также услуги по инсталляции, настройке сетевой среды и первичному развёртыванию программного стека.

Для уточнения конфигурации, сроков поставки и коммерческих условий — воспользуйтесь формой обратной связи на сайте или свяжитесь с нами через раздел «Контакты».

56 675 400 руб.
Под заказ
Задать вопрос
Гарантия с заменой компонентов
Доставка СДЭК и ведущими службами доставки
Помощь в подборе конфигурации
Характеристики
ПроцессорAMD EPYC
ВидеокартаNVIDIA
СостояниеНовое

Есть вопросы?

Поможем выбрать, проконсультируем по всем услугам, расскажем о средствах решения ваших задач
Заказать консультацию