Сервер под инференс Mistral 3: конфигурации с NVIDIA H100 и A100 — «СервакМастер»

Серверы для инференса Mistral 3: подбор оборудования в «СервакМастер»

Mistral 3 — зрелая открытая языковая модель с десятками миллиардов параметров, которая уверенно справляется с генерацией текста, написанием кода и многоэтапным анализом данных. В отличие от закрытых API, self-hosted-развёртывание даёт полный контроль над данными и затратами. Однако локальный запуск модели такого масштаба предъявляет жёсткие требования к серверному железу: объём VRAM, пропускная способность памяти и межузловая связь напрямую определяют latency и throughput. «СервакМастер» предлагает готовые серверные конфигурации и сборки под заказ, оптимизированные именно под задачи инференса Mistral 3.


Почему Mistral 3 требует специализированного серверного оборудования

При инференсе весовые матрицы модели циклически загружаются в вычислительные ядра GPU на каждом токене. Для Mistral 3 в полной точности FP16 это порождает несколько ключевых ограничений:

  • Объём VRAM. Для хранения весов модели, KV-кэша и промежуточных активаций потребуется не менее 80 ГБ видеопамяти — один H100 SXM 80 GB или пара A100 80 GB.
  • Пропускная способность памяти GPU. HBM3-память H100 обеспечивает до 3,35 ТБ/с — именно этот показатель, а не количество CUDA-ядер, определяет скорость генерации токенов.
  • Межсоединения GPU. При использовании нескольких ускорителей необходим NVLink или NVLink Switch: PCIe существенно снижает эффективность тензорного параллелизма.
  • Системная память и CPU. Токенизация, препроцессинг батчей и обслуживание API-запросов ложатся на хост. Для нагруженного сервиса рекомендуется от 512 ГБ DDR5 ECC и процессор с числом ядер не менее 32.

Недооценка хотя бы одного из этих параметров оборачивается неприемлемой задержкой первого токена и деградацией сервиса под нагрузкой.


Рекомендуемые конфигурации серверов

Начальный уровень — одиночный GPU-узел

Подходит для внутренних инструментов, R&D и стартовой нагрузки (до нескольких десятков параллельных запросов):

  • Платформа: Supermicro SYS-420GP-TNR или ASUS ESC8000A-E12
  • Процессор: AMD EPYC 9354 (32 ядра, 3,25 ГГц) или Intel Xeon Gold 6438N
  • GPU: 1–2 × NVIDIA H100 SXM 80 GB (или 2 × A100 80 GB в бюджетном варианте)
  • ОЗУ: 512 ГБ DDR5 ECC (16 × 32 ГБ)
  • Хранилище: 2 × NVMe SSD 3,84 ТБ (RAID 1) под ОС и веса модели
  • Сеть: 2 × 25 GbE + опциональный InfiniBand HDR

Одиночный H100 SXM 80 GB покрывает требования по VRAM для инференса Mistral 3 в FP16 без квантизации. Второй ускоритель добавляется при необходимости масштабирования throughput.

Средний уровень — двухсокетный сервер с 4 GPU

Оптимальная платформа для коммерческого API-сервиса с требованиями к SLA:

  • Платформа: Dell PowerEdge XE9640 или Supermicro SYS-821GE-TNHR
  • Процессор: 2 × AMD EPYC 9554 (64 ядра, 3,1 ГГц каждый)
  • GPU: 4 × NVIDIA H100 NVL 94 GB, объединены через NVLink Switch
  • ОЗУ: 1 ТБ DDR5 ECC (32 × 32 ГБ)
  • Хранилище: 4 × NVMe U.2 7,68 ТБ, RAID 10
  • Сеть: 2 × 100 GbE + InfiniBand NDR 400 Гбит/с

Четыре H100 NVL 94 GB суммируют 376 ГБ VRAM, что позволяет удерживать крупный KV-кэш и работать с batch size 32–64 без значимых компромиссов по точности.

Профессиональный уровень — 8-GPU кластерный узел

Для высоконагруженных production-систем и крупных корпоративных AI-платформ:

  • Платформа: Supermicro ARS-110M-NR (8-GPU 1U HGX H100)
  • Процессор: 2 × Intel Xeon Platinum 8480+ (60 ядер, 2,0 ГГц каждый)
  • GPU: 8 × NVIDIA H100 SXM5 80 GB (NVLink 3.0, суммарная пропускная способность 900 ГБ/с)
  • ОЗУ: 2 ТБ DDR5 4800 ECC
  • Хранилище: 8 × NVMe U.2 15,36 ТБ
  • Сеть: 4 × 400 GbE + InfiniBand NDR 800 Гбит/с

На данной платформе Mistral 3 поддерживает batch size 64 и выше при задержке первого токена менее 200 мс на типичных промптах. Архитектура HGX позволяет масштабироваться горизонтально — несколько узлов объединяются по InfiniBand в кластер без существенных изменений программного стека.


Программный стек для развёртывания Mistral 3

Оборудование раскрывает потенциал только в связке с правильным движком инференса. «СервакМастер» рекомендует проверенные решения:

  • vLLM — де-факто стандарт для production-инференса; реализует PagedAttention, тензорный и пайплайн-параллелизм, поддерживает Mistral-архитектуру из коробки.
  • TGI (Text Generation Inference) от Hugging Face — простое развёртывание через Docker, встроенный OpenAI-совместимый API, хорошо подходит для быстрого старта.
  • Ollama — удобен для on-premise-инсталляций на одной машине; подходит для внутренних инструментов и прототипирования.
  • NVIDIA Triton Inference Server — enterprise-класс; поддерживает динамическое батчирование, A/B-тестирование моделей и интеграцию с Kubernetes.

Если VRAM критична, квантизация GGUF (4-bit или 8-bit через llama.cpp) снижает требования к памяти вдвое, сохраняя приемлемое качество генерации на большинстве задач. Наши инженеры помогут подобрать баланс между точностью, скоростью и стоимостью оборудования.


Преимущества «СервакМастер» при покупке серверов под Mistral 3

  • Инженерная консультация перед покупкой. Расчёт конфигурации исходя из ожидаемого RPS, длины контекста и бюджета — бесплатно.
  • Готовность «из коробки». Серверы поставляются протестированными, с установленными драйверами CUDA, NCCL и базовой конфигурацией ОС.
  • Гибкие условия. Поэтапная поставка, лизинговые схемы, конфигурирование под индивидуальные требования.
  • Официальная гарантия и сервис. Гарантия производителя на всё оборудование плюс расширенный сервисный контракт от «СервакМастер».
  • Доставка по России. Безвозмездная доставка по Москве и Санкт-Петербургу, отправка транспортными компаниями в любой регион страны.

Часто задаваемые вопросы

Какой минимальный GPU-конфигурации достаточно для Mistral 3? Для стабильного инференса в FP16 без квантизации необходим один NVIDIA H100 SXM 80 GB или два A100 80 GB. При использовании 4-bit GGUF допустим одиночный A100 40 GB, однако latency и качество генерации заметно снизятся.

Можно ли строить кластер из потребительских GPU, например RTX 4090? Технически возможно с квантизацией и llama.cpp, но RTX-карты лишены ECC-памяти, поддержки NVLink и имеют ограниченную пропускную способность PCIe. Для коммерческой эксплуатации такое решение нежелательно из-за рисков ошибок вычислений и сложности масштабирования.

Как рассчитать количество GPU под конкретную нагрузку? Ключевые параметры — целевой RPS, средняя длина ввода/вывода и допустимая задержка первого токена. Свяжитесь с нами через форму обратной связи на сайте «СервакМастер» — инженер сделает расчёт и подберёт оптимальную конфигурацию.


Серверы для инференса Mistral 3 доступны в наличии и под заказ. «СервакМастер» — надёжный партнёр для построения AI-инфраструктуры любого масштаба.

13 935 600 руб.
Под заказ
Задать вопрос
Гарантия с заменой компонентов
Доставка СДЭК и ведущими службами доставки
Помощь в подборе конфигурации
Характеристики
БрендNVIDIA
ПроцессорAMD EPYC
ВидеокартаNVIDIA RTX
Форм-фактор1U
СостояниеНовое

Есть вопросы?

Поможем выбрать, проконсультируем по всем услугам, расскажем о средствах решения ваших задач
Заказать консультацию