Восемь NVIDIA Tesla P100 в 2026 году: подробный тест на GPU-сервере


Зачем это вообще нужно в 2026 году?

Когда речь заходит о построении собственной AI-инфраструктуры, цена вопроса нередко решает всё. Флагманские ускорители последних поколений стоят десятки тысяч долларов за штуку, тогда как Tesla P100 — карта предыдущего десятилетия — доступна на вторичном рынке по ценам, несопоставимым с современными аналогами.

Именно это и подтолкнуло нас к эксперименту: мы в СервакМастер собрали полноценный GPU-сервер из восьми ускорителей NVIDIA Tesla P100 PCIe 16GB и проверили, насколько такая связка пригодна для запуска крупных языковых моделей в условиях реальных нагрузок 2026 года.


Аппаратная конфигурация тестового стенда

Все испытания проводились на следующем оборудовании:

  • Материнская плата: Supermicro X10DRG-O+-CPU
  • Чипсет: Intel C612
  • Форм-фактор: 4U GPU-сервер
  • Процессоры: 2 × Intel Xeon E5-2687W v4
  • Ядра / потоки: 24 ядра / 48 потоков суммарно
  • Базовая / турбо-частота CPU: 3.00 GHz / 3.50 GHz
  • Кэш L3: 30 MB на процессор (60 MB суммарно)
  • Оперативная память: 128 GB DDR4 ECC
  • GPU: 8 × NVIDIA Tesla P100 PCIe 16GB
  • Суммарный объём видеопамяти: 128 GB
  • Операционная система: Ubuntu 24.04.4 LTS

Топология PCIe: почему именно PLX-коммутаторы?

Восемь ускорителей в данной платформе не подключены к процессорам по прямой схеме «один GPU — один канал x16». Вместо этого применяется двухуровневая топология с PCIe-коммутаторами PLX.

Каждый из двух процессоров обслуживает группу из четырёх GPU; внутри каждой группы карты объединены в пары, подключённые к CPU через общий PLX-коммутатор. Причина такой архитектуры прозаична: количество PCIe-линий у серверных Xeon E5 v4 физически ограничено, и восемь полноценных каналов x16 одновременно они обеспечить не в состоянии.

Что даёт PLX-коммутатор: карты внутри одной пары получают прямой Peer-to-Peer (P2P) канал на скорости PCIe 3.0 x16 (порядка 15,7 ГБ/с). Обмен данными между двумя такими ускорителями происходит без участия системной памяти и без нагрузки на шину процессора.

В чём ограничение: когда обе карты пары одновременно обращаются к RAM или пытаются обменяться данными с GPU другого процессора, полоса пропускания единственного канала к CPU делится между ними пополам.

Важно для LLM-инференса: описанный недостаток практически не влияет на задачи генерации текста. Веса модели загружаются в 128 ГБ суммарной видеопамяти один раз при старте, а в процессе инференса между картами и процессором передаются лишь токены — объём трафика ничтожно мал, и мультиплексированная шина PCIe 3.0 справляется с ним без труда.


Тестирование LLM-движков: что запустилось, а что нет

Мы последовательно проверили четыре популярных фреймворка для LLM-инференса. Все модели тестировались при одинаковой длине контекста — 8192 токена.

llama.cpp

Самый доступный инструмент для работы с несколькими GPU одновременно. llama.cpp автоматически распределяет слои модели между доступными ускорителями, и первый запуск требует минимальных усилий.

Однако у этого движка есть принципиальное ограничение: его архитектура не оптимизирована для масштабирования на большое количество карт. Скорость генерации растёт нелинейно, а загрузка вычислительных ядер каждого P100 в однопользовательском режиме редко превышает 25% — узкое место лежит не в «кремнии», а в программной логике планировщика задач.

При этом распределение видеопамяти работает образцово: все 128 ГБ суммарного VRAM задействуются равномерно по всем восьми ускорителям, что и позволяет запускать модели весовых категорий 70B и 120B.

Результаты тестирования по моделям

Модель Квантизация Скорость (токен/с) До первого токена Контекст Примечания
Lfm2 24B A2B Q4_K_M 69.92 0.2 сек. 8192 Высокая скорость, но ответы поверхностные
Gemma 4 26B A4B Q4_K_M 37.82 0.9 сек. 8192 Корректные ответы средней развёрнутости, ничем не выделяется
gpt-oss-20b MXFP4 58.77 0.6 сек. 8192 Лидер в своей весовой категории: детальные ответы при высокой скорости
Qwen3.5 35B A3B Q4_K_M 44.55 0.6 сек. 8192 Вышла 24.02.2026; лучшие развёрнутые ответы, сильные причинно-следственные связи
DeepSeek-R1 Distilled 32B Q4_K_M 9.97 1.2 сек. 8192 Минимальная скорость в группе, качество ответов среднее
Llama 3.3 70B-Instruct Q4_K_M 4.82 2.1 сек. 8192 Самые развёрнутые и точные ответы — но ценой очень низкой скорости
gpt-oss-120b MXFP4 39.14 0.3 сек. 8192 Наилучшее качество из всех: осмысленные, точные ответы на любом языке

vLLM

vLLM предъявляет жёсткие требования к версии CUDA и списку официально поддерживаемых GPU — Tesla P100 туда не входит. Запуск потребовал применения патченной сборки версии 0.3.0, скомпилированной под архитектуру Pascal с использованием cu118 и пересобранного xformers.

Даже после всех манипуляций задействовать более одного ускорителя не удалось. Инференс на единственной карте показал неудовлетворительную производительность, и практической ценности сценарий не имеет.

ExLlamaV2

Ситуация аналогична vLLM: одна карта работает корректно, но стабильный многокарточный режим в рамках нашей конфигурации наладить не удалось.

SGLang

У SGLang принципиальное ограничение на уровне архитектуры: ключевые механизмы ускорения — FlashInfer и FlashAttention — требуют наличия тензорных ядер. В Pascal (Tesla P100) тензорных ядер нет; они появились лишь в архитектуре Volta следующего поколения. Запускать SGLang на данном оборудовании лишено практического смысла.

Итог по движкам

Из четырёх протестированных фреймворков только llama.cpp обеспечивает стабильный запуск на всех восьми Tesla P100 с полным использованием суммарного объёма видеопамяти. Остальные движки либо не поддерживают архитектуру Pascal, либо ограничены одной картой.


Выводы и практическая применимость

Сборка GPU-сервера на восьми NVIDIA Tesla P100 — это нетривиальная инженерная задача, требующая понимания как аппаратных особенностей архитектуры Pascal, так и программных ограничений современных ML-фреймворков.

Однако списывать эти ускорители в утиль рано. Вот что показал эксперимент СервакМастер:

  • Суммарные 128 ГБ видеопамяти открывают доступ к моделям с числом параметров от 70B до 120B — уровень, недостижимый на одиночном потребительском GPU.
  • llama.cpp остаётся единственным стабильным инструментом для Pascal-архитектуры при многокарточном инференсе.
  • Скорость генерации находится в диапазоне 5–70 токен/с в зависимости от размера и формата модели — вполне приемлемо для пакетных задач и внутренних сервисов с умеренным числом одновременных запросов.
  • PLX-топология PCIe не является узким местом для инференса: загрузка шины токенами минимальна после первоначальной загрузки весов.

Если вы рассматриваете подобную конфигурацию для решения своих AI-задач или ищете GPU-сервер с оптимальным соотношением объёма видеопамяти и стоимости — обратитесь к специалистам СервакМастер: поможем подобрать оборудование под конкретную нагрузку и бюджет.


СервакМастер — серверное оборудование и GPU-решения для AI-инфраструктуры