Восемь NVIDIA Tesla P100 в 2026 году: подробный тест на GPU-сервере
Зачем это вообще нужно в 2026 году?
Когда речь заходит о построении собственной AI-инфраструктуры, цена вопроса нередко решает всё. Флагманские ускорители последних поколений стоят десятки тысяч долларов за штуку, тогда как Tesla P100 — карта предыдущего десятилетия — доступна на вторичном рынке по ценам, несопоставимым с современными аналогами.
Именно это и подтолкнуло нас к эксперименту: мы в СервакМастер собрали полноценный GPU-сервер из восьми ускорителей NVIDIA Tesla P100 PCIe 16GB и проверили, насколько такая связка пригодна для запуска крупных языковых моделей в условиях реальных нагрузок 2026 года.
Аппаратная конфигурация тестового стенда
Все испытания проводились на следующем оборудовании:
- Материнская плата: Supermicro X10DRG-O+-CPU
- Чипсет: Intel C612
- Форм-фактор: 4U GPU-сервер
- Процессоры: 2 × Intel Xeon E5-2687W v4
- Ядра / потоки: 24 ядра / 48 потоков суммарно
- Базовая / турбо-частота CPU: 3.00 GHz / 3.50 GHz
- Кэш L3: 30 MB на процессор (60 MB суммарно)
- Оперативная память: 128 GB DDR4 ECC
- GPU: 8 × NVIDIA Tesla P100 PCIe 16GB
- Суммарный объём видеопамяти: 128 GB
- Операционная система: Ubuntu 24.04.4 LTS
Топология PCIe: почему именно PLX-коммутаторы?
Восемь ускорителей в данной платформе не подключены к процессорам по прямой схеме «один GPU — один канал x16». Вместо этого применяется двухуровневая топология с PCIe-коммутаторами PLX.
Каждый из двух процессоров обслуживает группу из четырёх GPU; внутри каждой группы карты объединены в пары, подключённые к CPU через общий PLX-коммутатор. Причина такой архитектуры прозаична: количество PCIe-линий у серверных Xeon E5 v4 физически ограничено, и восемь полноценных каналов x16 одновременно они обеспечить не в состоянии.
Что даёт PLX-коммутатор: карты внутри одной пары получают прямой Peer-to-Peer (P2P) канал на скорости PCIe 3.0 x16 (порядка 15,7 ГБ/с). Обмен данными между двумя такими ускорителями происходит без участия системной памяти и без нагрузки на шину процессора.
В чём ограничение: когда обе карты пары одновременно обращаются к RAM или пытаются обменяться данными с GPU другого процессора, полоса пропускания единственного канала к CPU делится между ними пополам.
Важно для LLM-инференса: описанный недостаток практически не влияет на задачи генерации текста. Веса модели загружаются в 128 ГБ суммарной видеопамяти один раз при старте, а в процессе инференса между картами и процессором передаются лишь токены — объём трафика ничтожно мал, и мультиплексированная шина PCIe 3.0 справляется с ним без труда.
Тестирование LLM-движков: что запустилось, а что нет
Мы последовательно проверили четыре популярных фреймворка для LLM-инференса. Все модели тестировались при одинаковой длине контекста — 8192 токена.
llama.cpp
Самый доступный инструмент для работы с несколькими GPU одновременно. llama.cpp автоматически распределяет слои модели между доступными ускорителями, и первый запуск требует минимальных усилий.
Однако у этого движка есть принципиальное ограничение: его архитектура не оптимизирована для масштабирования на большое количество карт. Скорость генерации растёт нелинейно, а загрузка вычислительных ядер каждого P100 в однопользовательском режиме редко превышает 25% — узкое место лежит не в «кремнии», а в программной логике планировщика задач.
При этом распределение видеопамяти работает образцово: все 128 ГБ суммарного VRAM задействуются равномерно по всем восьми ускорителям, что и позволяет запускать модели весовых категорий 70B и 120B.
Результаты тестирования по моделям
| Модель | Квантизация | Скорость (токен/с) | До первого токена | Контекст | Примечания |
|---|---|---|---|---|---|
| Lfm2 24B A2B | Q4_K_M | 69.92 | 0.2 сек. | 8192 | Высокая скорость, но ответы поверхностные |
| Gemma 4 26B A4B | Q4_K_M | 37.82 | 0.9 сек. | 8192 | Корректные ответы средней развёрнутости, ничем не выделяется |
| gpt-oss-20b | MXFP4 | 58.77 | 0.6 сек. | 8192 | Лидер в своей весовой категории: детальные ответы при высокой скорости |
| Qwen3.5 35B A3B | Q4_K_M | 44.55 | 0.6 сек. | 8192 | Вышла 24.02.2026; лучшие развёрнутые ответы, сильные причинно-следственные связи |
| DeepSeek-R1 Distilled 32B | Q4_K_M | 9.97 | 1.2 сек. | 8192 | Минимальная скорость в группе, качество ответов среднее |
| Llama 3.3 70B-Instruct | Q4_K_M | 4.82 | 2.1 сек. | 8192 | Самые развёрнутые и точные ответы — но ценой очень низкой скорости |
| gpt-oss-120b | MXFP4 | 39.14 | 0.3 сек. | 8192 | Наилучшее качество из всех: осмысленные, точные ответы на любом языке |
vLLM
vLLM предъявляет жёсткие требования к версии CUDA и списку официально поддерживаемых GPU — Tesla P100 туда не входит. Запуск потребовал применения патченной сборки версии 0.3.0, скомпилированной под архитектуру Pascal с использованием cu118 и пересобранного xformers.
Даже после всех манипуляций задействовать более одного ускорителя не удалось. Инференс на единственной карте показал неудовлетворительную производительность, и практической ценности сценарий не имеет.
ExLlamaV2
Ситуация аналогична vLLM: одна карта работает корректно, но стабильный многокарточный режим в рамках нашей конфигурации наладить не удалось.
SGLang
У SGLang принципиальное ограничение на уровне архитектуры: ключевые механизмы ускорения — FlashInfer и FlashAttention — требуют наличия тензорных ядер. В Pascal (Tesla P100) тензорных ядер нет; они появились лишь в архитектуре Volta следующего поколения. Запускать SGLang на данном оборудовании лишено практического смысла.
Итог по движкам
Из четырёх протестированных фреймворков только llama.cpp обеспечивает стабильный запуск на всех восьми Tesla P100 с полным использованием суммарного объёма видеопамяти. Остальные движки либо не поддерживают архитектуру Pascal, либо ограничены одной картой.
Выводы и практическая применимость
Сборка GPU-сервера на восьми NVIDIA Tesla P100 — это нетривиальная инженерная задача, требующая понимания как аппаратных особенностей архитектуры Pascal, так и программных ограничений современных ML-фреймворков.
Однако списывать эти ускорители в утиль рано. Вот что показал эксперимент СервакМастер:
- Суммарные 128 ГБ видеопамяти открывают доступ к моделям с числом параметров от 70B до 120B — уровень, недостижимый на одиночном потребительском GPU.
- llama.cpp остаётся единственным стабильным инструментом для Pascal-архитектуры при многокарточном инференсе.
- Скорость генерации находится в диапазоне 5–70 токен/с в зависимости от размера и формата модели — вполне приемлемо для пакетных задач и внутренних сервисов с умеренным числом одновременных запросов.
- PLX-топология PCIe не является узким местом для инференса: загрузка шины токенами минимальна после первоначальной загрузки весов.
Если вы рассматриваете подобную конфигурацию для решения своих AI-задач или ищете GPU-сервер с оптимальным соотношением объёма видеопамяти и стоимости — обратитесь к специалистам СервакМастер: поможем подобрать оборудование под конкретную нагрузку и бюджет.
СервакМастер — серверное оборудование и GPU-решения для AI-инфраструктуры
