Ускорители на архитектуре Pascal давно списывают со счетов, но для локального запуска языковых моделей они до сих пор остаются самым дешёвым входом в мир GPU-инференса. Недавно мы проверяли Tesla P40, а теперь дошла очередь до её «старшей сестры» NVIDIA Tesla P100. Выясняем, чем карты отличаются, насколько P100 быстрее и стоит ли брать её под современные LLM.

Две карты одного поколения, две разные задачи

Tesla P100 и Tesla P40 вышли в одно время и построены на одной архитектуре Pascal, однако NVIDIA позиционировала их по-разному. P40 задумывалась исключительно как инструмент инференса нейросетей. P100 же стала флагманской «суперкомпьютерной» моделью поколения: её можно было использовать и для обучения, и для инференса, и для работы с низкоразрядными форматами. В неё заложили практически весь набор технологий, который у компании был на тот момент.

FP16 и память HBM2

Главное отличие в вычислениях — полноценная поддержка FP16. У P40 она урезана, а у P100 производительность в этом формате достигает 21.2 TFLOPS. Это вдвое больше, чем в FP32, и в 115 раз быстрее, чем у младшей карты в том же FP16.

Второй козырь — видеопамять HBM2 с шиной 4096 бит и пропускной способностью 732 ГБ/с. Именно в P100 NVIDIA применила HBM2 впервые. Для инференса это критично: чем быстрее GPU подтягивает веса модели, тем выше скорость генерации токенов. Поэтому даже при скромной вычислительной мощности P100 должна показывать приемлемые результаты.

Платить за это приходится объёмом. Стеки HBM2 размещаются по периметру кристалла, их число ограничено его габаритами, поэтому у P100 всего 16 ГБ памяти против 24 ГБ у P40. Любопытно, что и ядер у P40 больше: 3840 CUDA-ядер против 3584 у P100.

Параметр Tesla P100 Tesla P40
Архитектура Pascal Pascal
Видеопамять 16 ГБ HBM2 24 ГБ
Шина памяти 4096 бит —
Пропускная способность 732 ГБ/с —
CUDA-ядра 3584 3840
Производительность в FP16 21.2 TFLOPS урезана

Установка и драйверы

P100 занимает два слота, длина платы без турбинного кожуха — 267 мм. Для питания нужен 8-контактный разъём формата EPS. Блок питания должен быть не слабее 650 Вт, а если изображение выводится на отдельную видеокарту, то от 800 Вт.

После установки мы поставили свежие драйверы и убедились, что система карту распознала. Стоит учесть сроки: по плану жизненного цикла NVIDIA для архитектуры Pascal выпуск обновлений прекратится в июле 2026 года. Но пока обновления выходят, а значит, карта сохраняет полноценную программную поддержку производителя. Благодаря свежим драйверам LM Studio работала без проблем, и все тесты прошли штатно.

Результаты тестов в LM Studio

Список моделей в основном повторяет тот, что использовался для P40, чтобы сравнение было наглядным. Для разнообразия добавили несколько новых позиций, например gpt-oss от OpenAI на 20 млрд параметров. Все модели запускались в одинаковых условиях с контекстом 4096 токенов. Скорость измеряется в токенах в секунду, а «до первого токена» — это задержка от отправки запроса до начала ответа.

№ Модель Квантизация Скорость До первого токена Комментарий
1 deepseek-r1-0528-qwen3-8b Q4_K_M 36.45 т/сек 1.50 сек Короткие, но верные ответы
2 Meta-Llama-3.1-8B-Instruct* Q4_K_M 38.34 т/сек 1.50 сек Немногословна, но отвечает верно
3 OpenAI's gpt-oss 20B Q4_K_M 63.02 т/сек (лучшая) 0.17 сек (рекорд) Лучшая модель теста: самые подробные и быстрые ответы
4 DeepSeek-R1-Distill-Llama-8B* Q4_K_S 40.35 т/сек 0.25 сек Путается в языках: в одном предложении может трижды переключиться с русского на английский, затем на китайский и обратно
5 Llama-2-7B-Chat* Q4_K_S 46.23 т/сек (быстро) 0.22 сек Хорошо ведёт диалог, ответы правильные
6 Mistral-7B-Instruct-v0.3 Q5_K_M 38.95 т/сек 0.20 сек Самая среднестатистическая, ничем не выделяется
7 Llama-3.2-8X3B-MOE-Instruct-18.4B* Q5_K_M 22.63 т/сек 2.18 сек Отвечает стремительно, но изредка ошибается
8 Qwen3-4B-Thinking-2507 Q6_K 44.90 т/сек (быстро) 0.15 сек Качественно рассуждает, ответы исчерпывающие
9 gemma-3n-E4B-it-text Q6_K 32.06 т/сек 0.17 сек Иногда запинается и коверкает предложения
10 Meta-Llama-3-8B-Instruct-bf16* Q6_K 28.86 т/сек 0.19 сек Отвечает неправильно, часто не по теме
11 Meta-Llama-3-8B-Instruct-bf16* Q8_0 36.57 т/сек 1.47 сек Отвечает разумнее, но чуть медленнее варианта на Q6_K
12 Qwen3-4B-Thinking-2507 Q8_0 56.63 т/сек (быстро) 0.17 сек Одна из самых разумных и шустрых моделей
13 LLaMA-7b-AWQ* AWQ 35.56 т/сек 0.21 сек Очень короткий, малосодержательный ответ
14 Qwen3-4B-Instruct-2507-F16 BF16 45.34 т/сек (быстро) 0.15 сек Очень качественные ответы, но крупная модель работает медленнее
15 Meta-Llama-3-8B-Instruct-bf16* BF16 4.91 т/сек (медленно) 2.19 сек Ответы качественные, но работает очень неповоротливо

Что показывают цифры

Для своего возраста P100 демонстрирует достойную производительность: её показатели примерно на треть выше, чем у протестированной ранее P40. Абсолютный лидер — gpt-oss 20B, которая выдала 63.02 т/сек при рекордной задержке 0.17 сек и полностью раскрыла потенциал карты. Следом идут Qwen3-4B-Thinking-2507 на Q8_0 (56.63 т/сек) и Qwen3-4B-Instruct-2507-F16 (45.34 т/сек). Заметно проседает только Meta-Llama-3-8B-Instruct в формате BF16: 4.91 т/сек при задержке 2.19 сек.

Время до первого токена у P100 кратно меньше, чем у P40. Причина в более высокой пропускной способности памяти и лучшей оптимизации под параллельные вычисления.

Слабое место — длина контекста

Здесь младшая карта выигрывает за счёт объёма памяти. P40 сдавалась на 90 тысячах токенов, а плохо ей становилось уже на 70. P100 начинает «заикаться» на 30 тысячах, а больше 50 тысяч физически не переваривает. Если не выкручивать контекст до предела, P100 даёт ощутимый выигрыш в скорости при умеренных температурах.

Нагрев и охлаждение

P100 создавалась для серверных стоек, поэтому штатный пассивный радиатор в обычном корпусе не справится: нужно активное охлаждение. В нашем случае к пассивной системе добавили турбинный вентилятор мощностью 3,24 Вт, и даже такого простого решения хватило для умеренного тепловыделения карты.

Режим GPU Hot Spot Частота GPU Частота памяти Питание
Простой около 41 °C около 61 °C 1050 МГц 715,5 МГц около 34,4 Вт на плате
Средняя нагрузка 60,3 °C 80,3 °C 1212,7 МГц 715,5 МГц 50,1 Вт GPU, 90,5 Вт вся плата
Полная нагрузка 80,2 °C 100,2 °C 1328,5 МГц 715,5 МГц 122,9 Вт GPU, 210,4 Вт вся плата

Hot Spot при пиковой нагрузке переваливает за сотню градусов, но в остальных режимах температуры вполне приличные. Даже непритязательное охлаждение удерживает ускоритель в приемлемых рамках.

Итоги: кому подойдёт Tesla P100

P100 — разумный компромисс между ценой и производительностью для тех, кто экспериментирует с локальными LLM. HBM2 даёт ей заметное преимущество над старыми картами с обычной GDDR5. Платой за это служат два ограничения: 16 ГБ памяти и приближающийся конец поддержки драйверов в 2026 году. Если вам не нужна долгосрочная гарантия совместимости, карта станет хорошим вложением в эксперименты. Она остаётся актуальным ускорителем, которым можно пользоваться и сегодня, пусть и с оговорками.

Практические советы по выбору железа

  • Для моделей уровня 4–8 млрд параметров в квантизации Q4–Q8 и для gpt-oss 20B 16 ГБ достаточно; длинные контексты (свыше 30 тысяч токенов) лучше планировать на картах с большим объёмом памяти.
  • Рассчитывайте не только карту, но и питание (650–800 Вт) и активное охлаждение: в серверном корпусе с продувом это решается проще, чем в обычном ПК.
  • Если эксперименты перерастают в постоянную работу, имеет смысл закладывать запас по объёму видеопамяти и срокам поддержки драйверов.

Подобрать платформу под ваши модели и нагрузку поможем в «СервакМастер»: смотрите готовые решения в разделах серверы и AI-серверы или свяжитесь с нами, и мы предложим конфигурацию под ваши задачи.

*LLAMA — проект Meta Platforms Inc.**, деятельность которой в России признана экстремистской и запрещена.

**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена.