Зачем вообще обсуждать карту 2017 года

Tesla V100 вышла почти десять лет назад. Тем не менее она регулярно всплывает при подборе бюджетного железа под работу с языковыми моделями — и на то есть причина.

32 гигабайта видеопамяти. Именно объём памяти определяет, поместится модель в карту или нет, а на вторичном рынке V100 стоит долю от цены современных ускорителей с сопоставимым объёмом.

Вопрос в другом: что она реально тянет сегодня и где упирается в возраст архитектуры. Разберём по результатам тестов.

Характеристики

Параметр Значение
Архитектура Volta
Память 32 ГБ HBM2
FP64 (двойная точность) 7 ТФЛОПС
FP32 (одинарная точность) 14 ТФЛОПС
Тензорные операции FP16 112 ТФЛОПС
Базовая частота 1290 МГц
Частота в ускоренном режиме 1530 МГц

Обратите внимание на строку с тензорными операциями. V100 — первая карта с тензорными ядрами, и именно они обеспечивают приемлемую скорость на нейросетевых задачах. Без них карта такого возраста была бы неинтересна.

Ключевое ограничение спрятано не в таблице: отсутствие аппаратной поддержки современных низкоразрядных форматов. Восьмибитные и четырёхбитные вычисления, на которых строится эффективный инференс современных моделей, на Volta не ускоряются. Об этом ниже.

Неожиданный результат: Windows быстрее Linux

Начнём с того, что противоречит ожиданиям. При одинаковых настройках и одинаковых моделях замеры на Windows оказались стабильно выше:

Модель Windows 10 Ubuntu 24.04
Granite 4 H Tiny Q4_K_M 117,1 т/с 96,3 т/с
Llama 3.1 8B Q4_K_M 106,9 т/с 86,2 т/с
gpt-oss-20b MXFP4 130,2 т/с 96,7 т/с

Разрыв 20–35% — величина, которую нельзя списать на погрешность.

Объяснение, скорее всего, в зрелости драйверов и оптимизации сборок движка инференса под конкретную платформу для карты этого поколения. Это не общее правило для всех ускорителей — для современных карт картина обычно обратная.

Практический вывод: если планируете V100 под инференс, не отбрасывайте Windows как «несерверную» платформу. Проверьте обе — разница может окупить неудобства.

Что показала карта на реальных моделях

Все замеры при контексте 4096 токенов.

Модели среднего размера

Модель Формат Скорость До первого токена
Mistral 7B v0.3 Q4_K_M 120,3 т/с 0,03 с
gpt-oss-20b MXFP4 130,2 т/с 0,08 с
Qwen 2.5 7B Q4_K_M 108,1 т/с 0,05 с
Llama 3.1 8B Q4_K_M 106,6 т/с 0,01 с
Devstral 24B Q4_K_M 42,5 т/с 0,12 с

Здесь карта чувствует себя уверенно. Сто с лишним токенов в секунду — это быстрее, чем человек успевает читать, то есть для интерактивной работы более чем достаточно.

Любопытно, что лучший результат показала модель на 20 миллиардов параметров, а не самые компактные. Архитектура «смеси экспертов» активирует лишь часть параметров, и это работает в пользу карты.

Крупные модели

Модель Формат Скорость Замечание
Qwen 2.5 14B Q4_K_M 55,8 т/с Редкие паузы на сложных конструкциях
Qwen3 14B Q4_K_M 54,3 т/с Недостатков предыдущей версии нет
Gemma 3 27B Q4 35,1 т/с Логичные, грамотные ответы
Qwen3 32B Q4_K_M 29,6 т/с Максимальная детализация
Llama 3.3 70B Q2_K 6,5 т/с Слишком велика для карты

Здесь виден предел. До 32 миллиардов параметров карта работает приемлемо — 30 токенов в секунду вполне пригодны для работы. А вот 70 миллиардов уже не её масштаб: 6,5 токенов в секунду — это мучительно медленно, и вдобавок для размещения такой модели пришлось использовать очень грубое квантование, заметно ухудшающее качество ответов.

Практическая граница V100 — модели до 32 миллиардов параметров. Выше начинается компромисс, который лишает смысла саму затею.

Код и работа с изображениями

Модель Формат Скорость До первого токена
Qwen 2.5 Coder 14B Q4_K_M 60,8 т/с 0,15 с
Qwen3 VL 8B Q4_K_M 91,3 т/с 5,47 с
Llama 3.1 11B Vision Q4_K_M 76,8 т/с 0,43 с

Обратите внимание на задержку первого токена у мультимодальной модели — почти пять с половиной секунд. Это время обработки изображения, и оно ощутимо: для пакетной обработки приемлемо, для интерактивного диалога с картинками — уже раздражает.

По качеству распознавания объектов первая мультимодальная модель показала себя заметно лучше второй.

Свежие релизы

Модель Формат Скорость Замечание
DeepSeek-R1 Distilled 14B Q4_K_M 60,5 т/с Слабая поддержка русского
DeepSeek-R1 Distilled 32B Q4_K_M 30,1 т/с Немного лучше версии 14B

Главное ограничение

Вернёмся к тому, что не видно в характеристиках.

Современные ускорители имеют аппаратную поддержку вычислений пониженной точности — восьмибитных и четырёхбитных. Это позволяет не только уместить модель в меньший объём памяти, но и считать её быстрее.

На Volta такой поддержки нет. Квантованные модели на V100 запускаются — память экономится, — но выигрыша в скорости от квантования вы не получите: вычисления всё равно идут в более высокой точности.

Отсюда следствие: разрыв между V100 и современными картами на инференсе больше, чем разница в их формальных характеристиках. И этот разрыв будет расти по мере того, как оптимизации под новые форматы становятся стандартом.

Второй момент — поддержка. Volta постепенно исключается из современных версий программных стеков. Пока всё работает, но горизонт планирования у такой покупки ограничен.

Кому подходит, а кому нет

Стоит рассматривать, если:

  • нужен большой объём видеопамяти при ограниченном бюджете;
  • работаете с моделями до 32 миллиардов параметров;
  • это тестовый или учебный контур, а не продакшен;
  • нагрузка эпизодическая, а не круглосуточная.

Не стоит, если:

  • планируете модели крупнее 32 миллиардов;
  • нужна максимальная скорость на токен;
  • рассчитываете на выигрыш от современных форматов квантования;
  • проект длинный, и важна перспектива программной поддержки;
  • считаете стоимость с учётом электричества: карта заметно менее экономична, чем современные, и при круглосуточной работе разница в счетах способна съесть экономию на покупке.

Коротко

Tesla V100 32GB в 2026 году — рабочий вариант для ограниченного круга задач: модели до 32 миллиардов параметров, тестовые контуры, ситуации, где решает объём памяти на рубль.

Практический потолок — 32 миллиарда параметров. Дальше скорость падает до неприемлемой, а грубое квантование убивает качество.

Главное ограничение — отсутствие аппаратной поддержки современных низкоразрядных форматов. Квантование экономит память, но не ускоряет вычисления.

И неожиданное наблюдение из тестов: на этой карте Windows оказался на 20–35% быстрее Linux. Проверьте обе платформы, прежде чем считать результаты окончательными.

Подбираете GPU под конкретные модели — напишите, что планируете запускать, поможем сопоставить варианты по объёму памяти и скорости.