NVIDIA A100 40GB: архитектура Ampere, MIG и реальная производительность в задачах LLM


Введение

Когда в конце 2020 года NVIDIA представила серверный ускоритель A100, инженеры по всему миру получили доступ к принципиально иному классу вычислений. Архитектура Ampere объединила в одном чипе тензорные ядра третьего поколения, принципиально новые числовые форматы TF32 и BF16, аппаратную поддержку структурной разреженности и революционную технологию MIG для разделения ресурсов.

В этом материале команда СервакМастер детально исследует NVIDIA A100 40GB: разбирает ключевые архитектурные решения, изучает технические характеристики и проверяет реальную скорость инференса на популярных языковых моделях.


Архитектурные инновации Ampere

Multi-Instance GPU: одна карта — несколько задач

Multi-Instance GPU (MIG) — пожалуй, самое практически значимое нововведение A100 для облачных платформ и дата-центров. Технология позволяет разбить одну физическую карту на до семи полностью изолированных виртуальных экземпляров, каждый из которых получает собственные вычислительные ресурсы и защищённый раздел видеопамяти.

В 40-гигабайтном исполнении каждый MIG-экземпляр располагает до 5 ГБ HBM2e, в версии 80 ГБ — до 10 ГБ. Технология нативно интегрируется с Kubernetes, Docker и большинством популярных гипервизоров. Это открывает возможность параллельного использования одного ускорителя несколькими независимыми командами — без риска взаимных помех или утечки данных.

NVLink третьего поколения и NVSwitch

A100 получила обновлённое межсоединение NVLink 3.0 в связке с коммутатором NVSwitch. Суммарная пропускная способность GPU-to-GPU достигла 600 ГБ/с — вдвое больше, чем у предыдущего поколения. При объединении до восьми ускорителей через NVSwitch формируется единое унифицированное адресное пространство памяти, что критически важно при обучении сверхбольших моделей, не умещающихся в памяти одного устройства.

Числовые форматы: TF32, BF16 и FP64 Tensor Core

TF32 — интеллектуальный гибрид, сочетающий диапазон представления FP32 с точностью, сопоставимой с FP16. Этот 19-битный формат ускоряет матричные вычисления при обучении нейросетей до восьми раз по сравнению с классическим FP32. Принципиальное достоинство TF32 заключается в полной прозрачности: формат активируется автоматически без какой-либо переработки кода.

FP64 Tensor Core впервые в истории NVIDIA реализовал операции двойной точности непосредственно на тензорных ядрах. В результате производительность A100 в HPC-задачах достигла 19,5 TFLOPS по FP64 Tensor Core — это вдвое больше, чем у аналогичных решений предыдущего поколения. Благодаря этому A100 оказалась универсальным инструментом: она одинаково эффективна как в задачах ИИ, так и в научных симуляциях, требующих высокой точности вычислений.

Структурная разреженность: теория и практика

Аппаратная поддержка структурной разреженности (Structured Sparsity) — одно из наиболее фундаментальных нововведений архитектуры Ampere.

Логика идеи. Обученные нейросети содержат миллиарды весовых коэффициентов, однако значительная часть из них после обучения стремится к нулю и практически не влияет на качество предсказаний. Обычный GPU обрабатывает их наравне со значимыми весами, расходуя ресурсы впустую. Структурная разреженность — это механизм законного пропуска подобных нулевых операций.

Реализация 2:4. NVIDIA применила жёсткую схему: в каждом блоке из четырёх весов ровно два должны быть нулями. Такой предсказуемый паттерн позволяет специализированным аппаратным блокам хранить только ненулевые значения вместе с компактной картой их позиций — и обрабатывать вдвое меньше данных при эквивалентном качестве.

Практические оговорки. На задачах LLM-инференса структурная разреженность даёт реальный прирост лишь при условии, что модель обучалась с применением схемы 2:4 sparsity с самого начала. Подавляющее большинство публично доступных весов — Llama, Qwen, Mistral, Gemma и другие — являются плотными (dense). Это означает, что заявленные «sparse» TFLOPS в реальных сценариях инференса недостижимы. На практике куда более ощутимый прирост производительности дают квантование (FP8, INT8) и непрерывный батчинг.


Технические характеристики NVIDIA A100 40GB

Ускоритель построен на архитектуре Ampere и изготовлен по 7-нанометровому техпроцессу TSMC. Монолитный кристалл GA100 насчитывает 54 миллиарда транзисторов на площади 826 мм² — на момент выхода крупнейший в мире процессорный кристалл по площади. Как и AMD с серией CDNA, NVIDIA с выходом A100 окончательно разделила игровое и вычислительное направления: GA100 никогда не появлялся в потребительских видеокартах и проектировался исключительно для дата-центров.

Вычислительное ядро

Процессор содержит 108 потоковых мультипроцессоров (SM), каждый из которых включает 64 CUDA-ядра и 4 тензорных ядра третьего поколения. Итоговый счёт: 6912 CUDA-ядер и 432 тензорных ядра. Тензорные ядра специализированы на матричных умножениях (GEMM) и поддерживают весь спектр числовых форматов: FP64, TF32, BF16, FP16, INT8 и INT4.

Производительность по форматам

Режим TFLOPS / TOPS
FP64 9,7 TFLOPS
FP64 Tensor Core 19,5 TFLOPS
FP32 19,5 TFLOPS
TF32 Tensor Core 156 TFLOPS
BF16 / FP16 Tensor Core 312 TFLOPS
TF32 (sparse) 312 TFLOPS
BF16 / FP16 (sparse) 624 TFLOPS
INT8 (sparse) 1248 TOPS

Полная таблица характеристик

Основные параметры

  • Запуск: Q4 2020
  • Микроархитектура: Ampere
  • GPU: GA100
  • Техпроцесс: 7 нм (TSMC)
  • Площадь кристалла: 826 мм²
  • Количество транзисторов: 54 200 млн.

Вычислительные параметры

  • Потоковые процессоры (SP): 3840
  • CUDA-ядра: 6912
  • Тензорных ядер: 432
  • SM: 108
  • TMU: 432
  • Базовая частота: 1275 МГц
  • Максимальная частота: 1410 МГц

Кэш и память

  • L1-кэш: 192 КБ на SM
  • L2-кэш: 40 МБ
  • Тип памяти: HBM2e
  • Объём памяти: 40 ГБ
  • Шина памяти: 5120 бит
  • Эффективная частота памяти: 1215 МГц (2430 МГц)
  • Пропускная способность памяти: 1555 ГБ/с

Питание и интерфейс

  • TDP: 250 Вт
  • Интерфейс: PCIe 4.0 x16

Подсистема памяти HBM2e

Подсистема памяти — одно из главных конкурентных преимуществ A100. Пять стеков HBM2e обеспечивают суммарный объём 40 ГБ и выдающуюся пропускную способность 1555 ГБ/с за счёт чрезвычайно широкой 5120-битной шины. Для сравнения: типичный потребительский GPU работает с шиной в 256–384 бита. Эта разница непосредственно влияет на скорость работы с большими языковыми моделями: чем шире шина памяти — тем выше пропускная способность при загрузке весов в момент генерации токенов.


Тестирование NVIDIA A100 в задачах LLM-инференса

NVIDIA традиционно выделяется зрелостью программной экосистемы. A100 без дополнительных настроек запускается с любым популярным движком инференса — от удобной Ollama до тонко оптимизированного SGLang. Для базовых экспериментов достаточно установить официальный драйвер с сайта NVIDIA, включая сценарии работы под Windows.

llama.cpp

Модель Квантизация Скорость (токен/сек) До первого токена Контекст Примечания
GLM-4.7-flash 30B Q4_K_M 75,01 0,32 сек. 8192 Осмысленный диалог, чёткие и развёрнутые ответы
Gemma 4 E4B-it Q4_K_M 115,36 0,3 сек. 8192 Компактная модель от Google, быстрая и сообразительная
Qwen 3.6 35B-A3B Q4_K_M 129,04 0,6 сек. 8192 Актуальная замена Qwen 3.5, грамотные ответы
gpt-oss-20b MXFP4 173,52 0,13 сек. 8192 Быстрая и подробная генерация
Ministral 3 14B-Instruct Q4_K_M 80,49 0,11 сек. 8192 Исключительно развёрнутые и детальные ответы
Gemma 4 31B-it Q4_K_M 32,7 0,5 сек. 8192 Dense-модель семейства Gemma 4; лучше E4B, но не кратно

vLLM

Модель Квантизация Скорость (токен/сек) До первого токена Контекст Примечания
Mistral-7B-Instruct-v0.3 BF16 81,07 0,12 сек. 8192 Медленнее ожидаемого для своего размера; грамотные формулировки
Qwen 3.5 35B-A3B GPTQ 132,64 0,9 сек. 8192 Изредка проскальзывают китайские иероглифы
gpt-oss-20b MXFP4 195,03 0,05 сек. 8192 Быстрее и продуктивнее, чем на llama.cpp
Gemma 4 E4B-it BF16 93,57 0,1 сек. 8192 Подробные и осмысленные ответы
Ministral 3 14B-Reasoning BF16 46,49 0,21 сек. 8192 Развёрнутые ответы, слабая поддержка русского языка

SGLang

Модель Квантизация Скорость (токен/сек) До первого токена Контекст Примечания
Ministral 3 14B-Reasoning FP8 65,87 0,2 сек. 8192 Слабый русский; потребление VRAM выше на 10–15% vs vLLM
Phi 4 mini instruct BF16 110,08 0,27 сек. 8192 Шустрая модель Microsoft на 3,8 млрд параметров
Qwen 3 14B BF16 43,96 0,18 сек. 8192 Достойная модель, но без квантования тяжеловата для одной A100

Приведённые тесты отражают производительность A100 на реальных задачах инференса, а не сравнение фреймворков между собой.

Что показали тесты

A100 остаётся весомым инструментом для инференса языковых моделей среднего и крупного масштаба. Наиболее уверенно карта работает с моделями в диапазоне 7–35 млрд параметров, а также с MoE-архитектурами с относительно небольшим числом активных параметров.

Заслуживает внимания следующее наблюдение: Ministral 3 14B-Reasoning под SGLang потребляет на 10–15% больше видеопамяти, чем под vLLM. Именно поэтому запустить её в формате BF16 на 40-гигабайтной A100 не удалось — пришлось перейти на FP8. Это практический пример того, как выбор движка инференса напрямую влияет на то, какие модели вообще помещаются в доступный объём VRAM.


Охлаждение NVIDIA A100: серверная карта в несерверных условиях

Здесь начинается та часть, о которой производитель предпочитает умалчивать. A100 не оснащена собственным активным охлаждением: карта спроектирована для монтажа в серверную стойку с принудительным обдувом от тыловых вентиляторов шасси. В настольной системе обеспечить её нормальный тепловой режим значительно сложнее.

Готовых систем охлаждения для A100 в розничной продаже не существует — карта слишком специализированная и редкая.

Самодельное решение на 140-мм вентиляторе

Практический выход — сделать переходник самостоятельно:

  1. Спроектировать кронштейн под 140-мм вентилятор в любом 3D-редакторе.
  2. Распечатать на 3D-принтере — с первой итерации подходящая геометрия получается редко, закладывайте 2–3 попытки.
  3. Зафиксировать кронштейн на карте, вентилятор закрепить стяжками.

Идеальным решением был бы турбинный вентилятор с высоким статическим давлением — он обеспечивает более концентрированный воздушный поток и лучший теплоотвод через радиатор карты. Однако найти качественную турбину в свободной продаже значительно сложнее, чем хороший осевой 140-мм вертушок.

Несмотря на кустарный вид конструкции, температурные результаты оказались вполне рабочими:

  • В простое: ~50 °C
  • Под нагрузкой (средняя): ~76 °C
  • Хотспот в пике: ~80 °C

Не рекорд тепловой эффективности, но для решения стоимостью около тысячи рублей — более чем приемлемый результат.


Итог

NVIDIA A100 40GB и сегодня заслуживает серьёзного внимания. Да, в задачах обучения сверхбольших моделей она уступает H100, H200 и тем более B200. Но на вторичном рынке A100 остаётся сильной покупкой для широкого круга практических сценариев:

  • CUDA-инференс языковых моделей в диапазоне 7B–35B параметров
  • MoE-архитектуры с компактным числом активных параметров
  • Разработка и прототипирование на базе vLLM, SGLang или llama.cpp
  • HPC-вычисления с требованием к двойной точности (19,5 TFLOPS FP64 Tensor Core)
  • Стабильная CUDA-экосистема для производственных и исследовательских сценариев

Если вас интересует приобретение NVIDIA A100 или других серверных ускорителей — обращайтесь в СервакМастер: поможем подобрать подходящий вариант под ваши задачи и бюджет.