NVIDIA A100 40GB: архитектура Ampere, MIG и реальная производительность в задачах LLM
Введение
Когда в конце 2020 года NVIDIA представила серверный ускоритель A100, инженеры по всему миру получили доступ к принципиально иному классу вычислений. Архитектура Ampere объединила в одном чипе тензорные ядра третьего поколения, принципиально новые числовые форматы TF32 и BF16, аппаратную поддержку структурной разреженности и революционную технологию MIG для разделения ресурсов.
В этом материале команда СервакМастер детально исследует NVIDIA A100 40GB: разбирает ключевые архитектурные решения, изучает технические характеристики и проверяет реальную скорость инференса на популярных языковых моделях.
Архитектурные инновации Ampere
Multi-Instance GPU: одна карта — несколько задач
Multi-Instance GPU (MIG) — пожалуй, самое практически значимое нововведение A100 для облачных платформ и дата-центров. Технология позволяет разбить одну физическую карту на до семи полностью изолированных виртуальных экземпляров, каждый из которых получает собственные вычислительные ресурсы и защищённый раздел видеопамяти.
В 40-гигабайтном исполнении каждый MIG-экземпляр располагает до 5 ГБ HBM2e, в версии 80 ГБ — до 10 ГБ. Технология нативно интегрируется с Kubernetes, Docker и большинством популярных гипервизоров. Это открывает возможность параллельного использования одного ускорителя несколькими независимыми командами — без риска взаимных помех или утечки данных.
NVLink третьего поколения и NVSwitch
A100 получила обновлённое межсоединение NVLink 3.0 в связке с коммутатором NVSwitch. Суммарная пропускная способность GPU-to-GPU достигла 600 ГБ/с — вдвое больше, чем у предыдущего поколения. При объединении до восьми ускорителей через NVSwitch формируется единое унифицированное адресное пространство памяти, что критически важно при обучении сверхбольших моделей, не умещающихся в памяти одного устройства.
Числовые форматы: TF32, BF16 и FP64 Tensor Core
TF32 — интеллектуальный гибрид, сочетающий диапазон представления FP32 с точностью, сопоставимой с FP16. Этот 19-битный формат ускоряет матричные вычисления при обучении нейросетей до восьми раз по сравнению с классическим FP32. Принципиальное достоинство TF32 заключается в полной прозрачности: формат активируется автоматически без какой-либо переработки кода.
FP64 Tensor Core впервые в истории NVIDIA реализовал операции двойной точности непосредственно на тензорных ядрах. В результате производительность A100 в HPC-задачах достигла 19,5 TFLOPS по FP64 Tensor Core — это вдвое больше, чем у аналогичных решений предыдущего поколения. Благодаря этому A100 оказалась универсальным инструментом: она одинаково эффективна как в задачах ИИ, так и в научных симуляциях, требующих высокой точности вычислений.
Структурная разреженность: теория и практика
Аппаратная поддержка структурной разреженности (Structured Sparsity) — одно из наиболее фундаментальных нововведений архитектуры Ampere.
Логика идеи. Обученные нейросети содержат миллиарды весовых коэффициентов, однако значительная часть из них после обучения стремится к нулю и практически не влияет на качество предсказаний. Обычный GPU обрабатывает их наравне со значимыми весами, расходуя ресурсы впустую. Структурная разреженность — это механизм законного пропуска подобных нулевых операций.
Реализация 2:4. NVIDIA применила жёсткую схему: в каждом блоке из четырёх весов ровно два должны быть нулями. Такой предсказуемый паттерн позволяет специализированным аппаратным блокам хранить только ненулевые значения вместе с компактной картой их позиций — и обрабатывать вдвое меньше данных при эквивалентном качестве.
Практические оговорки. На задачах LLM-инференса структурная разреженность даёт реальный прирост лишь при условии, что модель обучалась с применением схемы 2:4 sparsity с самого начала. Подавляющее большинство публично доступных весов — Llama, Qwen, Mistral, Gemma и другие — являются плотными (dense). Это означает, что заявленные «sparse» TFLOPS в реальных сценариях инференса недостижимы. На практике куда более ощутимый прирост производительности дают квантование (FP8, INT8) и непрерывный батчинг.
Технические характеристики NVIDIA A100 40GB
Ускоритель построен на архитектуре Ampere и изготовлен по 7-нанометровому техпроцессу TSMC. Монолитный кристалл GA100 насчитывает 54 миллиарда транзисторов на площади 826 мм² — на момент выхода крупнейший в мире процессорный кристалл по площади. Как и AMD с серией CDNA, NVIDIA с выходом A100 окончательно разделила игровое и вычислительное направления: GA100 никогда не появлялся в потребительских видеокартах и проектировался исключительно для дата-центров.
Вычислительное ядро
Процессор содержит 108 потоковых мультипроцессоров (SM), каждый из которых включает 64 CUDA-ядра и 4 тензорных ядра третьего поколения. Итоговый счёт: 6912 CUDA-ядер и 432 тензорных ядра. Тензорные ядра специализированы на матричных умножениях (GEMM) и поддерживают весь спектр числовых форматов: FP64, TF32, BF16, FP16, INT8 и INT4.
Производительность по форматам
| Режим | TFLOPS / TOPS |
|---|---|
| FP64 | 9,7 TFLOPS |
| FP64 Tensor Core | 19,5 TFLOPS |
| FP32 | 19,5 TFLOPS |
| TF32 Tensor Core | 156 TFLOPS |
| BF16 / FP16 Tensor Core | 312 TFLOPS |
| TF32 (sparse) | 312 TFLOPS |
| BF16 / FP16 (sparse) | 624 TFLOPS |
| INT8 (sparse) | 1248 TOPS |
Полная таблица характеристик
Основные параметры
- Запуск: Q4 2020
- Микроархитектура: Ampere
- GPU: GA100
- Техпроцесс: 7 нм (TSMC)
- Площадь кристалла: 826 мм²
- Количество транзисторов: 54 200 млн.
Вычислительные параметры
- Потоковые процессоры (SP): 3840
- CUDA-ядра: 6912
- Тензорных ядер: 432
- SM: 108
- TMU: 432
- Базовая частота: 1275 МГц
- Максимальная частота: 1410 МГц
Кэш и память
- L1-кэш: 192 КБ на SM
- L2-кэш: 40 МБ
- Тип памяти: HBM2e
- Объём памяти: 40 ГБ
- Шина памяти: 5120 бит
- Эффективная частота памяти: 1215 МГц (2430 МГц)
- Пропускная способность памяти: 1555 ГБ/с
Питание и интерфейс
- TDP: 250 Вт
- Интерфейс: PCIe 4.0 x16
Подсистема памяти HBM2e
Подсистема памяти — одно из главных конкурентных преимуществ A100. Пять стеков HBM2e обеспечивают суммарный объём 40 ГБ и выдающуюся пропускную способность 1555 ГБ/с за счёт чрезвычайно широкой 5120-битной шины. Для сравнения: типичный потребительский GPU работает с шиной в 256–384 бита. Эта разница непосредственно влияет на скорость работы с большими языковыми моделями: чем шире шина памяти — тем выше пропускная способность при загрузке весов в момент генерации токенов.
Тестирование NVIDIA A100 в задачах LLM-инференса
NVIDIA традиционно выделяется зрелостью программной экосистемы. A100 без дополнительных настроек запускается с любым популярным движком инференса — от удобной Ollama до тонко оптимизированного SGLang. Для базовых экспериментов достаточно установить официальный драйвер с сайта NVIDIA, включая сценарии работы под Windows.
llama.cpp
| Модель | Квантизация | Скорость (токен/сек) | До первого токена | Контекст | Примечания |
|---|---|---|---|---|---|
| GLM-4.7-flash 30B | Q4_K_M | 75,01 | 0,32 сек. | 8192 | Осмысленный диалог, чёткие и развёрнутые ответы |
| Gemma 4 E4B-it | Q4_K_M | 115,36 | 0,3 сек. | 8192 | Компактная модель от Google, быстрая и сообразительная |
| Qwen 3.6 35B-A3B | Q4_K_M | 129,04 | 0,6 сек. | 8192 | Актуальная замена Qwen 3.5, грамотные ответы |
| gpt-oss-20b | MXFP4 | 173,52 | 0,13 сек. | 8192 | Быстрая и подробная генерация |
| Ministral 3 14B-Instruct | Q4_K_M | 80,49 | 0,11 сек. | 8192 | Исключительно развёрнутые и детальные ответы |
| Gemma 4 31B-it | Q4_K_M | 32,7 | 0,5 сек. | 8192 | Dense-модель семейства Gemma 4; лучше E4B, но не кратно |
vLLM
| Модель | Квантизация | Скорость (токен/сек) | До первого токена | Контекст | Примечания |
|---|---|---|---|---|---|
| Mistral-7B-Instruct-v0.3 | BF16 | 81,07 | 0,12 сек. | 8192 | Медленнее ожидаемого для своего размера; грамотные формулировки |
| Qwen 3.5 35B-A3B | GPTQ | 132,64 | 0,9 сек. | 8192 | Изредка проскальзывают китайские иероглифы |
| gpt-oss-20b | MXFP4 | 195,03 | 0,05 сек. | 8192 | Быстрее и продуктивнее, чем на llama.cpp |
| Gemma 4 E4B-it | BF16 | 93,57 | 0,1 сек. | 8192 | Подробные и осмысленные ответы |
| Ministral 3 14B-Reasoning | BF16 | 46,49 | 0,21 сек. | 8192 | Развёрнутые ответы, слабая поддержка русского языка |
SGLang
| Модель | Квантизация | Скорость (токен/сек) | До первого токена | Контекст | Примечания |
|---|---|---|---|---|---|
| Ministral 3 14B-Reasoning | FP8 | 65,87 | 0,2 сек. | 8192 | Слабый русский; потребление VRAM выше на 10–15% vs vLLM |
| Phi 4 mini instruct | BF16 | 110,08 | 0,27 сек. | 8192 | Шустрая модель Microsoft на 3,8 млрд параметров |
| Qwen 3 14B | BF16 | 43,96 | 0,18 сек. | 8192 | Достойная модель, но без квантования тяжеловата для одной A100 |
Приведённые тесты отражают производительность A100 на реальных задачах инференса, а не сравнение фреймворков между собой.
Что показали тесты
A100 остаётся весомым инструментом для инференса языковых моделей среднего и крупного масштаба. Наиболее уверенно карта работает с моделями в диапазоне 7–35 млрд параметров, а также с MoE-архитектурами с относительно небольшим числом активных параметров.
Заслуживает внимания следующее наблюдение: Ministral 3 14B-Reasoning под SGLang потребляет на 10–15% больше видеопамяти, чем под vLLM. Именно поэтому запустить её в формате BF16 на 40-гигабайтной A100 не удалось — пришлось перейти на FP8. Это практический пример того, как выбор движка инференса напрямую влияет на то, какие модели вообще помещаются в доступный объём VRAM.
Охлаждение NVIDIA A100: серверная карта в несерверных условиях
Здесь начинается та часть, о которой производитель предпочитает умалчивать. A100 не оснащена собственным активным охлаждением: карта спроектирована для монтажа в серверную стойку с принудительным обдувом от тыловых вентиляторов шасси. В настольной системе обеспечить её нормальный тепловой режим значительно сложнее.
Готовых систем охлаждения для A100 в розничной продаже не существует — карта слишком специализированная и редкая.
Самодельное решение на 140-мм вентиляторе
Практический выход — сделать переходник самостоятельно:
- Спроектировать кронштейн под 140-мм вентилятор в любом 3D-редакторе.
- Распечатать на 3D-принтере — с первой итерации подходящая геометрия получается редко, закладывайте 2–3 попытки.
- Зафиксировать кронштейн на карте, вентилятор закрепить стяжками.
Идеальным решением был бы турбинный вентилятор с высоким статическим давлением — он обеспечивает более концентрированный воздушный поток и лучший теплоотвод через радиатор карты. Однако найти качественную турбину в свободной продаже значительно сложнее, чем хороший осевой 140-мм вертушок.
Несмотря на кустарный вид конструкции, температурные результаты оказались вполне рабочими:
- В простое: ~50 °C
- Под нагрузкой (средняя): ~76 °C
- Хотспот в пике: ~80 °C
Не рекорд тепловой эффективности, но для решения стоимостью около тысячи рублей — более чем приемлемый результат.
Итог
NVIDIA A100 40GB и сегодня заслуживает серьёзного внимания. Да, в задачах обучения сверхбольших моделей она уступает H100, H200 и тем более B200. Но на вторичном рынке A100 остаётся сильной покупкой для широкого круга практических сценариев:
- CUDA-инференс языковых моделей в диапазоне 7B–35B параметров
- MoE-архитектуры с компактным числом активных параметров
- Разработка и прототипирование на базе vLLM, SGLang или llama.cpp
- HPC-вычисления с требованием к двойной точности (19,5 TFLOPS FP64 Tensor Core)
- Стабильная CUDA-экосистема для производственных и исследовательских сценариев
Если вас интересует приобретение NVIDIA A100 или других серверных ускорителей — обращайтесь в СервакМастер: поможем подобрать подходящий вариант под ваши задачи и бюджет.
