Введение
Видеокарта сегодня — едва ли не самый дефицитный и востребованный компонент на рынке компьютерного железа: вся индустрия искусственного интеллекта построена на GPU. Но для работы с нейросетями подходит далеко не любой ускоритель — часть моделей уже морально устарела, часть попросту не тянет современные LLM по объему памяти и производительности, а часть изначально не предназначалась для подобных задач. Поэтому мы обновили наш прежний рейтинг видеокарт для инференса и обучения нейросетей, убрав из него решения, которые либо перестали поддерживаться актуальным софтом, либо уже не справляются с сегодняшними языковыми моделями (Tesla P100, P40, Radeon Instinct MI50, V100 и подобные им).
Что важно учитывать при выборе видеокарты для ИИ
Прежде чем переходить к самим картам, стоит развести два разных сценария использования — инференс и обучение нейросетей, потому что требования к железу для них отличаются кардинально.
Инференс — это работа с уже готовой обученной моделью (например, Qwen 3.6 или GLM-5.1): вы загружаете её в память ускорителя и получаете от неё ответы. Задача узкая и конкретная — быстро «прогнать» токены через модель и вернуть результат пользователю.
Обучение — это ситуация, когда вы берёте датасет и дообучаете веса модели под свою задачу. Здесь в памяти приходится держать не только сами веса, но и состояния оптимизатора, градиенты и промежуточные активации, поэтому требования к железу значительно выше.
В этом материале мы не привязываемся к одному сценарию и по каждой карте отдельно отмечаем, для какой задачи она подходит лучше.
Объём видеопамяти
Первое, на что стоит смотреть — это не терафлопсы и не число ядер, а именно гигабайты VRAM. Если модель не помещается в память видеокарты, она просто не запустится: производительность H100 не поможет, если у вас карта на 24 ГБ, а модель даже в 4-битном квантовании занимает больше 40 ГБ. В этом рейтинге мы начинаем с ускорителей на 32 ГБ — на сегодняшний день это оптимальный минимум для старта работы с ИИ. С 32 ГБ вы уже не ограничены мелкими моделями в 4-битном сжатии: можно запускать Qwen-3.5 9B в FP16, работать с Gemma 4 27B в Q6/Q8 и даже пробовать инференс 70B-моделей в 3-битном квантовании. Если же речь идёт об обучении, базовый ориентир — от 48 ГБ и выше, поскольку веса и градиенты «съедают» память гораздо активнее.
Скорость памяти
Чем выше пропускная способность памяти, тем быстрее работает модель. Но если для инференса скорость памяти важна лишь косвенно, то для обучения это одна из ключевых характеристик. Наличие быстрой памяти HBM почти всегда говорит о том, что ускоритель изначально проектировался под обучение: поколение HBM определяет и «возраст» GPU, и его пропускную способность — HBM2E даёт до 1,6 ТБ/с, HBM3 — до 3,35 ТБ/с и так далее. Такая скорость критична для непрерывного обновления градиентов и весов при обучении — без неё процесс становится непозволительно медленным. Для инференса в расчёте на одного пользователя всё не так строго: высокая пропускная способность памяти тоже даёт прирост, но не критичный, и после определённого порога узким местом становится уже вычислительная мощность, особенно на больших батчах. Именно поэтому карты, спроектированные под обучение (H100, H200, A100), одинаково хорошо справляются и с обучением, и с инференсом, а карты, заточенные исключительно под инференс (например, RTX PRO 6000 Blackwell), могут быть намеренно ограничены в тренировочных сценариях даже при внушительном объёме памяти.
Производительность и поддерживаемые режимы вычислений
Чем больше терафлопс у GPU — тем выше производительность нейросети, это очевидно. А вот про режимы вычислений стоит сказать отдельно. Речь о квантизации — сжатии весов модели с высокой точности (FP16/BF16) до более низкой (FP8, FP4), которое уменьшает размер модели и ускоряет вычисления ценой некоторой потери точности. Чтобы использовать более агрессивные и одновременно качественные режимы квантизации, нужна аппаратная поддержка со стороны тензорных ядер ускорителя — без неё придётся довольствоваться более «тяжёлыми» версиями моделей. Впрочем, если вы работаете через движок llama.cpp, целочисленные форматы (Q4_K_M, Q6_K, IQ4_XS) запускаются практически на любом железе — движок сам эффективно организует вычисления даже без аппаратной поддержки INT8/FP8/FP4. Поэтому в подборке ниже соседствуют и топовые ускорители с поддержкой FP8/FP4, и более возрастные карты, которые умеют только FP16, — для инференса через llama.cpp их возможностей всё ещё вполне достаточно.
Рейтинг видеокарт для инференса и обучения ИИ
Ниже — десять актуальных ускорителей для локального развёртывания и обучения языковых моделей, от бюджетных решений до топового корпоративного класса.
AMD Radeon AI PRO R9700 AI TOP 32GB GDDR6
Открывает подборку младшая карта «красного лагеря» — AMD Radeon AI PRO R9700 AI TOP на архитектуре RDNA 4, изначально спроектированной с прицелом на потребительские ИИ-нагрузки вроде локального инференса. Карта получила 32 ГБ памяти GDDR6, 64 вычислительных блока и 128 ИИ-блоков.
Поддержки FP4 у неё нет и не будет — это архитектурное ограничение RDNA 4, зато есть FP8. При работе через llama.cpp проблем не возникает: 4-битные модели в Q4_K_M или Q6_K спокойно помещаются в 32 ГБ и работают стабильно. А вот с обучением всё сложнее — RDNA 4 для этого не приспособлена: оптимизаторы, градиенты и батч-нормализация лягут на программную эмуляцию и будут работать крайне медленно, так как у AMD есть отдельная архитектура CDNA специально под тренировку нейросетей.
На практике R9700 AI TOP уверенно справляется с инференсом, а расширение поддержки фирменного стека AMD ROCm делает её эффективность выше день ото дня. Это самое доступное по цене решение для эффективного локального инференса — своего рода входной билет в мир ИИ на платформе AMD, подходящий для экспериментов с LLM и лёгкими генеративными моделями. Как и у многих профессиональных ускорителей, у неё есть серверная версия с пассивным охлаждением, но найти её на рынке непросто — куда более доступны версии с активным (турбинным) охлаждением.
| Характеристика | AMD Radeon AI PRO R9700 AI TOP |
|---|---|
| Объём VRAM | 32 ГБ GDDR6 |
| Пропускная способность памяти | 644 ГБ/с |
| Кол-во матричных ядер | 128 |
| TDP | 300 Вт |
| FP16 | 191 TFLOPS |
| FP8 | 383 TFLOPS |
NVIDIA RTX PRO 4500 Blackwell 32GB GDDR7
Следующая карта — самый младший представитель архитектуры Blackwell в этой подборке (есть модели и послабее, RTX PRO 2000 и 4000, но они не дотягивают до минимальной планки в 32 ГБ). RTX PRO 4500 поддерживает режим FP4 через тензорные ядра пятого поколения — это значит, что модели можно запускать в фирменном формате NVFP4 и получать двукратную экономию памяти почти без потери качества. Карта оснащена 32 ГБ памяти GDDR7 с ECC-коррекцией на 256-битной шине и пропускной способностью 896 ГБ/с — серьёзный показатель для карты такого класса.
Программный стек NVIDIA здесь не вызывает вопросов: актуальные драйверы, полная поддержка CUDA 12, TensorRT-LLM, бесшовная интеграция с vLLM и Triton Inference Server — всё работает «из коробки». По сравнению с Radeon R9700 карта выигрывает практически по всем параметрам: мощнее, быстрее и опирается на более зрелую программную экосистему. Благодаря обширной поддержке со стороны ПО на RTX PRO 4500 реален и файнтюнинг небольших моделей, особенно с грамотным использованием чекпоинтов и LoRA.
Недавно появилась серверная версия карты с пассивным охлаждением и сниженным до 165 Вт TDP — оптимальный вариант для плотной серверной компоновки. Даже активная версия потребляет всего 200 Вт, так что проблем с охлаждением возникнуть не должно.
| Характеристика | RTX PRO 4500 Blackwell |
|---|---|
| Объём VRAM | 32 ГБ GDDR7 |
| Пропускная способность памяти | 896 ГБ/с |
| Кол-во тензорных ядер | 328 |
| TDP | 200 Вт |
| FP16 | 406 TFLOPS |
| FP8 | 811 TFLOPS |
| FP4 | 1600 TFLOPS |
AMD Radeon Instinct MI100 32GB HBM2
Снова возвращаемся к AMD, но здесь всё иначе: в отличие от потребительской R9700, Radeon Instinct MI100 — это полноценный серверный ускоритель, ориентированный в том числе на обучение. Это первая карта в нашей подборке с памятью типа HBM: 32 ГБ HBM2 с пропускной способностью 1,23 ТБ/с — почти вдвое выше, чем у R9700. При этом TDP не превышает 300 Вт, что удобно для плотных вычислительных систем.
MI100 вышла в 2020 году и за это время успела заслужить статус легенды в области обучения и инференса ИИ. Несмотря на отсутствие поддержки FP8 и FP4, карта показывает достойные результаты благодаря архитектуре CDNA первого поколения со 120 вычислительными блоками — решения на этой микроархитектуре по-прежнему поддерживаются AMD: под них выходят новые драйверы и обновления стека ROCm, в отличие от Radeon Instinct MI50 на базе GCN, которая уже выпала из актуальных версий библиотек.
Работать с моделями на MI100 приходится в основном через llama.cpp, но с учётом того, что карты на вторичном рынке стоят сопоставимо с потребительской R9700, покупка вполне оправдана.
| Характеристика | Radeon Instinct MI100 |
|---|---|
| Объём VRAM | 32 ГБ HBM2 |
| Пропускная способность памяти | 1,2 ТБ/с |
| Кол-во матричных ядер | 120 |
| TDP | 300 Вт |
| FP16 | 184 TFLOPS |
NVIDIA A100 40GB HBM2E
Продолжаем список легендарной NVIDIA A100 40 ГБ — именно на этих картах в своё время обучалась и инференсилась модель ChatGPT 3.5, изменившая мир языковых моделей.
A100 универсальна и одинаково хорошо подходит и для инференса, и для обучения. Пропускная способность 40 ГБ памяти HBM2E составляет около 2,0 ТБ/с — не рекорд по сегодняшним меркам, но этого вполне достаточно для инференса моделей уровня 32B и 70B в 4-битном сжатии. Карта построена на архитектуре Ampere, которая в своё время занимала место, сравнимое с нынешним положением Blackwell. И хотя на Ampere выпускались и игровые видеокарты, A100 — принципиально другой продукт: с поддержкой ECC-памяти, MIG-сегментацией и интерконнектом NVLink.
A100 встречается в этом рейтинге дважды — ниже речь пойдёт об увеличенной версии с 80 ГБ. Но и младшая модель заслуживает внимания: быстрая HBM-память, поддержка INT8 и BF16 на тензорных ядрах, комфортное охлаждение при TDP 250 Вт. Для тех, кто хочет прикоснуться к архитектуре, на которой создавались первые версии GPT, при ограниченном бюджете A100 40 ГБ остаётся хорошим выбором.
| Характеристика | NVIDIA A100 40 ГБ |
|---|---|
| Объём VRAM | 40 ГБ HBM2E |
| Пропускная способность памяти | 1,56 ТБ/с |
| Кол-во тензорных ядер | 432 |
| TDP | 250 Вт |
| FP16 | 77 TFLOPS |
NVIDIA RTX PRO 5000 Blackwell 48GB GDDR7
Ещё один ускоритель на архитектуре Blackwell — крепкий «середнячок» RTX PRO 5000, который унаследовал все преимущества флагманской микроархитектуры NVIDIA: поддержку FP4, тензорные ядра пятого поколения, GDDR7 с ECC и интерфейс PCIe 5.0 x16. В отличие от RTX PRO 4500, у RTX PRO 5000 почти на 40% больше ядер — 14 080 CUDA-ядер против 10 496, и 48 ГБ памяти вместо 32 ГБ. Вместе с увеличенным объёмом растёт и скорость: пропускная способность памяти достигает 1,3 ТБ/с.
Существует и версия RTX PRO 5000 Blackwell с 72 ГБ памяти, но из-за дефицита памяти на рынке достать её практически невозможно — такие карты сразу уходят корпоративным заказчикам. При этом 48 ГБ вполне достаточно для комфортного инференса LLM среднего размера.
Энергопотребление карты составляет умеренные 300 Вт, а в сочетании с активным турбинным охлаждением развернуть её в сервере не составит труда. Если бюджет позволяет, RTX PRO 5000 Blackwell — удачный выбор: модели 70B в квантовании Q6 помещаются целиком без дополнительных ухищрений, инференс работает быстро, а файнтюнинг моделей среднего размера вполне реален.
| Характеристика | RTX PRO 5000 Blackwell |
|---|---|
| Объём VRAM | 48 ГБ GDDR7 |
| Пропускная способность памяти | 1,3 ТБ/с |
| Кол-во тензорных ядер | 440 |
| TDP | 300 Вт |
| FP16 | 277 TFLOPS |
| FP8 | 550 TFLOPS |
| FP4 | 1100 TFLOPS |
AMD Radeon Instinct MI210 64GB HBM2E
Снова AMD — на этот раз Radeon Instinct MI210 на усовершенствованной архитектуре CDNA второго поколения. Карта получила 64 ГБ памяти HBM2E с пропускной способностью 1,6 ТБ/с, чего вполне достаточно для комфортного запуска моделей с 70+ млрд параметров даже без поддержки FP8. Энергопотребление при этом остаётся в рамках 300 Вт.
Интересная деталь: потоковых процессоров у MI210 меньше (104), чем у MI100 (120) — это следствие перехода на более совершенный техпроцесс и обновлённую архитектуру. Но несмотря на это, производительность в BF16 у MI210 вдвое выше, чем у MI100, за счёт выполнения двух операций в BF16 за такт. А переход на более быструю память HBM2E вместо HBM2 и удвоение объёма VRAM позволяют запускать и обучать крупные модели без необходимости квантизации.
| Характеристика | Radeon Instinct MI210 |
|---|---|
| Объём VRAM | 64 ГБ HBM2E |
| Пропускная способность памяти | 1,6 ТБ/с |
| Кол-во матричных ядер | 416 |
| TDP | 300 Вт |
| FP16 | 181 TFLOPS |
NVIDIA A100 80GB HBM2E
Вот и обещанный апгрейд A100 — версия с удвоенным объёмом VRAM за счёт установки более ёмких кристаллов HBM2E. Это отработанная стратегия NVIDIA: по мере зрелости техпроцесса компания устанавливает на ту же плату кристаллы HBM большей ёмкости.
Версия на 80 ГБ выходит на принципиально другой уровень: такого объёма достаточно, чтобы разбить одну физическую карту на несколько виртуальных ускорителей (MIG) с гарантированной памятью и пропускной способностью и обслуживать несколько моделей одновременно. У младшей версии на 40 ГБ технология MIG тоже есть, но нарезать 40 ГБ на куски под современные LLM малопрактично.
A100 80 ГБ остаётся актуальной картой: память HBM2E с пропускной способностью около 2,0 ТБ/с, тензорные ядра третьего поколения с поддержкой BF16, NVLink для объединения двух карт в пул на 160 ГБ. Для инференса моделей уровня 100B в 4-битном сжатии это по-прежнему удачный вариант, а для обучения моделей среднего размера (7B, 13B) A100 остаётся надёжной рабочей лошадкой.
| Характеристика | NVIDIA A100 80 ГБ |
|---|---|
| Объём VRAM | 80 ГБ HBM2E |
| Пропускная способность памяти | 2 ТБ/с |
| Кол-во тензорных ядер | 432 |
| TDP | 300 Вт |
| FP16 | 312 TFLOPS |
NVIDIA H100 OEM 80GB HBM3
Переходим к тяжёлой артиллерии: H100 80 ГБ — пожалуй, самый известный ИИ-ускоритель NVIDIA, во многом определивший облик современных вычислений для ИИ. Производительность выросла кратно по сравнению с A100 благодаря тому, что NVIDIA, подобно AMD, разделила архитектуры под разные сегменты: Hopper — для корпоративного ИИ, Ada Lovelace — для потребительского рынка. Ставка себя оправдала: H100 стала одним из главных драйверов роста всей ИИ-индустрии.
Карта оснащена 80 ГБ памяти HBM3 с пропускной способностью 3,35 ТБ/с. Помимо этого, в H100 внесены архитектурные изменения, ставшие впоследствии основой для последующих поколений: добавлен Transformer Engine и обновлённые тензорные ядра четвёртого поколения с поддержкой режима FP8. Поддержки FP4 здесь нет — это прерогатива Blackwell, — но для инференса через vLLM в FP8 карта показывает впечатляющие результаты.
В задачах обучения H100 заметно превосходит RTX PRO 6000 Blackwell Server Edition — за счёт памяти HBM3 вместо GDDR7, интерконнекта NVLink на 900 ГБ/с и архитектурных оптимизаций Hopper, изначально нацеленных на тренировочные нагрузки. В инференсе результаты у карт близки, но в целом H100 остаётся более универсальным инструментом. Спрос на H100 по-прежнему высок, поэтому и цены на неё держатся на высоком уровне.
| Характеристика | H100 |
|---|---|
| Объём VRAM | 80 ГБ HBM3 |
| Пропускная способность памяти | 3,35 ТБ/с |
| Кол-во тензорных ядер | 456 |
| TDP | 350 Вт |
| FP16 | 756 TFLOPS |
| FP8 | 1 513 TFLOPS |
NVIDIA RTX PRO 6000 Blackwell Server Edition 96GB GDDR7
Один из лучших ускорителей для локального инференса — RTX PRO 6000 Blackwell Server Edition. Технические характеристики впечатляют: 96 ГБ памяти GDDR7 с ECC на 512-битной шине, пропускная способность 1,6 ТБ/с, 24 064 CUDA-ядра и тензорные ядра пятого поколения с поддержкой FP4 — по позиционированию NVIDIA это одно из самых производительных решений для локального запуска нейросетей на сегодняшний день.
При этом для обучения нейросетей карта подходит хуже — NVIDIA намеренно ограничила её эффективность в тренировочных задачах. Небольшие модели дообучить на ней можно, но при попытке тренировать крупные модели с сильным квантованием пропускная способность GDDR7 в 1,6 ТБ/с становится узким местом по сравнению со скоростью памяти той же H100.
В сравнении с RTX PRO 5000 у RTX PRO 6000 почти на 71% больше ядер — это серьёзный шаг вперёд по производительности. Но и TDP соответствующий: карта нагревается до 600 Вт, а значит требует продуманного охлаждения сервера — пассивной серверной версии нужен мощный поток воздуха в стойке, активной — хорошая циркуляция воздуха в корпусе. RTX PRO 6000 остаётся дорогим решением, но всё же дешевле H100, при этом в инференсе она вполне сопоставима по скорости со старшей моделью. А вот в обучении преимущество однозначно на стороне H100.
| Характеристика | RTX PRO 6000 Blackwell Server Edition |
|---|---|
| Объём VRAM | 96 ГБ GDDR7 |
| Пропускная способность памяти | 1,5 ТБ/с |
| Кол-во тензорных ядер | 752 |
| TDP | 600 Вт |
| FP16 | 504 TFLOPS |
| FP8 | 1008 TFLOPS |
| FP4 | 2016 TFLOPS |
NVIDIA H200 NVL 141GB HBM3E
Одна из лучших видеокарт для обучения (и инференса) ИИ-моделей на сегодняшнем рынке — легендарная NVIDIA H200 NVL с 144 ГБ памяти. Логика апгрейда та же, что и у A100: NVIDIA дожидается зрелости техпроцесса HBM и устанавливает на проверенную архитектуру Hopper более ёмкие и быстрые чипы памяти. В случае H200 NVL это память HBM3E, дающая 141 ГБ с поддержкой ECC. Пропускная способность памяти достигает 4,8 ТБ/с — на сегодняшний день это абсолютный рекорд среди серийных ускорителей.
Такой объём VRAM в однокорпусном исполнении — качественный скачок по сравнению с H100 80 ГБ, которая заставляла идти на компромиссы при работе с моделями от 70 млрд параметров. H200 NVL позволяет загружать модели уровня 170B в FP8 целиком, без тензорного параллелизма и без потерь времени на межкарточную коммуникацию. Для инференса это значит, что в памяти можно держать всю модель целиком, включая RAG-контексты и агентные системы, обслуживая сотни одновременных запросов без деградации качества. Именно поэтому H200 стала основой инференс-инфраструктуры у крупных облачных провайдеров.
В задачах обучения H200 NVL раскрывается не хуже: высокая пропускная способность HBM3E снимает узкое место памяти, которое раньше ограничивало вычислительные блоки на больших батчах. Градиенты, состояния оптимизатора и активации обрабатываются с такой скоростью, что обучение плотных моделей уровня Llama 4 и Qwen 3.6 перестаёт быть исключительной задачей. Дополняют картину Transformer Engine с поддержкой FP8, тензорные ядра четвёртого поколения и возможность объединения четырёх карт через NVLink в единый домен памяти объёмом порядка терабайта.
| Характеристика | H200 NVL |
|---|---|
| Объём VRAM | 141 ГБ HBM3E |
| Пропускная способность памяти | 4,8 ТБ/с |
| Кол-во тензорных ядер | 456 |
| TDP | 600 Вт |
| FP16 | 835 TFLOPS |
| FP8 | 1 671 TFLOPS |
AMD Radeon Instinct MI350P 144GB HBM3E
Пока готовился этот материал, AMD представила новый ускоритель MI350P с интерфейсом PCIe, который занимает верхнюю строчку рейтинга среди доступных на рынке решений. AMD применила ту же стратегию, что и NVIDIA: взяла архитектуру CDNA 4, урезала её вдвое от флагманского MI350X и установила на стандартную PCIe-карту с воздушным охлаждением. В результате получилось решение, способное безболезненно встроиться в существующую серверную инфраструктуру и превратить её в полноценную платформу для локального инференса.
В основе MI350P — чип, изготовленный по 3-нм техпроцессу TSMC, с 73 миллиардами транзисторов и 512 матричными ядрами. В паре с ним работает 144 ГБ памяти HBM3E на 4-канальной шине с пропускной способностью 4 ТБ/с и 128 МБ Infinity Cache. Это позволяет загружать LLM с десятками и сотнями миллиардов параметров, а также размещать на одном ускорителе сложные RAG-конвейеры и агентные системы, обслуживая множество запросов без деградации.
Главное преимущество MI350P — скорость: AMD заявляет 2,3 PFLOPS для операций FP16 и MXFP8, а в режиме с разреженностью и на более низких точностях MXFP4/MXFP6 показатель достигает 4,6 PFLOPS. Это позволяет приблизиться по производительности к более дорогим OAM-ускорителям на существенно более гибком и доступном носителе. По заявлениям AMD, MI350P демонстрирует на 43% более высокую теоретическую производительность в FP16 и на 39% в FP8 по сравнению с прямым конкурентом — NVIDIA H200 NVL. При стоимости около $3000–4000 и возможности установки в стандартные серверы MI350P выглядит одним из самых привлекательных предложений в сегменте корпоративного ИИ-железа.
| Характеристика | MI350P |
|---|---|
| Объём VRAM | 144 ГБ HBM3E |
| Пропускная способность памяти | 4 ТБ/с |
| Кол-во матричных ядер | 512 |
| TDP | 600 Вт |
| FP16 | 1,15 PFLOPS |
| FP8/MXFP8 | 2,3 PFLOPS |
| MXFP4/MXFP6 | 4,6 PFLOPS |
Выводы
Мы разобрали десять актуальных ускорителей — от бюджетных решений для входа в тему до по-настоящему мощных карт корпоративного класса. Рынок ИИ-железа сейчас предлагает варианты на любой бюджет: можно взять доступное решение на RDNA 4 или младшем Blackwell, можно ориентироваться на проверенные серверные карты вроде A100 и MI100, а для по-настоящему требовательных задач подойдут H100, H200 NVL или MI350P, способные обрабатывать огромные объёмы данных без потери стабильности. У каждой карты свои нюансы — объём и тип памяти, поддерживаемые режимы вычислений, соотношение цены и производительности, — и разобраться в них самостоятельно бывает непросто. Если нужна помощь с подбором конкретной конфигурации под свои задачи, специалисты СервакМастер готовы подсказать, какой GPU и какие сопутствующие компоненты лучше подойдут для вашей инфраструктуры.
Автор: СервакМастер
