Рынок ИИ-ускорителей за несколько лет превратился в гонку за топовыми GPU: модели растут быстрее дата-центров, а дата-центры быстрее, чем NVIDIA успевает поставлять чипы. В марте 2024 года компания представила архитектуру Blackwell, и на время она сняла часть напряжения. В её составе GPU B200 и B300, а также суперчипы GB200 и GB300 с форматами FP8 и новым FP4, множеством тензорных и CUDA-ядер, переработанной подсистемой памяти, интерконнектом NVLink C2C и Arm-процессорами Grace. На слайдах всё выглядит безупречно, но за красивыми графиками стоят компромиссы и узкие места. Ниже мы, специалисты «СервакМастер», разбираем, где Blackwell действительно силён, где он спотыкается и что стоит учесть до покупки.
Что такое Blackwell и GB200
Blackwell — не просто ускоренный H100/H200. Инженеры NVIDIA изменили структуру Tensor Core, добавили новый путь работы с памятью (Tensor Memory), обновили логику планировщика, ввели формат FP4 и усилили каналы обмена данными. Техпроцесс сменился с TSMC 4N на TSMC 4NP, но это скорее обычное обновление при смене поколения.
Семейство включает несколько линеек:
| Решение | Что это | Особенности |
|---|---|---|
| B200 / B300 | Серверные GPU | Двухкристальная конструкция: два вычислительных чипа в одном корпусе |
| GB200 / GB300 | Суперчипы | Arm-процессор NVIDIA Grace и GPU Blackwell B200 / B300 на одном модуле; конфигурации 2GPU + 1CPU, 1GPU + 1CPU и другие |
| GB202 | Чип для RTX 5090 и рабочих станций | Основа NVIDIA RTX Pro 6000 Blackwell (Server Edition, Workstation Edition, Max-Q); компактнее B200/B300, меньше тензорных ядер и графических блоков, есть графический API для DirectX и OpenCL |
| GB10 | Младший SoC | Лежит в основе мини-ПК для ИИ DGX Spark; ядер меньше, чем в GB202 |
Суперчипы по замыслу заимствованы у Hopper (GH100 и GH200), но в Blackwell эта идея развита сильнее. Общая логика у всех решений одна: максимум производительности на самых больших моделях за счёт сверхбыстрого интерконнекта NVLink Chip-to-Chip (C2C), единого адресного пространства памяти и минимальных задержек. Сам C2C появился ещё в эпоху Hopper, однако в Blackwell его потенциал раскрылся полнее. Пример GB10 показывает: преимущество поколения не сводится к размеру кристалла и числу вычислительных блоков.
Узкие места самих GPU
Дисбаланс Tensor Cores и SFU
Основной источник скорости Blackwell — большое число блоков с тензорными ядрами. Они выполняют матричные умножения (GEMM), на которых строится большинство ИИ-моделей, а поддержка FP8 и FP4 делает их ещё быстрее. Но эта специализация имеет обратную сторону.
Блоки SFU (Special Function Units) отвечают за экспоненты, логарифмы, тригонометрию и функцию Softmax. Их усиливали куда скромнее, поэтому в подобных операциях Blackwell по скорости откатывается к уровню Hopper. Для ИИ это важно напрямую: чем быстрее считаются матрицы, тем заметнее становится просадка там, где нужны специальные функции, а именно в механизме Attention трансформеров. Ускорение вычислений внимания при переходе с Hopper на Blackwell почти не выросло.
Сильнее всего проблема проявляется в B200. В решениях Blackwell Ultra (B300 и GB300) SFU усилили, и ситуация улучшилась лишь частично. Кроме того, производительность резко падает в режимах FP64 и FP32. Для ИИ это не критично, ведь там считают в FP16, FP8 и FP4, зато в HPC, где нужна повышенная точность, недостаток становится серьёзным препятствием.
TMEM и усложнение программирования
Программирование под CUDA от поколения к поколению становится всё более асинхронным: сначала появился cp.async, затем механизмы TMA и MBarrier, а теперь в Blackwell добавлена TMEM (Tensor Memory), отдельный путь перемещения тензоров вне классической модели SIMT. Архитектурно это оправдано, поскольку регистры CUDA-ядер перестают быть узким местом.
Для разработчиков низкоуровневого кода всё сложнее:
- нужно строить цепочки асинхронных операций;
- правильно планировать загрузку TMEM;
- выстраивать многоступенчатые барьеры;
- думать о том, как расписание операций согласуется с Tensor Core.
NVIDIA предлагает CuTe и высокоуровневые пайплайны, скрывающие детали, но порог входа растёт, и разработчикам приходится глубже погружаться в архитектуру. Ошибки синхронизации стали частыми и труднее обнаруживаются. Показательна схема взаимодействия компонентов GPU-приложения из GitHub: производительность там упирается в ожидание MMA, а не в загрузку данных, потому что TMA завершает работу раньше, чем Consumer освобождает барьер.
Два кристалла: асимметрия доступа к памяти
В презентациях B200 и B300 NVIDIA не делала акцента на том, что чипы двухкристальные, а такая конструкция неизбежно порождает асимметрию:
- доступ к памяти «соседнего» кристалла медленнее, чем к памяти основного;
- нагрузка, не учитывающая топологию, получает дополнительные задержки;
- CUDA пока не даёт полноценного управления двухчиповыми конфигурациями, чтобы гарантированно привязать CTA к конкретному кристаллу.
Особенно болезненно на топологию реагируют сложные паттерны доступа к памяти. Если данные и вычисления распределены «в лоб», часть операций постоянно пересекает границу между кристаллами и замедляется. На однокристальном H100 такой проблемы не было, в B200 и B300 всё иначе.
Суперчип GB200: когда узким местом становится CPU
Суперчипы, по сути отдельные вычислительные системы, ещё нагляднее показали и плюсы, и минусы Blackwell.
«Killer microsecond»
Чем быстрее GPU, тем чаще проявляются проблемы микросекундного масштаба: короткие кернелы завершаются так быстро, что в бюджете времени доминирует латентность управления со стороны CPU. Grace в GB200 построен на ARM Neoverse V2, но отличается от стандартных серверных реализаций: кэш L2 урезан, а часть маршрутов к L3 проходит через несколько хопов NOC. В эпоху Hopper Grace выглядел достойно и NVIDIA охотно показывала графики роста скорости при повышении энергоэффективности. С Blackwell картина обернулась: GPU ушёл вперёд, и недостатки CPU перестали быть незаметными. Особенно это видно в задачах с множеством коротких кернелов, которым постоянно нужен CPU для синхронизации, подготовки данных или переключения графов.
NOC, RDMA и сетевой трафик через Grace
В ряде конфигураций Scale-Out кластеров сетевой RDMA-трафик вынужден идти через процессоры Grace: через NOC-сетку CPU, его кэши и только затем по NVLink C2C к GPU. Это добавляет задержки и нагружает CPU-часть суперчипа. Крупные игроки нашли частичные обходы: AWS использует внешние PCIe-switch для более удачного распределения трафика, а Meta* меняет соотношение Grace и Blackwell и применяет улучшенную топологию размещения в стойках. Для NVIDIA Grace — первый крупный серверный CPU, тогда как для гиперскейлеров Arm-серверы давно освоенная практика. При установке GB200 в ЦОД нередко приходится почти вручную выстраивать маршруты трафика, иначе нагрузка уходит в CPU и мешает GPU.
Что улучшено в GB300
GB300 — прямая эволюция GB200. NVIDIA поработала над узкими местами базовой архитектуры:
- расширила блоки SFU;
- оптимизировала работу памяти;
- перераспределила ресурсы в пользу FP8/FP4;
- добавила PCIe Switch;
- улучшила некоторые аспекты связи между кристаллами.
В результате меньше проседает Softmax, быстрее обучаются трансформеры, а задержки при прохождении трафика через Grace уменьшились. Однако принципиально картина не поменялась: двухкристальная конфигурация никуда не делась, а RDMA-маршруты по-прежнему требуют грамотной топологии кластера. GB300 определённо лучше GB200, но ждать от него устранения всех ограничений не стоит.
Практические выводы для заказчика сервера
Blackwell остаётся выдающимся продуктом индустрии ИИ-оборудования. Вопрос только в том, под какие задачи он подходит.
Где Blackwell раскрывается
Лучше всего он работает, когда вычислений много, они предсказуемы и состоят в основном из матричных операций:
- обучение больших трансформеров и LLM;
- длинные пайплайны с CUDA Graphs, где кернелы подготовлены заранее;
- сценарии, где важна пропускная способность и заранее известно распределение данных.
Где можно упереться в ограничения
- нагрузки с большим числом коротких кернелов, где начинает доминировать CPU;
- модели, в профиле которых слишком много Softmax или Attention;
- кластеры с агрессивным Scale-Out, где RDMA перегружает Grace, потому что путь к GPU всегда проходит через CPU-часть.
В таких случаях теоретические TFLOPS легко превращаются в формулу «на бумаге быстро, в проде не очень».
B200, B300, GB200, GB300 и альтернативы
- Если нужен максимум GEMM-ускорения и Softmax не доминирует, оптимальны B200 или GB200: высокая плотность вычислений, единая память и NVLink C2C.
- Если модели перегружены механизмом Attention и активно используют SFU-операции, стоит смотреть на B300, который лучше справляется с дисбалансом.
- Сравнивайте не только текущее поколение NVIDIA, но и альтернативы: кластеры на Hopper, связки x86 с дискретными GPU, другие ARM-серверы, платформы разных вендоров. Самый новый чип не всегда самый подходящий.
Несмотря на недостатки, Blackwell остаётся лучшим ИИ-решением на рынке до выхода следующей архитектуры NVIDIA Rubin.
Итоги
Сила NVIDIA не только в больших и мощных GPU, но и в экосистеме: компиляторах, библиотеках, алгоритмах, серверах и сетевых решениях. Blackwell стал вершиной этой работы, но идеальным он не является. Среди его компромиссов: урезанный SFU, двухкристальность, высокая чувствительность к топологии, особенности CPU Grace и маршруты RDMA. Всё это нужно учитывать до покупки, особенно при масштабировании кластера. Важно не просто купить новейший GPU, а понять, как он устроен и под какие задачи подходит, тогда архитектурные особенности превращаются из проблемы в инструмент.
Подобрать конфигурацию, которая действительно окупится, поможет «СервакМастер»: платформы HGX, MGX, DGX и другие Arm-серверы для задач вашего бизнеса. Посмотрите серверы для ИИ и общий каталог серверов или свяжитесь с нами для расчёта под вашу нагрузку.
*Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена.
