Говоря об обучении больших языковых моделей, обычно вспоминают GPU Nvidia, ИИ-ускорители, вычислительные узлы и кластеры с впечатляющими цифрами TFLOPS в форматах FP16, FP8 или FP4. Но производительность вычислительных блоков — только половина дела. Главное узкое место часто лежит не в арифметике, а в ёмкости и пропускной способности памяти. Именно HBM не даёт Nvidia Rubin или AMD Instinct MI400 простаивать в ожидании данных. Ниже специалисты «СервакМастер» объясняют, что такое HBM, как она устроена, какие у неё есть поколения и почему от неё так сильно зависит ИИ-инфраструктура.

Что такое HBM и как она работает

HBM (High Bandwidth Memory) — тип графической памяти, созданный ради максимальной пропускной способности и плотности хранения. Достигается это особой компоновкой DRAM-кристаллов.

Микросхемы GDDR в потребительских видеокартах распаиваются по одной на плате вокруг GPU. В HBM кристаллы памяти укладываются друг на друга в многослойную 3D-стопку. Каждый слой — отдельный чип, а между собой слои связаны вертикальными проводниками, которые проходят сквозь кремний. Технология называется TSV (Through-Silicon Vias). В основании стопки стоит базовый логический кристалл-контроллер. Вся сборка устанавливается не на текстолит ускорителя отдельно, а на общую с GPU подложку, поэтому вычислительный чип получает прямой доступ к своей памяти.

Почему шина такая широкая

Из-за этой компоновки интерфейс HBM намного шире, чем у GDDR: у одного чипа GDDR7 шина 32 бита, а у стека HBM3E — 1024 бита. Частота самой HBM при этом скромнее, всего 1–3 ГГц, но итоговая пропускная способность достигает нескольких терабайт в секунду. Контакты микробампов на подложке очень короткие, паразитные ёмкости минимальны, и за счёт этого заметно падает энергопотребление на каждый переданный бит.

Типичный пример — ускорители Nvidia H100, где чипы HBM3 расположены на одной подложке с графическим чипом GH100.

Поколения HBM

Технология развивалась быстро: сначала её подталкивали задачи HPC, затем бум искусственного интеллекта. Каждое поколение заметно увеличивало ёмкость и пропускную способность и одновременно усложняло производство.

Сводная таблица

Поколение Макс. объём на стек Пропускная способность на стек Шина
HBM1 4 ГБ 128 ГБ/с 1024 бита
HBM2 24 ГБ до 256 ГБ/с 1024 бита
HBM2E 24 ГБ до 460 ГБ/с 1024 бита
HBM3 24 ГБ до 819 ГБ/с 1024 бита
HBM3E 48 ГБ свыше 1,0 ТБ/с, до 1,2 ТБ/с 1024 бита
HBM4 64 ГБ от 2,8 ТБ/с (Micron) до 3,3 ТБ/с (Samsung) 2048 бит
HBM4E 64 ГБ 4,0 ТБ/с —

HBM1 (2015)

Первое поколение вышло в 2015 году в видеокартах AMD Radeon R9 Fury X и Radeon Pro Duo (чип Fiji). Именно AMD инициировала разработку этого типа памяти. По сути, это была демонстрация концепции: она показала, что 3D-стопки DRAM работают в конечных устройствах. Техпроцесс TSV и ограниченная плотность позволяли собрать лишь до четырёх слоёв в стеке, так что объём в 4 ГБ на стек для профессиональных задач был мал. Зато 1024-битная шина при 128 ГБ/с уже тогда заметно опережала GDDR5. HBM1 заложила основу для всех следующих версий, хотя в продуктах пробыла недолго. Пример реализации — Radeon R9 Nano с четырьмя чипами HBM1.

HBM2 (2016)

Стандарт JEDEC вышел в 2016 году. В том же году Nvidia показала Tesla P100, а в 2017-м — V100. HBM2 стала рабочим стандартом для HPC и обучения нейросетей. Скорость выросла до 256 ГБ/с, слоёв в стеке стало до восьми, что удвоило ёмкость и пропускную способность. Появились поддержка ECC и более гибкое управление банками. По энергоэффективности на петабайт данных HBM2 в разы превзошла GDDR5X.

Где применялась:

  • NVIDIA Tesla P100 — 16 ГБ, 4 стека;
  • NVIDIA Tesla V100 — 32 ГБ, 4 стека HBM2 (чип GV100);
  • AMD MI50 — 32 ГБ;
  • процессор Fujitsu A64FX для суперкомпьютера Fugaku.

HBM2E (2019)

Формально это не отдельный стандарт JEDEC, а расширенная версия HBM2 образца 2019 года с повышенными скоростью и плотностью. Число слоёв выросло до двенадцати, что позволило делать стеки по 16 ГБ, а скорость поднялась до 460 ГБ/с. Этот шаг оказался критически важным для нынешнего ИИ-бума: 80-гигабайтная версия NVIDIA A100 с пятью стеками по 16 ГБ впервые позволила обучать модели масштаба GPT-2/3 на одном ускорителе без разбиения. Кроме того, HBM2E использовалась в процессорах Intel Xeon Max (64 ГБ) как встроенная высокоскоростная память, что показало универсальность подхода. В графическом процессоре GA100 ускорителя A100 физически размещено шесть стеков HBM2E.

HBM3 (2022)

Это первый стандарт, полностью разработанный с учётом требований ИИ-ускорителей; JEDEC утвердил его в начале 2022 года. Скорость выросла до 819 ГБ/с, заметно улучшился параллелизм запросов и снизились задержки при произвольном доступе. Объём стека достиг 24 ГБ, а для дата-центров стали обязательными сквозная коррекция ошибок и тонкое управление питанием на уровне банков. Первыми HBM3 получили ускорители NVIDIA H100 (80 ГБ, 5 стеков; в самом GPU GH100 предусмотрено шесть), затем она появилась в AMD Instinct MI300X и Google TPU v4.

HBM3E

Актуальный до недавнего времени флагман, расширяющий спецификацию HBM3. Массовые поставки SK Hynix начала в начале 2024 года для NVIDIA H200, и почти сразу HBM3E стала стандартом для новейших ускорителей Blackwell. Пропускная способность перешагнула порог в 1 ТБ/с, появились стеки на 24, 36 и 48 ГБ. Этого хватает для современных LLM с сотнями миллиардов параметров: можно собирать ускорители со 192 ГБ памяти и пропускной способностью около 8 ТБ/с на чипе, как у B200. Фактически именно HBM3E задаёт темп ИИ-гонки.

Примеры:

  • NVIDIA H200 — 141 ГБ, 6 стеков, 4,8 ТБ/с;
  • NVIDIA B200 — 192 ГБ, 8 стеков, до 8 ТБ/с;
  • NVIDIA B300 — 288 ГБ, 8 стеков, до 8 ТБ/с;
  • AMD MI350;
  • Intel Gaudi 3.

HBM4

JEDEC утвердил стандарт в апреле 2025 года. К концу 2025-го SK Hynix завершила разработку и начала массовое производство, а в начале 2026 года к ней присоединились Samsung и Micron. Главное изменение — ширина шины на стек выросла вдвое, с 1024 до 2048 бит, и именно это даёт основной прирост пропускной способности. Второе новшество: базовый логический кристалл (Base Die) впервые выпускается не по техпроцессу памяти, а по передовым логическим нормам, 4–5 нм на фабриках TSMC. Это открывает путь к глубокой кастомизации под конкретного заказчика.

Пример применения — NVIDIA Vera Rubin: до 288 ГБ на GPU, 8 стеков по 36 ГБ, пропускная способность до 22 ТБ/с на GPU. На презентации Дженсен Хуанг показывал процессоры Rubin и Vera, причём у Rubin восемь стеков HBM4.

HBM4E

Это форсированное расширение HBM4, которое Samsung впервые показала на GTC 2026. Оно ориентировано на следующее поколение ускорителей — NVIDIA Rubin Ultra. Параметры: до 64 ГБ на стек и 4,0 ТБ/с. Для самого Rubin Ultra ожидается до 384 ГБ на GPU при 16-слойных стеках и до 64 ТБ/с совокупной пропускной способности.

Почему HBM лучше всего подходит для обучения ИИ

Обучение больших моделей — это непрерывный поток матричных умножений над огромными тензорами весов. Основная сложность — доставить веса и промежуточные активации к исполнительным блокам. Вычислять можно быстро, пока данные лежат в регистрах или SRAM-кеше, но крупная модель в них не помещается. Чем она больше, тем чаще приходится обращаться к основной памяти, а поскольку обучение идёт пакетами, чтение должно обеспечивать огромный throughput. HBM закрывает сразу три задачи.

  1. Пропускная способность. При 4–8 ТБ/с простой тензорных ядер сводится к минимуму.
  2. Объём. Даже для «старой» Llama 2 70B с весами в FP16 нужно минимум 140 ГБ только под параметры, не считая активаций и градиентов. Восемь стеков HBM3E дают до 192 ГБ на одном чипе, и это позволяет масштабироваться до кластеров без критических потерь пропускной способности на межсоединениях.
  3. Энергоэффективность. Каждый джоуль, сэкономленный на передаче данных от памяти к вычислительному ядру, можно потратить на сами вычисления. Благодаря коротким линиям и низкой частоте на контактах HBM передаёт бит в несколько раз экономичнее, чем GDDR.

Поэтому NVIDIA, AMD, Intel, Google и другие разработчики ИИ-чипов выбрали HBM как безальтернативный вариант для тренировки. В 2026 году, правда, ситуация начала меняться — об этом в разделе про аналоги.

Для сравнения: у Radeon RX 480 с графическим процессором Polaris 10 микросхемы GDDR5 распаяны вокруг GPU, а не на общей с ним подложке.

Кто производит HBM

На рынке сложилась жёсткая олигополия. Три компании — SK Hynix, Samsung и Micron — владеют технологией монолитных 3D-стеков DRAM. Сейчас все трое участвуют в гонке HBM4 и параллельно разрабатывают HBM4E. Главный «судья» — NVIDIA: именно её требования к скорости и качеству определяют, чьи чипы окажутся в ускорителях Vera Rubin.

  • SK Hynix — безоговорочный лидер и главный выгодополучатель ИИ-бума. Первой начала массовое производство HBM4: в сентябре 2025 года она завершила разработку первого чипа и вышла на серию. Её 16-слойная HBM4 ёмкостью до 48 ГБ работает на скоростях свыше 2,9 ТБ/с, то есть с запасом выше стандарта JEDEC. Компания выпускает 70% HBM-чипов для Nvidia и поставляет память для AMD.
  • Micron — поставляет Nvidia 16-слойные HBM4 до 48 ГБ с упором на повышенную энергоэффективность. После возвращения Samsung в гонку доля американской компании в отгрузках упала до 18%, но она остаётся одним из крупнейших производителей HBM в мире и поставляет память, в частности, AMD.
  • Samsung — долго была отстающей, но сумела удовлетворить требования Nvidia и в феврале 2026 года начала коммерческие поставки 16-слойной HBM4 на 48 ГБ. По заявлению компании, её чипы работают на 3,3 ТБ/с, что примерно на 46% выше отраслевого стандарта в 8 Гбит/с, с возможностью разгона до 13 Гбит/с. Объёмы пока невелики, но Samsung строит заводы для утроения выпуска и ведёт разработку HBM4E со скоростью до 4 ТБ/с на стек.

Плюсы и минусы HBM

Сильные стороны:

  • пропускная способность на ватт — решающее преимущество, когда ЦОДы упираются в лимиты мощности на стойку;
  • близость к ядру — минимальные физические задержки и мало буферных каскадов;
  • компактность — на подложке освобождается место для дополнительных вычислительных кластеров или стеков HBM;
  • масштабируемость — на том же числе контактов интерпозера можно последовательно удваивать пропускную способность и объём.

Слабые стороны:

  • стоимость. Стеки с TSV, тестирование на пластине, сборка на интерпозер и жёсткие требования к термомеханической совместимости материалов делают HBM в разы дороже GDDR в пересчёте на гигабайт. Поэтому в массовых игровых картах её не используют;
  • охлаждение. Вертикальные стопки выделяют тепло неравномерно, а разные коэффициенты теплового расширения кремния, микробампов и заполнителя приводят к механическим повреждениям. Обеспечить долгосрочную надёжность при рабочих температурах около 95 °C непросто;
  • негибкость объёма. Добавить памяти или заменить блок на более ёмкий нельзя: конфигурация закладывается на этапе производства ускорителя;
  • выход годных. Дефект в критическом TSV или соединении стека бракует всю дорогую сборку. Выход улучшается, но остаётся ниже, чем у дискретной DRAM.

HBM в процессорах и потребительских видеокартах

Когда индустрия оценила возможности HBM, её попытались применить и в серверных CPU, и в потребительских GPU.

Серверные процессоры

  • Fujitsu A64FX (2020). Энергоэффективная архитектура Arm и 32 ГБ HBM2 на борту с пропускной способностью 1 ТБ/с. Процессоры стали прорывом для своего времени и использовались в суперкомпьютере Fugaku.
  • Intel Xeon Max (спустя два года). 64 ГБ HBM2E со скоростью 1 ТБ/с; Intel искусственно снизила скорость HBM2E ради стабильности. Чипы ориентировали на HPC, но решение провалилось из-за неадекватной цены и высокой конкуренции.
  • AMD MI300A (2023). APU для суперкомпьютера El Capitan, который объединил на одной подложке CPU, GPU и 128 ГБ HBM3 с пропускной способностью 5,3 ТБ/с.

Потребительские видеокарты

Здесь история поучительная. После неудачных релизов Radeon R9 Fury с 4 ГБ HBM и Radeon VII с 16 ГБ HBM2 в AMD поняли: в обычных видеокартах высокоскоростная память неуместна. Высокая стоимость полностью перебивает избыточный прирост скорости в пользовательских задачах, а им вполне хватает GDDR. Повторять за AMD никто не стал, и HBM окончательно ушла в серверный сегмент.

Альтернативы HBM

В 2026 году в поле зрения ИИ-индустрии всё чаще появляются технологии, которые должны заменить дорогую высокоскоростную память, сохранив или даже расширив её скоростные показатели.

Технология Суть Ключевые данные
HB3DM (Hybrid Bonded 3D Memory) Проект SAIMEMORY и Intel: 9-слойные стеки DRAM на базе ZAM с прямым гибридным соединением слоёв без микробампов До 5,3 ТБ/с, энергопотребление ниже на 40% относительно HBM4; прототип в 2027 году, коммерциализация в 2029-м
HBF (High Bandwidth Flash) Быстрый DRAM-буфер и массив плотной флеш-памяти в одной 3D-стопке Для задач, где важен огромный объём при высокой пропускной способности, например инференс сверхбольших моделей
HiZQ HBM Аналог HBM2E/HBM3 от китайской CXMT, позиционируется как альтернатива подсанкционным чипам HBM Легла в основу ИИ-ускорителей Huawei Atlas 950PR

Что это значит при выборе оборудования

Для практики из всего этого следует несколько выводов.

  • Если вы планируете обучение или дообучение крупных моделей, смотрите не только на TFLOPS, но и на объём и пропускную способность памяти ускорителя: именно они определяют, поместится ли модель и будет ли GPU загружен.
  • Объём HBM нельзя нарастить после покупки, поэтому его нужно закладывать сразу, с запасом под активации и градиенты.
  • Для задач, где не требуется HBM, например инференса моделей умеренного размера, часто достаточно ускорителей с GDDR: они заметно дешевле.

Подобрать серверную платформу под вашу нагрузку поможет «СервакМастер»: посмотрите раздел серверов и ИИ-серверов или свяжитесь с нами, и мы подскажем конфигурацию под вашу задачу и бюджет.

Выводы

HBM по праву можно назвать краеугольным камнем ИИ-индустрии: от доступности и эффективности этой памяти зависит, смогут ли поставщики ИИ-чипов создавать решения для самых сложных задач и масштабировать нагрузки. Путь HBM начинался в потребительских видеокартах, но сегодня она полностью заняла серверный сегмент, и возвращаться к истокам вряд ли будет. При этом на горизонте уже появляются конкуренты в лице HB3DM и HBF, которые претендуют на роль не только более быстрой, но и более экономичной альтернативы.