Говоря о «самой быстрой памяти», большинство сразу вспоминает HBM: именно она стала символом огромной пропускной способности в ускорителях Nvidia и AMD. Но у HBM есть конкурент, который по скорости опережает и нынешние, и будущие поколения этой памяти. Это не секретная разработка закрытых лабораторий, а SRAM, которая с 1963 года, то есть больше шести десятилетий, работает кэшем процессоров и оперативной памятью микроконтроллеров. Сегодня она возвращается в центр внимания благодаря ИИ-инференсу. Ниже инженеры «СервакМастер» разбирают, как SRAM устроена, за счёт чего достигает десятков и сотен ТБ/с и как выглядит рядом с DRAM и HBM.
Что такое SRAM
Static Random-Access Memory, или статическая память, относится к энергозависимым типам. Каждый бит хранится в небольшой схеме из нескольких транзисторов, образующих бистабильную ячейку: она находится в одном из двух устойчивых состояний, «0» или «1». Пока на ячейку подаётся питание, данные не меняются и не требуют регенерации. Этим SRAM принципиально отличается от DRAM и HBM, где бит живёт в виде заряда конденсатора, а заряд приходится постоянно подновлять.
Отсюда следует главное свойство SRAM, скорость. Чтобы считать бит, не нужно заряжать конденсатор до нужного уровня и ждать, пока усилитель различит слабый сигнал: данные доступны практически сразу после запроса. Задержка измеряется единицами наносекунд, тогда как у DRAM это десятки наносекунд.
Четыре разновидности ячеек
По числу транзисторов в ячейке SRAM делится на четыре типа:
| Тип ячейки | Особенности | Где применяется |
|---|---|---|
| 4T | Вместо p-канальных транзисторов стоят высокоомные резисторы. В теории площадь меньше, но через нагрузочные резисторы постоянно утекает ток, поэтому потребление выше, чем у 6T | Практически не используется в современных решениях |
| 6T | «Золотой стандарт»: баланс площади, стабильности и энергопотребления. Занимает до 60% площади современных SoC | Кэш CPU и новейшие ИИ-ускорители |
| 8T | Два дополнительных транзистора позволяют одновременно читать и записывать данные, что заметно повышает пропускную способность, но ячейка больше примерно на 15-20% | Кэш L1, где важна минимальная задержка |
| 10T | Ещё больше транзисторов для ускорения чтения и записи; оптимизирована для сверхнизких напряжений питания | Энергоэффективные схемы |
Цена скорости: площадь кристалла
Быстрота SRAM оплачивается площадью. Типичная ячейка состоит из шести транзисторов, а ячейка DRAM — из одного транзистора и одного конденсатора. На кристалле фиксированного размера помещается ограниченное число транзисторов, поэтому при тех же затратах SRAM получается заметно меньше, чем DRAM. Объёмы соответствуют: от нескольких килобайт в кэшах CPU до 500 мегабайт на ускоритель или нескольких сотен гигабайт на стойку, в то время как DRAM считается гигабайтами и терабайтами. Цена за бит у SRAM на порядки выше, поэтому её ставят только там, где скорость критична: в кэшах процессоров и буферах высокопроизводительных чипов.
Решить проблему переходом на более тонкий техпроцесс пока не получается. Раньше считалось, что ячейка SRAM будет уменьшаться почти так же линейно, как логика. Но начиная с 5-нм техпроцесса выяснилось, что при дальнейшем сжатии транзисторов падает стабильность, растут токи утечки, и ячейка перестаёт надёжно держать данные без дополнительных ухищрений. На 3-нм плотность SRAM составляет около 38 мегабайт на квадратный миллиметр, тогда как старые дорожные карты обещали как минимум сотню. Поэтому индустрия ищет другие пути наращивания ёмкости; о них речь пойдёт ниже.
SRAM, DRAM и HBM: сравнение
Положение SRAM проще понять на фоне двух других участников рынка. Выбор между ними всегда компромисс.
SRAM
Безусловный лидер по скорости: задержка менее 10 нс, нет циклов обновления, стабильная работа на максимальных частотах. Платой служит площадь: ячейке SRAM нужно в 4-6 раз больше транзисторов, чем DRAM. При том же техпроцессе объём выходит заметно меньше, а цена бита на порядки выше. К тому же масштабирование практически остановилось: площадь ячейки почти не сокращается с переходом на новые нормы, и наращивать объём на кристалле всё дороже.
DRAM
Массовый стандарт оперативной памяти. Один транзистор и один конденсатор на ячейку дают высокую плотность и низкую цену за бит. Задержки при этом на порядок выше: 50-100 нс на первый доступ, плюс регулярные циклы обновления, во время которых память недоступна для чтения и записи.
HBM
Строго говоря, это не отдельный тип памяти, а вертикальная стопка слоёв DRAM. Преимущество — огромная пропускная способность: 1,2 ТБ/с на стек HBM3E благодаря 1024-битной шине, по которой данные идут параллельно. Недостатки — цена, сложность производства и всё та же DRAM-задержка в десятки наносекунд. Для непрерывной подачи больших массивов данных в ИИ-ускорители HBM подходит отлично, но по времени отклика до первого байта в разы уступает SRAM.
Где используется SRAM
В центральных процессорах
Традиционная роль SRAM — кэш уровней L1-L3, где хранятся самые «горячие» данные рядом с вычислительным ядром.
- L1. Самый быстрый и расположенный ближе всего к исполнительным блокам. Размер ограничен: 32-64 КБ на инструкции и столько же на данные. Применяются 8T-ячейки, оптимизированные под минимальную задержку, зачастую по гарвардской схеме с раздельными шинами для инструкций и данных. Доступ занимает 1-3 такта.
- L2. Крупнее: от 256 КБ до 1 МБ на ядро или пару ядер, в зависимости от дизайна. Здесь уже используется более плотная 6T-SRAM; ёмкость растёт ценой небольшого увеличения задержки до 10-20 тактов.
- L3 (LLC, Last Level Cache). Самый вместительный: от 2 до 192 МБ и более, общий для всех ядер. Построен на высокоплотной 6T-SRAM с низким энергопотреблением в режиме хранения. Задержка составляет 20-50 тактов, но его главная задача — не скорость, а защита от обращений в DRAM: каждый промах мимо L3 означает поход в основную память и 100 и более тактов простоя.
Для серверных задач это объясняет, почему объём L3 так важен для баз данных и виртуализации. Подобрать процессор под вашу нагрузку можно в разделе серверов.
В ИИ-ускорителях
Когда индустрия вспомнила о достоинствах SRAM, у ряда ИИ-стартапов возник вопрос: если память настолько быстрая, почему не использовать её в самих ускорителях? Идея оказалась удачной.
Причина в природе инференса больших языковых моделей. Фаза декодирования, то есть генерация каждого следующего токена, упирается не столько в вычислительную мощность ядер, сколько в скорость выгрузки весов модели из памяти. У HBM эта скорость ограничена шириной шины и у топовых GPU достигает 3,35-8 ТБ/с. Если же разместить память на самом кристалле и использовать SRAM, пропускная способность вырастает до десятков и сотен ТБ/с. Поэтому ускорители вроде Groq 3 LPU (150 ТБ/с) в реальных задачах обходят конкурента на HBM3e более чем на 140%, несмотря на скромный объём SRAM.
Вот ускорители, которые первыми стали применять SRAM вместо привычной HBM.
Groq 3 LPU. Типичная ставка на чистую SRAM как основную память для весов, а не просто кэш. Чип третьего поколения несёт 500 МБ встроенной SRAM и обеспечивает 150 ТБ/с. Это даёт от 750 до 1665 токенов в секунду при батче 1. Обратная сторона: для запуска моделей уровня Llama-3 70B нужны сотни чипов, собранных в стойки LPX.
Cerebras WSE-3. Один чип размером со всю 300-мм пластину, внутри 44 ГБ SRAM и пропускная способность памяти 21 ПБ/с. Благодаря этому достигаются скорости свыше 2500 токенов/с на больших моделях без дополнительных коммутаторов. Платой становится огромное энергопотребление: около 27 кВт на одну стойку CS-3.
d-Matrix Corsair. Гибридный подход с упором на compute-in-memory. Каждый ускоритель несёт 2 ГБ выделенной SRAM-памяти с пропускной способностью до 150 ТБ/с. Самое интересное, что ячейки этой SRAM модифицированы так, чтобы выполнять умножение прямо внутри памяти (all-digital compute-in-memory) без пересылки данных в вычислительную логику. Для весов, которые не помещаются в SRAM, есть медленная память: 256 ГБ LPDDR5.
SambaNova RDU. В чипе SN40L трёхступенчатая иерархия: 520 МБ распределённой SRAM на кристалле, 64 ГБ HBM на упаковке и большой пул DDR вне кристалла. SRAM здесь не хранит всю модель, а служит самым быстрым буфером для активных блоков. Благодаря реконфигурируемой потоковой архитектуре загрузка моделей между уровнями памяти ускоряется до 100 раз по сравнению с обычными GPU.
Куда движется SRAM
Хотя масштабирование на планарных техпроцессах упёрлось в предел, развитие технологии продолжается. Основных направлений четыре.
- Стэкирование SRAM. С помощью TSV из SRAM-кристаллов можно собирать многослойные «сэндвичи» по аналогии с тем, как в HBM стопкой укладываются слои DRAM. Это резко повышает плотность и открывает путь к ёмкости вплоть до терабайтов на чип. Именно такую технологию AMD применяет для мощного кэша в настольных процессорах Ryzen 3D V-Cache.
- Вертикальная интеграция. Вместо попыток уместить крупную SRAM на одной подложке с вычислительными кристаллами рассматривается размещение SRAM прямо поверх ИИ-чипов с использованием Backside Power Delivery в техпроцессе TSMC A16: так растёт полезная площадь и ещё больше повышается пропускная способность. Предположительно, именно такая компоновка будет в следующем поколении LPU Groq 4 в связке с решениями Nvidia Feynman.
- Новые ячейки. Разрабатываются 3D-ячейки SRAM, где NMOS- и PMOS-транзисторы разнесены по разным слоям: это сокращает площадь ячейки и уменьшает паразитные ёмкости. Существуют прототипы с плотностью, близкой к DRAM, при сохранении скоростных свойств SRAM.
- Compute-in-memory. Логика внутри SRAM выполняет простые операции, например сложение и умножение, прямо в массиве памяти, не тратя время и энергию на перемещение данных в CPU или GPU. Для ИИ-инференса это означает матричное умножение непосредственно в ячейках с огромной скоростью.
Выводы
SRAM остаётся краеугольным камнем высокопроизводительных вычислений почти шесть десятилетий, и, несмотря на трудности масштабирования, её позиции в обозримом будущем выглядят прочно. Ни HBM, ни GDDR, ни другие виды DRAM не сравнятся с ней по задержкам. Расплата за это неизбежна: небольшая ёмкость и высокая стоимость SRAM-кристаллов, когда объём памяти требуется довести до нескольких сотен гигабайт. Однако для тех, кто готов платить за минимальные задержки в ИИ-инференсе, эти ограничения несущественны, что показали Nvidia в чипах Groq 3 LPU и стартап Cerebras в «царь-чипах» WSE. Пока капитальные затраты на SRAM в ИИ-инфраструктуре оправданы лишь в сценариях инференса, но и это ограничение может исчезнуть в ближайшем будущем.
Что это значит при выборе оборудования
Для большинства компаний универсальным решением по-прежнему остаются серверы на GPU с HBM: они гибко подходят и для обучения, и для инференса. Специализированные SRAM-ускорители имеют смысл там, где главный критерий — число токенов в секунду на небольшом батче. Подобрать конфигурацию под вашу задачу можно в разделе ИИ-серверов, а если нужна консультация инженера, напишите нам через страницу контактов.
