Память стала узким местом раньше, чем вычисления

Когда обсуждают производительность ИИ-серверов, разговор обычно сводится к ускорителям: сколько GPU в шасси, какой интерконнект, сколько HBM на борту. Оперативная память системы при этом остаётся в тени — её воспринимают как расходный ресурс, который просто должен быть в достаточном объёме.

На практике всё иначе. В платформах, где десятки ускорителей работают в одной стойке, системная память превратилась в фактор, ограничивающий и плотность компоновки, и энергетический бюджет. Классический модуль DDR5 RDIMM проектировался под универсальные серверы, и в новом контексте у него вылезли сразу три неудобных свойства.

Он крупный. Планка длиной около 133 миллиметров занимает место, которого в шасси с восемью ускорителями и жидкостным охлаждением физически нет. Он прожорливый: на передачу одного бита DDR5 тратит заметно больше энергии, чем мобильные типы памяти, а при 24 планках на узел эта разница превращается в сотни ватт. И он ограничен по частоте — наращивать её приходится ценой роста напряжения и тепловыделения.

Отсюда и появился SOCAMM — компактный модуль на памяти LPDDR5X, изначально придуманный под ИИ-платформы. Его вторая версия, SOCAMM2, получила статус отраслевого стандарта, и именно она сейчас определяет, как будет устроена системная память в серверах для обучения и инференса.

Что такое SOCAMM и откуда он взялся

Аббревиатура расшифровывается как Small Outline Compression Attached Memory Module — компактный модуль памяти с прижимным подключением. Разница с привычной планкой начинается уже здесь: SOCAMM не вставляется в слот с защёлками, а прижимается к плате винтовым креплением.

Идея выросла из очевидного противоречия. Мобильная память LPDDR давно опережает серверную DDR по энергоэффективности, но в смартфонах и ноутбуках её припаивают намертво. Для сервера это неприемлемо: память должна меняться при отказе и наращиваться при апгрейде. SOCAMM решает ровно эту задачу — берёт мобильные чипы и делает из них обслуживаемый модуль.

Первая версия появилась как решение под конкретные платформы NVIDIA и, по сути, была проприетарной. Дальше произошло то, что обычно и происходит с удачным форматом: спецификацию довели до уровня отраслевого стандарта через JEDEC — организацию, которая стандартизирует память для всей индустрии. Так возник SOCAMM2.

Статус стандарта здесь важнее технических улучшений. Пока формат принадлежит одному вендору, остальные производители не рискуют вкладываться в производство. Как только спецификация становится общей, за неё берутся все крупные игроки — а это уже конкуренция, объёмы и предсказуемые цены.

Чем LPDDR5X отличается от серверной DDR5

Разница не в скорости как таковой, а в том, какой ценой эта скорость достаётся.

Параметр DDR5 RDIMM LPDDR5X в SOCAMM2
Исходное назначение Универсальные серверы Мобильные устройства, адаптирована под серверы
Энергия на передачу бита Базовый уровень Существенно ниже
Габариты модуля Планка ~133 мм Компактный модуль, площадь в разы меньше
Подключение Слот с защёлками Прижимное, винтовое крепление
Ремонтопригодность Высокая Высокая — в отличие от распаянной LPDDR
Типичное применение Любые серверы ИИ-платформы, плотные вычислительные узлы

Ключевая экономия у LPDDR5X идёт от пониженного рабочего напряжения и более короткой длины проводников. Чем ближе чипы к контроллеру и чем ниже напряжение — тем меньше энергии уходит впустую на разгон линий связи.

В масштабах одного сервера выигрыш выглядит скромно. В масштабах стойки, где узлы стоят вплотную, а тепло приходится отводить жидкостью, экономия каждых ста ватт на узле напрямую конвертируется в число ускорителей, которые удастся разместить в том же энергетическом бюджете.

Что даёт вторая версия

SOCAMM2 развивает исходную идею по трём направлениям.

Выше пропускная способность. Рабочие частоты LPDDR5X в новой ревизии подняты относительно первого поколения, что важно для нагрузок, где системная память постоянно подкачивает данные ускорителям.

Больше ёмкость на модуль. Плотность выросла — а значит, нужный объём набирается меньшим числом модулей. Для компоновки это критично: меньше модулей означает меньше места, меньше разъёмов и меньше точек потенциального отказа.

Единый стандарт вместо проприетарного решения. Модули разных производителей становятся взаимозаменяемыми, а платформы перестают зависеть от одного поставщика.

Отдельно стоит отметить конструктив. Прижимное крепление вместо слота — не прихоть, а необходимость: при плотной компоновке и жидкостном охлаждении обычный слот с защёлками просто не выдержал бы вибрационные и температурные нагрузки, да и высота его избыточна.

Кто выпускает модули

За SOCAMM2 взялась вся большая тройка производителей памяти — Samsung, SK hynix и Micron. Для нового формата это лучший из возможных сценариев: конкуренция трёх вендоров означает, что формат не окажется заложником одного поставщика, а цены будут формироваться рынком, а не монополией.

Показательно, что все трое зашли в стандарт практически одновременно. Обычно это признак того, что спрос со стороны разработчиков платформ уже подтверждён контрактами, а не остаётся гипотезой.

Где это применяется сегодня

Основная область — платформы для обучения и инференса больших моделей, где системная память работает в связке с процессорами архитектуры ARM и ускорителями на одной плате.

Логика применения такая. У ускорителя есть собственная сверхбыстрая память HBM, но её объём ограничен. Всё, что в HBM не помещается — веса, промежуточные состояния, датасеты, — лежит в системной памяти и постоянно подкачивается. Значит, системная память должна быть одновременно большой, быстрой и энергоэффективной. SOCAMM2 закрывает все три требования сразу, чего не может ни распаянная LPDDR (не наращивается и не чинится), ни классический RDIMM (велик и прожорлив).

Второе направление — компактные вычислительные системы, где ИИ-инференс выполняется локально. Там ограничения по габаритам и питанию ещё жёстче, чем в стойке.

Придёт ли SOCAMM2 в обычные серверы

Короткий ответ: не скоро и не везде.

Причин несколько. Формат жёстко привязан к платформам, чьи контроллеры памяти рассчитаны именно на LPDDR5X — универсальный серверный процессор с ним просто не заработает. Экосистема вокруг DDR5 огромна: под неё сделаны материнские платы, охлаждение, инструменты диагностики, под неё обучены инженеры. Такой инерции хватит на годы.

Есть и содержательный аргумент. Для типовых серверных задач — виртуализации, баз данных, файловых хранилищ — преимущества LPDDR5X не решают ничего. Там на первом месте задержки, объём и цена гигабайта, а не энергия на бит. Экономия ватт имеет смысл, когда в стойке стоят десятки киловатт ускорителей; для узла на два процессора без GPU эта разница теряется в погрешности.

Вероятный сценарий — сосуществование. SOCAMM2 закрепится в ИИ-платформах и компактных вычислительных системах, DDR5 и её преемники останутся в универсальных серверах. Разделение по нишам вместо вытеснения.

Что из этого следует на практике

Если вы планируете инфраструктуру под ИИ, из появления SOCAMM2 стоит вынести две мысли.

Первая: системная память в ИИ-платформах перестала быть свободным параметром. Раньше её можно было доукомплектовать почти любыми совместимыми планками. В новых платформах тип, форм-фактор и объём памяти заданы архитектурой, и выбирать приходится на этапе покупки шасси, а не после.

Вторая: энергетический бюджет стойки стал таким же ограничением, как место в ней. Форматы вроде SOCAMM2 появились именно потому, что упёрлись не в скорость, а в ватты. При планировании ИИ-инфраструктуры считать электричество нужно наравне с юнитами.

Для владельцев обычных серверных парков ничего не меняется: DDR5 остаётся рабочим стандартом, а планки для существующих машин никуда не денутся.

Коротко

SOCAMM2 — это модульная память на мобильных чипах LPDDR5X, придуманная под ИИ-серверы и доведённая до статуса отраслевого стандарта. Она компактнее и экономичнее классических планок, при этом, в отличие от распаянной мобильной памяти, её можно менять и наращивать.

Формат решает конкретную проблему конкретного класса машин — плотных ИИ-платформ, упирающихся в габариты и энергопотребление. Заменять DDR5 в обычных серверах он не будет: там его преимущества не окупают потери в универсальности.

Если подбираете конфигурацию под ИИ-нагрузки и не уверены, какой объём системной памяти нужен под вашу модель — напишите нам, поможем рассчитать исходя из размера модели и планируемого числа параллельных запросов.