Центральные процессоры в современных серверах нередко работают совсем не над тем, ради чего их покупали. Процессор с сотнями ядер вынужден заниматься рутиной: пропускать через себя сетевые пакеты, шифровать трафик на лету, обслуживать виртуальные сетевые функции. Без этого ЦОД остановится, но такая «паразитная» нагрузка способна съедать до 30% вычислительных ресурсов чипа. Логичный ответ индустрии — вынести эту работу на отдельное специализированное железо. Сначала появились SmartNIC, а затем и новый класс устройств, DPU (Data Processing Unit), которые берут трафик на себя и разгружают CPU (offloading). Ниже разбираем, что такое DPU, как он устроен, чем отличается от SmartNIC, кто выпускает такие устройства и в каких сценариях они оправданы.

Что такое DPU

DPU — это специализированный программируемый сопроцессор. Его задача — обрабатывать потоки данных и снимать с центрального процессора всё, что не относится к бизнес-логике приложений и не связано с хостингом самой системы. Это простые, но затратные по ресурсам операции:

  • коммутация трафика;
  • межсетевое экранирование;
  • управление томами NVMe по протоколу NVMe-over-Fabrics;
  • оркестрация контейнерных сред.

DPU-карта AMD Pensando DSC2-25

DPU-карта AMD Pensando DSC2-25.

Как устроен DPU

SoC с Arm-ядрами и аппаратными блоками

В основе DPU лежит SoC-чип, но необычный. Если большинство систем-на-кристалле объединяют множество компонентов, то здесь набор логики ограничен процессорной частью на Arm-ядрах и дополнительными аппаратными блоками, ускоряющими шифрование и обработку трафика. Это не жёстко прошитый ASIC с фиксированной логикой, а самостоятельное вычислительное устройство со своей оперативной памятью. Оно исполняет код, запускает приложения и поддерживает собственную изолированную операционную систему.

Что даёт такая архитектура

Главное преимущество — изоляция инфраструктурного слоя. Даже если хостовая ОС скомпрометирована полностью, до критических сервисов, работающих на DPU, добраться не получится: ключи шифрования, политики маршрутизации и правила файрвола остаются в защищённом пространстве. Трафик арендаторов в облаке продолжает обрабатываться по заданным правилам, а данные не уходят на сторону.

Форм-фактор и связь со SmartNIC

DPU обычно выпускается как карта расширения с интерфейсом PCIe и высокоскоростными сетевыми портами для подключения к серверам, коммутаторам или СХД. Поэтому можно сказать, что DPU — это сетевая карта с Arm-процессором на борту: он напрямую продолжает идею SmartNIC и является её логической эволюцией. При этом у DPU есть всё, что полагается полноценному компьютеру: память, процессор, сеть, IPMI и прочая логика.

Основные компоненты и архитектура классического DPU-ускорителя. Источник: vInfrastructure.

Ключевые характеристики DPU

Пропускная способность и line rate

Как и для сетевых карт, главный параметр — пропускная способность. Современные DPU работают на скоростях от 200 Гбит/с до 1,6 Тбит/с. Но цифры на порту — ещё не всё: критично, чтобы устройство обрабатывало трафик на полной скорости линии (line rate), то есть справлялось с потоком пакетов минимального размера без задержек. Это достигается аппаратными конвейерами обработки пакетов, встроенными в SoC, и оптимизированными на аппаратном уровне путями передачи данных.

Вычислительная часть и память

Вычислительная основа DPU всегда строится на ядрах Arm:

Параметр Типичные значения
Ядра в современных DPU Arm Neoverse N1 или N2
Ядра в ранних устройствах Cortex-A78
Количество ядер от 16 до 64
Оперативная память от 32 до 128 ГБ LPDDR5 (в ранних моделях — DDR4 или DDR5)

По числу ядер это сопоставимо с серверными процессорами начального уровня, а объём памяти позволяет разворачивать на DPU полноценные ОС и достаточно сложное ПО, не обращаясь к ресурсам хоста.

Интерфейс подключения

С хост-системой DPU связан по шине PCI Express. Актуальные модели используют PCIe 5.0 в конфигурациях x16 или даже x32 линий — этого хватает для обработки сетевого трафика и команд управления. На подходе решения с PCIe 6.0, которые обещают двукратный прирост пропускной способности относительно пятого поколения.

Аппаратные движки

Отдельного упоминания заслуживают специализированные блоки под конкретные задачи:

  • криптографические ускорители с поддержкой AES, SHA и RSA;
  • движки сжатия и дедупликации данных на лету;
  • аппаратная эмуляция NVMe-устройств;
  • движки обработки RDMA-трафика;
  • подсистемы сбора телеметрии.

Программируемость

Благодаря полноценным процессорным ядрам и поддержке фреймворков для разработки DPU отличается от примитивных ASIC и FPGA. На нём можно развернуть собственные сетевые функции, уникальные политики безопасности и любые сервисы обработки данных. Фреймворки вроде NVIDIA DOCA позволяют описать нужное поведение сетевого конвейера на высокоуровневом языке и скомпилировать его в конфигурацию аппаратных ресурсов чипа. Итог — производительность ASIC при гибкости программного обеспечения.

DPU-карты AMD Pensando DSC2-25 и Nvidia Connect X6 200Gb/s.

Основные производители DPU

DPU — решение для корпоративных заказчиков, а там, где корпоративные заказчики, неизбежно появляются три крупнейших игрока: NVIDIA, AMD и Intel.

NVIDIA BlueField-4

Флагманом NVIDIA на ближайшие годы станет BlueField-4. Он займёт место в передовых ИИ-системах на базе будущих ускорителей Rubin. Это гибрид, объединяющий процессор Grace, сетевой контроллер ConnectX последнего поколения и значительный объём энергоэффективной памяти.

  • Сеть: контроллер ConnectX-9 SuperNIC с пропускной способностью 1,6 Тбит/с и поддержкой 800G Ethernet. Есть аппаратное ускорение RoCEv2, поддержка InfiniBand и сверхнизкие задержки.
  • Вычисления: 64-ядерный процессор NVIDIA Grace на архитектуре Arm Neoverse V2 со 114 МБ кэша L3. Производительность вычислительной подсистемы выросла в шесть раз по сравнению с BlueField-3 для экосистем Blackwell и Blackwell Ultra.
  • Память: 128 ГБ LPDDR5 и встроенный твердотельный накопитель на 512 ГБ для кода операционной системы и рабочих данных инфраструктурных сервисов.
  • Подключение: PCIe 6.0, 16 линий.
  • Ускорители: криптографические движки, эмуляция NVMe-over-Fabrics, блоки GPUDirect Storage для прямой передачи данных из сетевых хранилищ в память GPU и аппаратное ускорение RoCEv2.

Nvidia BlueField-4. Источник: Nvidia.

AMD Pensando Salina 400

Ответ AMD на BlueField-4 — DPU-карты Pensando Salina 400. Они ориентированы на стандартные Ethernet-сети корпоративных дата-центров и облачных платформ на серверах AMD EPYC.

  • Сеть: 400 Гбит/с, поддержка RoCEv2 и традиционного RDMA (без требований к Ultra Ethernet). Программируемый P4-движок обрабатывает до 80 миллионов пакетов в секунду и устанавливает до 2 миллионов новых соединений в секунду.
  • Вычисления: P4-движок второго поколения со 128 ядрами MPU (Match Processing Unit). В архитектуре есть Table Engine для аппаратной генерации ключей хеш-таблиц, поддержка атомарных операций во встроенной SRAM и аппаратное преобразование виртуальных адресов в физические. Когерентности кеша с хост-системой нет, что снижает сложность интеграции.
  • Память: встроенная SRAM на 64 МБ для таблиц состояний и очередей.
  • Подключение: PCIe Gen5 x16. В отличие от старших моделей, InfinityFabric здесь не используется: к процессорам EPYC и ускорителям Instinct карта подключается через стандартные коммутаторы PCIe или Ethernet.
  • Ускорители: программируемый P4-конвейер с фиксированными шаблонами обработки, аппаратная поддержка RoCEv2 с базовыми параметрами и статическая балансировка нагрузки на основе хеширования, без адаптации к состоянию сети.

AMD Pensando Salina 400. Источник: AMD.

Intel IPU E2200 (Mount Morgan)

Intel называет свои DPU инфраструктурными процессорами (IPU). Модель E2200 с кодовым именем Mount Morgan нацелена на разгрузку и ускорение нагрузок в дата-центрах на платформе Intel Xeon. Линейка IPU появилась ещё в 2021 году, так что Intel по праву считается пионером DPU-сопроцессоров. Первые IPU строились на FPGA Agilex и лишь затем эволюционировали в полноценные SoC с Arm-ядрами.

  • Сеть: суммарная пропускная способность 400 Гбит/с (вдвое больше, чем у E2100) и поддержка RoCE v2.
  • Вычисления: до 24 ядер Arm Neoverse N2 и 32 МБ кеша L3. В предыдущем E2100 Mount Evans было 16 ядер.
  • Память: четыре канала LPDDR5-6400 объёмом до 64 ГБ.
  • Подключение: PCIe 5.0, 16 линий.
  • Ускорители: P4-программируемый процессор пакетов FXP, встроенный криптографический движок с IPsec и PSP с настройкой для каждого потока, модуль Traffic Shaper (алгоритм Timing Wheel) и выделенный блок Look-Aside для компрессии и шифрования.

Intel IPU E2200. Источник: Intel.

Другие производители

Рынок DPU не ограничивается тремя гигантами. Другие компании разрабатывали или продолжают разрабатывать собственные решения, но часть из них вытеснена или переориентирована на иные ниши.

  • Broadcom Stingray PS250 — устаревшая линейка на SoC BCM58800: 8 ядер Cortex-A72, контроллер NetXtreme E-Series 100G (суммарно 200 Гбит/с) и три канала DDR4-2400. Ставка сделана на глубокую аппаратную разгрузку NVMe-oF и сетевых функций. Несмотря на возраст, Stingray PS250 активно используется в облачной инфраструктуре Baidu.
  • Marvell Octeon 10 — DPU на базе Arm Neoverse N2 с поддержкой до 400G Ethernet, встроенными крипто-движками и аппаратными акселераторами для 5G и сетевой безопасности. Позиционируется для операторов связи и периферийных вычислений.
  • Kalray Coolidge2 — французская разработка на массиве из 80 ядер KV3 (архитектура VLIW) с пропускной способностью до 200 Гбит/с. Ориентирована на детерминированную обработку данных с низкой задержкой в аэрокосмической и автомобильной отраслях, хотя изначально претендовала на сегмент ЦОД.
  • Xsight Labs — израильский стартап с чипом X2: 400 Гбит/с Ethernet, программируемый конвейер и упор на сверхнизкое энергопотребление (до 60 Вт на 400G). Решение рассчитано на гиперскейлеров и облачных провайдеров, которые хотят снизить операционные расходы.

Где применяются DPU

DPU находят применение в разных сегментах IT: они разгружают центральные процессоры и повышают эффективность инфраструктуры. Основные сценарии выглядят так.

Облака и гиперскейлеры

Здесь DPU полностью снимают с хостового CPU инфраструктурные задачи: виртуализацию сетевых функций, управление распределёнными хранилищами, изоляцию арендаторов, реализацию политик безопасности. Такие технологии используют крупнейшие провайдеры — AWS Nitro, Microsoft Azure Boost DPU и Alibaba Cloud X-Dragon. Благодаря DPU в облаке можно отдавать bare-metal серверы с управляемостью и безопасностью на уровне виртуальных машин.

Корпоративные ЦОД

DPU позволяют собрать инфраструктурные сервисы на выделенном устройстве: распределённый межсетевой экран, балансировку сетевой нагрузки, шифрование трафика, доступ к удалённым томам NVMe-over-Fabrics. Нагрузка на процессоры серверов снижается, а управление инфраструктурой упрощается.

ИИ-инфраструктуры

Здесь DPU обеспечивают графическим ускорителям быстрый доступ к данным. Технология GPUDirect Storage в DPU NVIDIA передаёт данные из сетевых хранилищ прямо в память GPU. Кроме того, DPU применяются для построения высокоскоростных сетей на RoCEv2 или InfiniBand, объединяющих тысячи ускорителей в единую вычислительную систему. Если вам интересна эта тема, посмотрите наши серверы для ИИ.

Нужен ли DPU небольшой компании

Резонный вопрос: есть ли смысл в DPU для энтузиаста или компании с парой вычислительных нод в стойке? Если говорить прямо, нет. В единичном сервере DPU станет дорогой игрушкой. Поставить, например, NVIDIA ConnectX-8 или ConnectX-9 с мощным Arm-процессором на борту и использовать лишь малую долю его возможностей по офлоаду и оркестрации — удовольствие сомнительное. Экономический эффект DPU раскрывается на масштабе ЦОД, когда речь идёт о стойках и кластерах, а нагрузка от трафика на процессор действительно велика.

Процесс настройки IPMI-доступа с хостингом на DPU.

Выводы

В реалиях гигаваттных ЦОД DPU — не просто полезная опция, а технология, без которой трудно построить по-настоящему эффективную вычислительную инфраструктуру, где процессоры выполняют полезную работу, а не перекладывают пакеты. Высвобождение ядер CPU, повышение безопасности за счёт аппаратной изоляции и заметное снижение энергопотребления инфраструктурного слоя делают DPU обязательным компонентом серьёзной облачной или корпоративной платформы. Но это решение не для всех.

Если ваши задачи уже переросли любительский уровень и вы планируете эффективную и безопасную серверную инфраструктуру, специалисты «СервакМастер» помогут подобрать как DPU, так и любое другое оборудование из каталога серверов, а также настроят всё необходимое под ваши задачи, чтобы сервер был готов к работе с первого дня. Обсудить конфигурацию можно через страницу контактов.