Что такое ACE и зачем он появился

В начале 2025 года AMD и Intel объединили усилия в рамках инициативы x86 Ecosystem Advisory Group (EAG) — совместного органа, созданного для укрепления позиций x86-архитектуры перед нарастающим давлением ARM и RISC-V. Практическим итогом этой работы стала публикация финальной спецификации ACE (AI Compute Extensions) — стандарта матричного ускорения, рассчитанного на весь спектр x86-платформ: от потребительских ноутбуков до высоконагруженных серверов в центрах обработки данных.

Ключевые цифры, которые сразу привлекают внимание: вычислительная плотность ACE в 16 раз превышает AVX10, а среди коммерческих x86-процессоров стандарт первым реализует аппаратную поддержку форматов OCP MX с блочным масштабированием.


Почему AVX недостаточно для современных AI-нагрузок

Матричное умножение лежит в основе практически любой задачи машинного обучения — от обучения трансформерных моделей до инференса LLM в продакшене. Традиционные SIMD-расширения семейства AVX изначально проектировались для векторных, а не матричных операций. Это накладывает принципиальные ограничения:

  • Векторная модель регистров плохо отображается на двумерную природу матричного умножения
  • Максимум 64 умножения за такт на 512-битных AVX-векторах — недостаточно для современных AI-воркнагрузок
  • Отсутствие нативной поддержки форматов малой точности: FP8, MX FP4 и аналогичных

AVX-512 при всех своих достоинствах создал и дополнительную проблему: разные производители реализовывали разные подмножества, что порождало фрагментацию и непредсказуемое поведение. ACE проектировался с учётом этого опыта.


Архитектура ACE: Tile-регистры и операция outer-product

Вместо привычной одномерной модели векторных регистров ACE вводит восемь двумерных Tile-регистров размером 16×16 с 32-битной точностью. Центральная вычислительная операция — outer-product (внешнее произведение).

Как работает одна такая операция на аппаратном уровне:

  1. На вход поступают два 512-битных AVX-регистра, каждый из которых представляет матрицу 16×4 с 8-битными элементами.
  2. На каждом из 256 пересечений сетки 16×16 аппаратура вычисляет скалярное произведение между строковым вектором 1×4 и столбцовым вектором 4×1.
  3. Все 256 результатов одновременно накапливаются в Tile-регистре — это и есть суть матричного ускорения.
  4. Итоговое количество умножений за такт — 1024 против 64 у AVX.

Принципиально важный момент: ACE не вытесняет AVX10, а надстраивается над ним. Tile-регистры физически разделяют хранилище с AVX10-регистрами, что обеспечивает обратную совместимость. Процессор с поддержкой ACE v1 обязан реализовывать определённый базовый набор инструкций AVX10.2.


Поддерживаемые форматы данных

Спецификация охватывает 11 форматов, закрывая как классические вычислительные задачи, так и современные требования AI-инференса:

Стандартные форматы:

  • INT8, INT32
  • FP32 (одинарная точность)
  • FP16, BF16 (половинная точность)
  • FP8 по стандарту OCP OFP8

Масштабируемые форматы OCP MX — впервые в коммерческих CPU:

  • MX FP8
  • MX FP6
  • MX FP4
  • MX INT8

Форматы серии MX (Microscaling) применяют блочное масштабирование: группам элементов назначается общий коэффициент, позволяя существенно снизить объём передаваемых данных при незначительной потере точности. Именно эти форматы сегодня используются в GPU для квантования LLM. Когда аналогичная поддержка появится в CPU, x86-серверы смогут выполнять инференс квантованных моделей напрямую — без обязательной выгрузки задач на отдельный AI-ускоритель.


Программная поддержка и экосистема

Аппаратные расширения имеют ценность только при наличии зрелого программного стека. AMD и Intel заявили об активном внедрении поддержки ACE в ключевые инструменты:

  • NumPy и SciPy — основа научных вычислений на Python
  • PyTorch — доминирующий фреймворк для обучения и инференса нейронных сетей
  • TensorFlow — широко применяется в промышленных ML-пайплайнах

Интеграция на уровне этих библиотек означает практическую ценность для разработчиков: использовать ускорение ACE можно будет без переписывания существующего кода — достаточно обновить зависимости.


Что ACE означает для серверного рынка

Появление единого согласованного стандарта — в отличие от исторически фрагментированного AVX-512 — принципиально меняет расклад:

  • Единый программный интерфейс избавляет разработчиков от необходимости писать vendor-specific код под каждого производителя
  • Совместимость оборудования: серверы на базе ACE-процессоров будут работать с единым AI-стеком вне зависимости от того, AMD или Intel внутри
  • Снижение зависимости от GPU: x86-серверы смогут конкурентоспособно обрабатывать квантованные модели без дополнительных ускорителей в ряде задач инференса

Процессоры с поддержкой ACE пока не анонсированы серийно, а широкое появление технологии на рынке ожидается не ранее 2027 года. Тем не менее публикация финальной спецификации — значимый сигнал: x86-платформа движется к унифицированной экосистеме ИИ-ускорения, способной на равных конкурировать с ARM-решениями, где аналогичные матричные расширения (SME/SME2) уже реализованы в железе.


Итог

ACE — это не очередное расширение набора инструкций, а согласованная архитектурная стратегия двух крупнейших производителей x86. Стандарт обеспечивает 1024 умножения за такт против 64 у AVX, вводит Tile-регистры 16×16, поддерживает 11 форматов данных включая OCP MX и органично встраивается в ведущие AI-фреймворки. В СервакМастер мы отслеживаем развитие серверных архитектур и готовы проконсультировать вас по выбору актуального оборудования под текущие и перспективные ИИ-задачи.