MLPerf Training 5.0: AMD впервые уверенно обходит NVIDIA H200

4 июня 2025 года отраслевое сообщество получило результаты MLPerf Training 5.0 — пожалуй, самого авторитетного независимого бенчмарка для ускорителей машинного обучения. Этот раунд стал историческим для AMD: компания не просто «участвовала», а сумела обойти NVIDIA на конкретных задачах. В данном материале СервакМастер подробно разбирает итоги, цифры и практические выводы для тех, кто выбирает аппаратную платформу для обучения нейросетей.


Почему MLPerf Training важен для выбора ИИ-ускорителя

MLPerf Training измеряет реальную скорость обучения актуальных нейросетевых моделей в стандартизированных условиях. В отличие от пиковых TFLOPS, которые производители указывают в характеристиках, бенчмарк фиксирует время до достижения заданной точности модели — то есть то, что реально важно при промышленной эксплуатации.

В раунде 5.0 ключевой задачей стала тонкая настройка модели Llama* 2-70B методом LoRA (Low-Rank Adaptation). Этот подход активно применяется в корпоративном секторе: крупные языковые модели дообучаются на внутренних данных компании при существенно меньших затратах, чем при полном обучении с нуля. Замораживается большинство весов модели, обновляется лишь небольшой набор дополнительных параметров — это снижает требования к памяти и вычислительным ресурсам GPU в разы.

AMD выставила на тестирование два ускорителя:

  • Instinct MI300X — актуальный флагман предыдущего поколения
  • Instinct MI325X — обновлённая версия с памятью HBM3E увеличенного объёма

Ключевые результаты: AMD обгоняет Hopper

MI325X быстрее H200 на 8%

Наиболее резонансный результат раунда — AMD Instinct MI325X опередил NVIDIA H200 по скорости обучения Llama* 2-70B-LoRA приблизительно на 8%. Это не техническая погрешность и не маркетинговый приём: речь идёт об измеренном времени завершения задачи в сопоставимых конфигурациях.

Важный контекст: H200 относится к поколению Hopper. Сравнение происходит именно с ним, а не с новейшими ускорителями на архитектуре Blackwell. Тем не менее Hopper ещё год назад считался недосягаемым для AMD — и факт обгона говорит о реальном качественном скачке в развитии платформы Instinct.

MI300X быстрее H100 на 4%

Менее флагманский Instinct MI300X превзошёл NVIDIA H100 на те же задачи обучения примерно на 4%. Разрыв скромнее, зато с учётом доступности MI300X на рынке и его конкурентного ценообразования — это весомый аргумент для заказчиков, которые не могут позволить себе ждать H100 из квот.


OEM-результаты: как показали себя разные платформы

В MLPerf Training 5.0 приняли участие не только референсные конфигурации AMD, но и серверные системы крупнейших производителей. Все они решали одну задачу — обучение Llama* 2-70B-LoRA — в различных аппаратных окружениях.

Supermicro — лучший результат на MI325X

Supermicro представила систему на базе Instinct MI325X с жидкостным охлаждением и зафиксировала время обучения 21,75 минуты — лучший показатель среди всех платформ MI325X. Жидкостное охлаждение обеспечило стабильный тепловой режим и позволило ускорителям работать на полной мощности без троттлинга на протяжении всего теста.

MangoBoost — масштабирование MI300X

MangoBoost продемонстрировала, как линейно масштабируется производительность платформы MI300X при наращивании числа ускорителей:

Конфигурация Время обучения
8 GPU MI300X 29,6 мин
16 GPU MI300X 16,32 мин
32 GPU MI300X 10,92 мин

Практически линейное ускорение — признак зрелой межузловой коммуникации и отсутствия узких мест в программном стеке ROCm при кластерном обучении.

Dell — надёжный средний результат

Dell с платформой на 8 GPU Instinct MI300X завершила обучение за 28,99 минуты. Результат чуть лучше, чем у Oracle, и близок к среднему по группе MI300X — стабильная коммерческая платформа без сюрпризов.

Oracle — нижняя граница по MI300X

Oracle показала наименее быстрый результат в группе: 30,42 минуты на 8 GPU MI300X. По всей видимости, облачная сетевая инфраструктура вносит дополнительные задержки, которые сказываются на общем времени тренировочного прогона.

Gigabyte — MI325X в стандартной воздушной сборке

Gigabyte с 8 GPU MI325X показала 22,1 минуты — результат немного хуже, чем у Supermicro с жидкостным охлаждением, но заметно лучше всех MI300X-конфигураций.

QCT — подтверждение стабильности MI325X

QCT с аналогичной конфигурацией из 8 GPU MI325X завершила задачу за 22,43 минуты, подтвердив воспроизводимость результатов этого ускорителя в типовых серверных сборках.


MI325X против MI300X: разрыв внутри линейки AMD

Сравнение результатов двух поколений даёт чёткую картину: Instinct MI325X быстрее MI300X примерно на 30% в задачах обучения LLM. Разница обусловлена рядом архитектурных улучшений:

  • Увеличенный объём памяти HBM3E — больше данных помещается «рядом» с вычислительными ядрами
  • Более высокая пропускная способность памяти — меньше ожиданий на передачу весов и активаций
  • Улучшенная поддержка смешанной точности — эффективнее используются возможности FP8

Для практического выбора это означает следующее: если предстоит регулярное обучение моделей уровня 70B и выше — MI325X окупит свою более высокую стоимость. Для инференса и дообучения моделей небольшого масштаба MI300X по-прежнему остаётся экономически выгодным вариантом.


ROCm v6.5: программный стек как конкурентное преимущество

Высокие результаты AMD в MLPerf Training 5.0 — это не только история о железе. Ускорители Instinct работали под управлением ROCm v6.5 — версии, которая на момент публикации результатов ещё не была общедоступна. Именно программный стек обеспечил значительную часть прироста производительности.

Ключевые программные компоненты, использованные в тестировании:

  • Flash Attention — значительно снижает потребление памяти при длинных входных последовательностях, что критично для больших языковых моделей
  • Transformer Engine — оптимизирует вычисления в режиме смешанной точности FP8/BF16
  • Оптимизированные алгоритмы обновления весов — ускорение на уровне оптимизатора
  • Готовые Docker-контейнеры — воспроизводимое окружение, исключающее неожиданные вариации в результатах

AMD последовательно устраняет программные пробелы, которые ещё несколько лет назад делали ROCm несопоставимым с CUDA. Сегодня для задач тонкой настройки LLM экосистема ROCm уже не является «вторым выбором» — она полноценно конкурирует с CUDA по удобству и итоговой производительности.


Где находится NVIDIA сегодня

Честный разбор не должен обходить стороной актуальное положение дел в лагере NVIDIA. В MLPerf Training 5.0 компания представила ускорители GB200 на архитектуре Blackwell — и их показатели существенно превосходят MI325X:

  • 8 GPU GB200 (кластер NVL72): обучение Llama* 2-70B-LoRA завершено за 10,34 минуты
  • Это более чем в два раза быстрее, чем лучший результат на MI325X (21,75 мин у Supermicro)
  • Обучение Stable Diffusion v2 на GB200 заняло 12,86 минуты
  • Кластер из 512 чипов GB200 (NVL72) обучил Llama* 3.1 405B за 121,09 минуты

Другими словами, AMD сегодня опережает Hopper, но по-прежнему отстаёт от Blackwell примерно в два раза. Это отставание на одно поколение — ожидаемая и понятная ситуация. Ни одна компания не может выпускать флагманские архитектуры одновременно.


Что AMD анонсировала на Advance AI 2025

На конференции Advance AI 2025 AMD раскрыла планы на следующее поколение: ускорители Instinct MI350X и Instinct MI355X. Если темп прогресса сохранится — а переход от MI300X к MI325X дал +30% — то MI350X/MI355X могут существенно сократить разрыв с Blackwell.

При этом NVIDIA уже работает над архитектурой Rubin, которая придёт на смену Blackwell. Гонка ускорителей продолжается, и AMD явно не собирается уступать.


Практические выводы для выбора ИИ-платформы

Результаты MLPerf Training 5.0 дают несколько конкретных ориентиров:

  • MI325X — обоснованный выбор для тех, кто регулярно дообучает LLM размером 70B+. Превосходство над H200 подтверждено независимым тестированием.
  • MI300X — экономичная альтернатива H100 с небольшим преимуществом в скорости и доступностью на рынке.
  • GB200 (Blackwell) недосягаем по пиковой производительности, но требует соответствующего бюджета и инфраструктуры.
  • ROCm зрелый — переход с CUDA больше не означает потерю производительности или удобства в задачах обучения LLM.

Если вы рассматриваете сборку ИИ-сервера на базе AMD Instinct MI300X или MI325X, специалисты СервакМастер помогут подобрать оптимальную конфигурацию под ваши задачи и бюджет. Свяжитесь с нами через форму на сайте.


Итог

AMD уверенно дебютировала в MLPerf Training 5.0, обойдя NVIDIA H200 на Instinct MI325X и H100 на MI300X. Программный стек ROCm v6.5 сыграл ключевую роль в этом результате. Отставание от Blackwell сохраняется, но оно укладывается в нормальный цикл смены поколений — и следующие продукты AMD уже на подходе.


*LLAMA — проект Meta Platforms Inc.**, деятельность которой в России признана экстремистской и запрещена

**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена