MLPerf Training 5.0: AMD впервые уверенно обходит NVIDIA H200
4 июня 2025 года отраслевое сообщество получило результаты MLPerf Training 5.0 — пожалуй, самого авторитетного независимого бенчмарка для ускорителей машинного обучения. Этот раунд стал историческим для AMD: компания не просто «участвовала», а сумела обойти NVIDIA на конкретных задачах. В данном материале СервакМастер подробно разбирает итоги, цифры и практические выводы для тех, кто выбирает аппаратную платформу для обучения нейросетей.
Почему MLPerf Training важен для выбора ИИ-ускорителя
MLPerf Training измеряет реальную скорость обучения актуальных нейросетевых моделей в стандартизированных условиях. В отличие от пиковых TFLOPS, которые производители указывают в характеристиках, бенчмарк фиксирует время до достижения заданной точности модели — то есть то, что реально важно при промышленной эксплуатации.
В раунде 5.0 ключевой задачей стала тонкая настройка модели Llama* 2-70B методом LoRA (Low-Rank Adaptation). Этот подход активно применяется в корпоративном секторе: крупные языковые модели дообучаются на внутренних данных компании при существенно меньших затратах, чем при полном обучении с нуля. Замораживается большинство весов модели, обновляется лишь небольшой набор дополнительных параметров — это снижает требования к памяти и вычислительным ресурсам GPU в разы.
AMD выставила на тестирование два ускорителя:
- Instinct MI300X — актуальный флагман предыдущего поколения
- Instinct MI325X — обновлённая версия с памятью HBM3E увеличенного объёма
Ключевые результаты: AMD обгоняет Hopper
MI325X быстрее H200 на 8%
Наиболее резонансный результат раунда — AMD Instinct MI325X опередил NVIDIA H200 по скорости обучения Llama* 2-70B-LoRA приблизительно на 8%. Это не техническая погрешность и не маркетинговый приём: речь идёт об измеренном времени завершения задачи в сопоставимых конфигурациях.
Важный контекст: H200 относится к поколению Hopper. Сравнение происходит именно с ним, а не с новейшими ускорителями на архитектуре Blackwell. Тем не менее Hopper ещё год назад считался недосягаемым для AMD — и факт обгона говорит о реальном качественном скачке в развитии платформы Instinct.
MI300X быстрее H100 на 4%
Менее флагманский Instinct MI300X превзошёл NVIDIA H100 на те же задачи обучения примерно на 4%. Разрыв скромнее, зато с учётом доступности MI300X на рынке и его конкурентного ценообразования — это весомый аргумент для заказчиков, которые не могут позволить себе ждать H100 из квот.
OEM-результаты: как показали себя разные платформы
В MLPerf Training 5.0 приняли участие не только референсные конфигурации AMD, но и серверные системы крупнейших производителей. Все они решали одну задачу — обучение Llama* 2-70B-LoRA — в различных аппаратных окружениях.
Supermicro — лучший результат на MI325X
Supermicro представила систему на базе Instinct MI325X с жидкостным охлаждением и зафиксировала время обучения 21,75 минуты — лучший показатель среди всех платформ MI325X. Жидкостное охлаждение обеспечило стабильный тепловой режим и позволило ускорителям работать на полной мощности без троттлинга на протяжении всего теста.
MangoBoost — масштабирование MI300X
MangoBoost продемонстрировала, как линейно масштабируется производительность платформы MI300X при наращивании числа ускорителей:
| Конфигурация | Время обучения |
|---|---|
| 8 GPU MI300X | 29,6 мин |
| 16 GPU MI300X | 16,32 мин |
| 32 GPU MI300X | 10,92 мин |
Практически линейное ускорение — признак зрелой межузловой коммуникации и отсутствия узких мест в программном стеке ROCm при кластерном обучении.
Dell — надёжный средний результат
Dell с платформой на 8 GPU Instinct MI300X завершила обучение за 28,99 минуты. Результат чуть лучше, чем у Oracle, и близок к среднему по группе MI300X — стабильная коммерческая платформа без сюрпризов.
Oracle — нижняя граница по MI300X
Oracle показала наименее быстрый результат в группе: 30,42 минуты на 8 GPU MI300X. По всей видимости, облачная сетевая инфраструктура вносит дополнительные задержки, которые сказываются на общем времени тренировочного прогона.
Gigabyte — MI325X в стандартной воздушной сборке
Gigabyte с 8 GPU MI325X показала 22,1 минуты — результат немного хуже, чем у Supermicro с жидкостным охлаждением, но заметно лучше всех MI300X-конфигураций.
QCT — подтверждение стабильности MI325X
QCT с аналогичной конфигурацией из 8 GPU MI325X завершила задачу за 22,43 минуты, подтвердив воспроизводимость результатов этого ускорителя в типовых серверных сборках.
MI325X против MI300X: разрыв внутри линейки AMD
Сравнение результатов двух поколений даёт чёткую картину: Instinct MI325X быстрее MI300X примерно на 30% в задачах обучения LLM. Разница обусловлена рядом архитектурных улучшений:
- Увеличенный объём памяти HBM3E — больше данных помещается «рядом» с вычислительными ядрами
- Более высокая пропускная способность памяти — меньше ожиданий на передачу весов и активаций
- Улучшенная поддержка смешанной точности — эффективнее используются возможности FP8
Для практического выбора это означает следующее: если предстоит регулярное обучение моделей уровня 70B и выше — MI325X окупит свою более высокую стоимость. Для инференса и дообучения моделей небольшого масштаба MI300X по-прежнему остаётся экономически выгодным вариантом.
ROCm v6.5: программный стек как конкурентное преимущество
Высокие результаты AMD в MLPerf Training 5.0 — это не только история о железе. Ускорители Instinct работали под управлением ROCm v6.5 — версии, которая на момент публикации результатов ещё не была общедоступна. Именно программный стек обеспечил значительную часть прироста производительности.
Ключевые программные компоненты, использованные в тестировании:
- Flash Attention — значительно снижает потребление памяти при длинных входных последовательностях, что критично для больших языковых моделей
- Transformer Engine — оптимизирует вычисления в режиме смешанной точности FP8/BF16
- Оптимизированные алгоритмы обновления весов — ускорение на уровне оптимизатора
- Готовые Docker-контейнеры — воспроизводимое окружение, исключающее неожиданные вариации в результатах
AMD последовательно устраняет программные пробелы, которые ещё несколько лет назад делали ROCm несопоставимым с CUDA. Сегодня для задач тонкой настройки LLM экосистема ROCm уже не является «вторым выбором» — она полноценно конкурирует с CUDA по удобству и итоговой производительности.
Где находится NVIDIA сегодня
Честный разбор не должен обходить стороной актуальное положение дел в лагере NVIDIA. В MLPerf Training 5.0 компания представила ускорители GB200 на архитектуре Blackwell — и их показатели существенно превосходят MI325X:
- 8 GPU GB200 (кластер NVL72): обучение Llama* 2-70B-LoRA завершено за 10,34 минуты
- Это более чем в два раза быстрее, чем лучший результат на MI325X (21,75 мин у Supermicro)
- Обучение Stable Diffusion v2 на GB200 заняло 12,86 минуты
- Кластер из 512 чипов GB200 (NVL72) обучил Llama* 3.1 405B за 121,09 минуты
Другими словами, AMD сегодня опережает Hopper, но по-прежнему отстаёт от Blackwell примерно в два раза. Это отставание на одно поколение — ожидаемая и понятная ситуация. Ни одна компания не может выпускать флагманские архитектуры одновременно.
Что AMD анонсировала на Advance AI 2025
На конференции Advance AI 2025 AMD раскрыла планы на следующее поколение: ускорители Instinct MI350X и Instinct MI355X. Если темп прогресса сохранится — а переход от MI300X к MI325X дал +30% — то MI350X/MI355X могут существенно сократить разрыв с Blackwell.
При этом NVIDIA уже работает над архитектурой Rubin, которая придёт на смену Blackwell. Гонка ускорителей продолжается, и AMD явно не собирается уступать.
Практические выводы для выбора ИИ-платформы
Результаты MLPerf Training 5.0 дают несколько конкретных ориентиров:
- MI325X — обоснованный выбор для тех, кто регулярно дообучает LLM размером 70B+. Превосходство над H200 подтверждено независимым тестированием.
- MI300X — экономичная альтернатива H100 с небольшим преимуществом в скорости и доступностью на рынке.
- GB200 (Blackwell) недосягаем по пиковой производительности, но требует соответствующего бюджета и инфраструктуры.
- ROCm зрелый — переход с CUDA больше не означает потерю производительности или удобства в задачах обучения LLM.
Если вы рассматриваете сборку ИИ-сервера на базе AMD Instinct MI300X или MI325X, специалисты СервакМастер помогут подобрать оптимальную конфигурацию под ваши задачи и бюджет. Свяжитесь с нами через форму на сайте.
Итог
AMD уверенно дебютировала в MLPerf Training 5.0, обойдя NVIDIA H200 на Instinct MI325X и H100 на MI300X. Программный стек ROCm v6.5 сыграл ключевую роль в этом результате. Отставание от Blackwell сохраняется, но оно укладывается в нормальный цикл смены поколений — и следующие продукты AMD уже на подходе.
*LLAMA — проект Meta Platforms Inc.**, деятельность которой в России признана экстремистской и запрещена
**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена
