Instinct MI100 вышла в 2020 году и стала первым ускорителем AMD на архитектуре CDNA. Это был первый серьёзный ответ компании на господство CUDA в серверных вычислениях. Более новые поколения карт уже появились, но MI100 по-прежнему интересна и энтузиастам, и профессионалам: у неё необычно удачное сочетание цены и возможностей. Ниже разберём её устройство, сравним две версии ROCm, прогоним через неё полтора десятка популярных языковых моделей и посмотрим, как она ведёт себя под нагрузкой по температуре и питанию.

Почему MI100 появилась именно такой

С самого начала MI100 задумывалась как научно-вычислительный ускоритель. В те годы в научных расчётах безраздельно царили NVIDIA Tesla V100 и A100. AMD предложила альтернативу, которая должна была быть не только быстрее, но и дешевле в пересчёте на один TFLOPS. Ставка была сделана на открытые стандарты и экосистему ROCm, и тогда это был рискованный выбор.

С этого поколения AMD разделила линейки по назначению: RDNA остаётся для игр, CDNA предназначена для вычислений. В отличие от карт, выросших из игровых GPU и потом адаптированных под расчёты, MI100 проектировалась как вычислительный ускоритель с нуля.

Характеристики AMD Instinct MI100

Вычислительные блоки и матричные ядра

В основе карты 120 вычислительных блоков, в каждом по 64 потоковых ядра (Stream Cores). Всего получается 7680 универсальных ядер. Кроме того, MI100 стала первым ускорителем AMD с матричными ядрами MFMA (Matrix Fused Multiply-Add), заточенными под матричные операции. Они не равны CUDA-ядрам NVIDIA, а скорее сопоставимы с тензорными: MFMA гибче и умеет за один такт работать с разными форматами данных и размерностями матриц, тогда как тензорные ядра NVIDIA ориентированы на конкретные операции.

Производительность по режимам точности

Режим Заявленная производительность
FP32 23.1 TFLOPS
FP64 11.5 TFLOPS
FP32 Matrix до 46.1 TFLOPS
FP16 до 184.6 TFLOPS
INT8 184.6 TOPS

Самый впечатляющий результат карта показывает на целых числах и низкой точности. В INT8 она практически догоняет NVIDIA V100 (за счёт MFMA), но при этом уже поддерживает более современные форматы.

Память

На борту 32 ГБ многослойной памяти HBM2 с пропускной способностью 1228 ГБ/с. Для сравнения, у NVIDIA Tesla V100 этот показатель составляет 897 ГБ/с. Для инференса языковых моделей, где скорость часто упирается именно в память, это существенный аргумент.

Установка и запуск: габариты и охлаждение

MI100 занимает 2 слота, её длина без охлаждения всего 267 мм. Но эти габариты обманчивы: у карты нет собственного активного охлаждения, и в десктопной системе его придётся ставить самостоятельно. Например, с турбовентиляторным охлаждением, которое мы используем, длина вырастает до 402 мм. Это нужно учитывать при выборе корпуса.

Работа MI100 ограничена Linux-дистрибутивами, поэтому для тестов мы взяли самый популярный из них, Ubuntu 24.04.3 LTS. Оставался вопрос, какую версию ROCm ставить и есть ли заметная разница между старыми и новыми релизами.

ROCm 6.14.14 против ROCm 7.0.0

Для сравнения мы выбрали две ветки, которые по нашему опыту наиболее стабильны на Instinct MI100: ROCm 7.0.0 и ROCm 6.14.14. Обе используются в контейнерах, рекомендованных AMD. Тест проводился на пяти проверенных временем моделях, контекст везде 4096 токенов.

Результаты

Модель Квантизация ROCm 7.0.0, т/сек До первого токена ROCm 6.14.14, т/сек До первого токена
Qwen 2.5 7B-Instruct Q4_K_M 77.55 0.06 сек. 81.41 0.22 сек.
Llama 3.1 8B-Instruct* Q4_K_M 88.06 0.47 сек. 90.22 0.42 сек.
Mistral 7B v0.3 Q4_K_M 74.02 0.44 сек. 85.58 0.30 сек.
gpt-oss-20b MXFP4 124.10 0.08 сек. 103.88 0.09 сек.
Mistralai/Devstral-small-2-2512 24B Q4_K_M 51.41 0.45 сек. 51.94 0.35 сек.

Что показала разница

Если брать за метрику токены в секунду, то:

  • ROCm 6.14.14 быстрее ROCm 7.0.0 на Qwen 2.5 7B (+4.7%), Llama 3.1 8B (+2.4%), Mistral 7B v0.3 (+13.5%) и Devstral-small-2 24B (+1.0%);
  • ROCm 7.0.0 оказался впереди только на gpt-oss-20b (MXFP4): примерно +19.5%, то есть 124.1 против 103.88 ток/с.

По стабильности шестая версия тоже выглядит лучше: она отработала на всех моделях без заминок. Седьмая единожды споткнулась и выдала ошибку на Devstral-small-2-2512 24B. Событие разовое, но в рабочей среде такие вещи запоминаются. Поэтому основные тесты ниже мы провели на ROCm 6.14.14. Если же ваша основная нагрузка это gpt-oss-20b, выигрыш седьмой версии может оказаться важнее.

Тесты MI100 в популярных LLM

Подборку мы разбили на четыре сегмента: базовые популярные модели, крупные модели, модели для кодинга и недавние релизы, включая reasoning. Все модели запускались с контекстом 4096 токенов. Скорость генерации измеряется в токенах в секунду, а «до первого токена» показывает время реакции системы с момента запроса.

Базовые популярные модели

Модель Квантизация Скорость До первого токена Впечатления
Qwen 2.5 7B-Instruct Q4_K_M 81.41 т/сек 0.22 сек. Разумная, проверенная временем модель
Llama 3.1 8B-Instruct* Q4_K_M 90.22 т/сек 0.42 сек. Немногословна, но отвечает верно
Mistral 7B v0.3 Q4_K_M 85.58 т/сек 0.30 сек. Самая среднестатистическая, ничем не выделяется
gpt-oss-20b MXFP4 103.88 т/сек 0.09 сек. Лучшая в группе: самые подробные и быстрые ответы
Mistralai/Devstral-small-2-2512 24B Q4_K_M 51.94 т/сек 0.35 сек. Типовая MoE-модель, пришедшая на замену Mixtral 8x7B, даёт добротные ответы

Крупные языковые модели

Модель Квантизация Скорость До первого токена Впечатления
Qwen 2.5 14B-Instruct Q4_K_M 51.22 т/сек 0.06 сек. Иногда спотыкается на сложных предложениях, задумываясь на доли секунды
Qwen3 14B Q4_K_M 53.10 т/сек 0.08 сек. Лишена недостатков версии 2.5
Gemma 3 27B-IT-QAT Q4_O 51.24 т/сек 0.50 сек. Грамотно и логично строит ответы, не путается в словах и не допускает ошибок
Qwen3 32B Q4_K_M 20.75 т/сек 0.71 сек. Самая медленная, но ответы очень подробные, одинаково уверенно на русском и английском

Модели для кодинга

Модель Квантизация Скорость До первого токена Впечатления
Deepseek Coder 7B Q4_K_M 60.76 т/сек 0.15 сек. Легко пишет простые программы и скрипты
Code Llama 7B* Q4_K_M 99.98 т/сек 0.09 сек. Самый шустрый из кодеров
Granite Code 8B Q4_K_M 81.60 т/сек 0.19 сек. Добротный кодер, но слабо понимает запросы на русском

Недавние релизы и reasoning

Модель Квантизация Скорость До первого токена Впечатления
DeepSeek-R1 Distilled 14B Q4_K_M 52.70 т/сек 0.08 сек. Не очень хорошо дружит с русским языком
DeepSeek-R1 Distilled 32B Q4_K_M 21.54 т/сек 0.16 сек. Немногим лучше версии на 14 млрд параметров
Ministral 3 14B-Instruct Q4_K_M 71.03 т/сек 0.32 сек. Очень развёрнутые и подробные ответы
Ministral 3 14B-Reasoning Q4_K_M 53.76 т/сек 0.35 сек. Прекрасная модель, способная тягаться с gpt-oss-20b

Что из этого следует

Семи- и восьмимиллиардные модели работают на скоростях около 80-100 т/сек, а по скорости лидирует gpt-oss-20b с 103.88 т/сек и временем до первого токена 0.09 сек. Модели класса 14B держатся на уровне 51-54 т/сек (исключение Ministral 3 14B-Instruct с 71.03 т/сек), а 27-32B-модели замедляются: Gemma 3 27B выдаёт 51.24 т/сек, а Qwen3 32B и DeepSeek-R1 Distilled 32B около 21 т/сек. Для интерактивной работы этого вполне достаточно.

Результат весьма достойный. MI100 сделала очевидный рывок по сравнению с предшественницей AMD Instinct MI50, а 32 ГБ быстрой памяти всё ещё хватает для запуска крупных языковых моделей.

Температуры и энергопотребление

У новой карты есть и существенный минус по сравнению с прошлым поколением. MI100 заметно горячее и прожорливее предшественниц на GCN 5.1.

Мы провели часовой стресс-тест: в первой половине карту нагружали крупными LLM, во второй запускали встроенный в ROCm бенчмарк.

  • Нагрузка в языковых моделях. Температура колеблется от 75 до 85 градусов, средняя отметка около 80.
  • Бенчмарк ROCm. Температура взлетает до 95 °C и почти не меняется до конца теста, то есть карта работает на грани срабатывания защиты. При этом частоты опускаться к базовым карта не желает и держится на уровне ~1200-1350 МГц.
  • Питание. Карта часто упирается в лимит потребления 300 Вт. Для десктопной системы с такой видеокартой мы рекомендуем блок питания на 800-850 Вт.

Критическим изъяном это считать не стоит: с добротным блоком питания, хорошим охлаждением и продуваемым корпусом недостатки уходят на второй план, а вы получаете производительную карту по очень разумной цене.

Практические выводы по выбору

  • Для большинства моделей выбирайте ROCm 6.14.14: она быстрее на четырёх из пяти проверенных моделей и не давала сбоев. ROCm 7.0.0 имеет смысл, если вы в основном работаете с gpt-oss-20b.
  • Закладывайте место под охлаждение: с турбовентилятором карта вытягивается с 267 до 402 мм.
  • Планируйте питание и теплоотвод заранее: до 300 Вт и до 95 °C в бенчмарке требуют нормального блока и продуваемого корпуса.
  • Готовьтесь к Linux: карта работает только в Linux-дистрибутивах и потребует некоторой возни с ROCm.

Если вы не хотите разбираться с охлаждением, блоком питания и совместимостью самостоятельно, подберите готовую конфигурацию: в разделе серверов для ИИ и в общем каталоге серверов есть решения под инференс и обучение, а специалисты «СервакМастер» помогут рассчитать платформу под вашу задачу через страницу контактов.

Заключение

AMD Instinct MI100 однозначно хорошая карта со своими достоинствами и издержками. Если вы готовы ограничиться Linux и немного повозиться с ROCm, это отличный способ получить мощный ускоритель и заметно сэкономить относительно ближайших конкурентов. А если у вас уже есть опыт работы с «инстинктами», MI100 станет для вас одним из лучших вложений по соотношению мощности и затраченных рублей.

*LLAMA — проект Meta Platforms Inc.**, деятельность которой в России признана экстремистской и запрещена

**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена