Instinct MI100 вышла в 2020 году и стала первым ускорителем AMD на архитектуре CDNA. Это был первый серьёзный ответ компании на господство CUDA в серверных вычислениях. Более новые поколения карт уже появились, но MI100 по-прежнему интересна и энтузиастам, и профессионалам: у неё необычно удачное сочетание цены и возможностей. Ниже разберём её устройство, сравним две версии ROCm, прогоним через неё полтора десятка популярных языковых моделей и посмотрим, как она ведёт себя под нагрузкой по температуре и питанию.
Почему MI100 появилась именно такой
С самого начала MI100 задумывалась как научно-вычислительный ускоритель. В те годы в научных расчётах безраздельно царили NVIDIA Tesla V100 и A100. AMD предложила альтернативу, которая должна была быть не только быстрее, но и дешевле в пересчёте на один TFLOPS. Ставка была сделана на открытые стандарты и экосистему ROCm, и тогда это был рискованный выбор.
С этого поколения AMD разделила линейки по назначению: RDNA остаётся для игр, CDNA предназначена для вычислений. В отличие от карт, выросших из игровых GPU и потом адаптированных под расчёты, MI100 проектировалась как вычислительный ускоритель с нуля.
Характеристики AMD Instinct MI100
Вычислительные блоки и матричные ядра
В основе карты 120 вычислительных блоков, в каждом по 64 потоковых ядра (Stream Cores). Всего получается 7680 универсальных ядер. Кроме того, MI100 стала первым ускорителем AMD с матричными ядрами MFMA (Matrix Fused Multiply-Add), заточенными под матричные операции. Они не равны CUDA-ядрам NVIDIA, а скорее сопоставимы с тензорными: MFMA гибче и умеет за один такт работать с разными форматами данных и размерностями матриц, тогда как тензорные ядра NVIDIA ориентированы на конкретные операции.
Производительность по режимам точности
| Режим | Заявленная производительность |
|---|---|
| FP32 | 23.1 TFLOPS |
| FP64 | 11.5 TFLOPS |
| FP32 Matrix | до 46.1 TFLOPS |
| FP16 | до 184.6 TFLOPS |
| INT8 | 184.6 TOPS |
Самый впечатляющий результат карта показывает на целых числах и низкой точности. В INT8 она практически догоняет NVIDIA V100 (за счёт MFMA), но при этом уже поддерживает более современные форматы.
Память
На борту 32 ГБ многослойной памяти HBM2 с пропускной способностью 1228 ГБ/с. Для сравнения, у NVIDIA Tesla V100 этот показатель составляет 897 ГБ/с. Для инференса языковых моделей, где скорость часто упирается именно в память, это существенный аргумент.
Установка и запуск: габариты и охлаждение
MI100 занимает 2 слота, её длина без охлаждения всего 267 мм. Но эти габариты обманчивы: у карты нет собственного активного охлаждения, и в десктопной системе его придётся ставить самостоятельно. Например, с турбовентиляторным охлаждением, которое мы используем, длина вырастает до 402 мм. Это нужно учитывать при выборе корпуса.
Работа MI100 ограничена Linux-дистрибутивами, поэтому для тестов мы взяли самый популярный из них, Ubuntu 24.04.3 LTS. Оставался вопрос, какую версию ROCm ставить и есть ли заметная разница между старыми и новыми релизами.
ROCm 6.14.14 против ROCm 7.0.0
Для сравнения мы выбрали две ветки, которые по нашему опыту наиболее стабильны на Instinct MI100: ROCm 7.0.0 и ROCm 6.14.14. Обе используются в контейнерах, рекомендованных AMD. Тест проводился на пяти проверенных временем моделях, контекст везде 4096 токенов.
Результаты
| Модель | Квантизация | ROCm 7.0.0, т/сек | До первого токена | ROCm 6.14.14, т/сек | До первого токена |
|---|---|---|---|---|---|
| Qwen 2.5 7B-Instruct | Q4_K_M | 77.55 | 0.06 сек. | 81.41 | 0.22 сек. |
| Llama 3.1 8B-Instruct* | Q4_K_M | 88.06 | 0.47 сек. | 90.22 | 0.42 сек. |
| Mistral 7B v0.3 | Q4_K_M | 74.02 | 0.44 сек. | 85.58 | 0.30 сек. |
| gpt-oss-20b | MXFP4 | 124.10 | 0.08 сек. | 103.88 | 0.09 сек. |
| Mistralai/Devstral-small-2-2512 24B | Q4_K_M | 51.41 | 0.45 сек. | 51.94 | 0.35 сек. |
Что показала разница
Если брать за метрику токены в секунду, то:
- ROCm 6.14.14 быстрее ROCm 7.0.0 на Qwen 2.5 7B (+4.7%), Llama 3.1 8B (+2.4%), Mistral 7B v0.3 (+13.5%) и Devstral-small-2 24B (+1.0%);
- ROCm 7.0.0 оказался впереди только на gpt-oss-20b (MXFP4): примерно +19.5%, то есть 124.1 против 103.88 ток/с.
По стабильности шестая версия тоже выглядит лучше: она отработала на всех моделях без заминок. Седьмая единожды споткнулась и выдала ошибку на Devstral-small-2-2512 24B. Событие разовое, но в рабочей среде такие вещи запоминаются. Поэтому основные тесты ниже мы провели на ROCm 6.14.14. Если же ваша основная нагрузка это gpt-oss-20b, выигрыш седьмой версии может оказаться важнее.
Тесты MI100 в популярных LLM
Подборку мы разбили на четыре сегмента: базовые популярные модели, крупные модели, модели для кодинга и недавние релизы, включая reasoning. Все модели запускались с контекстом 4096 токенов. Скорость генерации измеряется в токенах в секунду, а «до первого токена» показывает время реакции системы с момента запроса.
Базовые популярные модели
| Модель | Квантизация | Скорость | До первого токена | Впечатления |
|---|---|---|---|---|
| Qwen 2.5 7B-Instruct | Q4_K_M | 81.41 т/сек | 0.22 сек. | Разумная, проверенная временем модель |
| Llama 3.1 8B-Instruct* | Q4_K_M | 90.22 т/сек | 0.42 сек. | Немногословна, но отвечает верно |
| Mistral 7B v0.3 | Q4_K_M | 85.58 т/сек | 0.30 сек. | Самая среднестатистическая, ничем не выделяется |
| gpt-oss-20b | MXFP4 | 103.88 т/сек | 0.09 сек. | Лучшая в группе: самые подробные и быстрые ответы |
| Mistralai/Devstral-small-2-2512 24B | Q4_K_M | 51.94 т/сек | 0.35 сек. | Типовая MoE-модель, пришедшая на замену Mixtral 8x7B, даёт добротные ответы |
Крупные языковые модели
| Модель | Квантизация | Скорость | До первого токена | Впечатления |
|---|---|---|---|---|
| Qwen 2.5 14B-Instruct | Q4_K_M | 51.22 т/сек | 0.06 сек. | Иногда спотыкается на сложных предложениях, задумываясь на доли секунды |
| Qwen3 14B | Q4_K_M | 53.10 т/сек | 0.08 сек. | Лишена недостатков версии 2.5 |
| Gemma 3 27B-IT-QAT | Q4_O | 51.24 т/сек | 0.50 сек. | Грамотно и логично строит ответы, не путается в словах и не допускает ошибок |
| Qwen3 32B | Q4_K_M | 20.75 т/сек | 0.71 сек. | Самая медленная, но ответы очень подробные, одинаково уверенно на русском и английском |
Модели для кодинга
| Модель | Квантизация | Скорость | До первого токена | Впечатления |
|---|---|---|---|---|
| Deepseek Coder 7B | Q4_K_M | 60.76 т/сек | 0.15 сек. | Легко пишет простые программы и скрипты |
| Code Llama 7B* | Q4_K_M | 99.98 т/сек | 0.09 сек. | Самый шустрый из кодеров |
| Granite Code 8B | Q4_K_M | 81.60 т/сек | 0.19 сек. | Добротный кодер, но слабо понимает запросы на русском |
Недавние релизы и reasoning
| Модель | Квантизация | Скорость | До первого токена | Впечатления |
|---|---|---|---|---|
| DeepSeek-R1 Distilled 14B | Q4_K_M | 52.70 т/сек | 0.08 сек. | Не очень хорошо дружит с русским языком |
| DeepSeek-R1 Distilled 32B | Q4_K_M | 21.54 т/сек | 0.16 сек. | Немногим лучше версии на 14 млрд параметров |
| Ministral 3 14B-Instruct | Q4_K_M | 71.03 т/сек | 0.32 сек. | Очень развёрнутые и подробные ответы |
| Ministral 3 14B-Reasoning | Q4_K_M | 53.76 т/сек | 0.35 сек. | Прекрасная модель, способная тягаться с gpt-oss-20b |
Что из этого следует
Семи- и восьмимиллиардные модели работают на скоростях около 80-100 т/сек, а по скорости лидирует gpt-oss-20b с 103.88 т/сек и временем до первого токена 0.09 сек. Модели класса 14B держатся на уровне 51-54 т/сек (исключение Ministral 3 14B-Instruct с 71.03 т/сек), а 27-32B-модели замедляются: Gemma 3 27B выдаёт 51.24 т/сек, а Qwen3 32B и DeepSeek-R1 Distilled 32B около 21 т/сек. Для интерактивной работы этого вполне достаточно.
Результат весьма достойный. MI100 сделала очевидный рывок по сравнению с предшественницей AMD Instinct MI50, а 32 ГБ быстрой памяти всё ещё хватает для запуска крупных языковых моделей.
Температуры и энергопотребление
У новой карты есть и существенный минус по сравнению с прошлым поколением. MI100 заметно горячее и прожорливее предшественниц на GCN 5.1.
Мы провели часовой стресс-тест: в первой половине карту нагружали крупными LLM, во второй запускали встроенный в ROCm бенчмарк.
- Нагрузка в языковых моделях. Температура колеблется от 75 до 85 градусов, средняя отметка около 80.
- Бенчмарк ROCm. Температура взлетает до 95 °C и почти не меняется до конца теста, то есть карта работает на грани срабатывания защиты. При этом частоты опускаться к базовым карта не желает и держится на уровне ~1200-1350 МГц.
- Питание. Карта часто упирается в лимит потребления 300 Вт. Для десктопной системы с такой видеокартой мы рекомендуем блок питания на 800-850 Вт.
Критическим изъяном это считать не стоит: с добротным блоком питания, хорошим охлаждением и продуваемым корпусом недостатки уходят на второй план, а вы получаете производительную карту по очень разумной цене.
Практические выводы по выбору
- Для большинства моделей выбирайте ROCm 6.14.14: она быстрее на четырёх из пяти проверенных моделей и не давала сбоев. ROCm 7.0.0 имеет смысл, если вы в основном работаете с gpt-oss-20b.
- Закладывайте место под охлаждение: с турбовентилятором карта вытягивается с 267 до 402 мм.
- Планируйте питание и теплоотвод заранее: до 300 Вт и до 95 °C в бенчмарке требуют нормального блока и продуваемого корпуса.
- Готовьтесь к Linux: карта работает только в Linux-дистрибутивах и потребует некоторой возни с ROCm.
Если вы не хотите разбираться с охлаждением, блоком питания и совместимостью самостоятельно, подберите готовую конфигурацию: в разделе серверов для ИИ и в общем каталоге серверов есть решения под инференс и обучение, а специалисты «СервакМастер» помогут рассчитать платформу под вашу задачу через страницу контактов.
Заключение
AMD Instinct MI100 однозначно хорошая карта со своими достоинствами и издержками. Если вы готовы ограничиться Linux и немного повозиться с ROCm, это отличный способ получить мощный ускоритель и заметно сэкономить относительно ближайших конкурентов. А если у вас уже есть опыт работы с «инстинктами», MI100 станет для вас одним из лучших вложений по соотношению мощности и затраченных рублей.
*LLAMA — проект Meta Platforms Inc.**, деятельность которой в России признана экстремистской и запрещена
**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена
