Ускорители для дата-центров устаревают быстро: новые поколения выходят одно за другим, а старые карты теряют актуальность. Но у части из них начинается вторая жизнь. Мы проверили, остаётся ли AMD Instinct MI50 на 16 ГБ выгодным решением для запуска нейросетей у себя на сервере или её время действительно прошло.

Откуда взялась MI50

Instinct MI50 появилась в ноябре 2018 года, когда рынок серверных ускорителей только формировался. AMD тогда показала первые в мире графические процессоры, выпущенные по 7-нм техпроцессу. Этим она заметно гордилась: NVIDIA в то время делала свои карты по 12-нм нормам. В продажу вышли сразу две модели, флагманская Instinct MI60 и более скромная MI50. Обе построены на чипе Vega 20 и поддерживали тогда ещё новый интерфейс PCIe 4.0.

Изначально карту проектировали для корпоративных ЦОД и научных расчётов. Никто не ожидал, что через несколько лет интерес к локальному запуску больших языковых моделей даст этим ускорителям новую жизнь.

Базовая комплектация предусматривала 16 ГБ памяти. Позднее вышла версия на 32 ГБ, и она настолько сбила спрос на дорогую MI60, что старшая модель постепенно ушла с рынка. Первой же из дата-центров начала выходить именно версия на 16 ГБ: из-за невысокой цены она попала к энтузиастам. Из этой цепочки обстоятельств и выросла репутация MI50 как одной из самых выгодных карт за свои деньги.

Технические характеристики

MI50 построена на архитектуре GCN 5.1 и выпускается по 7-нм техпроцессу TSMC. Ключевые параметры:

Параметр Значение
Потоковые процессоры 3840
FP32 13,4 TFLOPS
FP16 26,8 TFLOPS
FP64 (двойная точность) 6,7 TFLOPS
Память 16 ГБ HBM2, 1000 МГц
Пропускная способность памяти 1024 ГБ/с
Лимит энергопотребления 225 Вт

По сути, MI50 можно описать как Radeon VII «в строгом костюме», причём карта очень близка и к Vega 64. Мощность FP64 делала её полезной в научных расчётах, а крупный объём быстрой HBM2 и грубая вычислительная сила множества потоковых процессоров были главными козырями при продажах.

Память как главное преимущество

Самое сильное место MI50 — подсистема памяти. HBM2 работает на частоте 1000 МГц, а шина шириной 4096 бит даёт 1024 ГБ/с. Сравним с картами NVIDIA:

  • Tesla P100 предыдущего поколения: 732 ГБ/с;
  • Tesla V100, прямая конкурентка: 897 ГБ/с.

Ни одна видеокарта NVIDIA на тот момент не предлагала такой пропускной способности. Для инференса языковых моделей, где скорость часто упирается именно в память, это очень важный параметр.

Подготовка платформы и установка ROCm

Здесь начинаются недостатки: от пользователя потребуются знания и подходящая конфигурация железа.

  1. Карта инициализируется только в режиме UEFI. Даже смешанный режим UEFI+Legacy не позволяет ей определиться в системе.
  2. Материнская плата должна поддерживать Above 4G Memory и Re-Size BAR (он же Large BAR).
  3. Желательно отключить CSM Support и Secure Boot.

Названия опций зависят от производителя платы, поэтому наличие нужных функций стоит проверять в официальной спецификации. Когда настройки BIOS выставлены правильно, карта появляется в системе, но до рабочего состояния ещё далеко: нужен стек ROCm.

Установка ROCm 6.3 по шагам

Шаг 1. Подготовка системы. Обновите пакеты и поставьте зависимости:

sudo apt update
sudo apt upgrade -y
sudo apt install -y linux-headers-$(uname -r)
sudo apt install -y linux-modules-extra-$(uname -r)
sudo apt install -y build-essential
sudo apt install -y python3-setuptools
sudo apt install -y python3-wheel

Обновление должно пройти без ошибок. Если они появились, перезагрузитесь и повторите.

Шаг 2. Установщик amdgpu-install для ROCm 6.3. Скачайте пакет:

cd ~/Downloads
wget https://repo.radeon.com/amdgpu-install/6.3.0/ubuntu/noble/amdgpu-install_6.3.60300-1_all.deb
ls -lah ~/Downloads/amdgpu-install_6.3.60300-1_all.deb

Файл должен занимать около 17 КБ. Затем установите его и проверьте результат:

sudo apt install ./amdgpu-install_6.3.60300-1_all.deb
which amdgpu-install

Ответом должен быть путь /usr/bin/amdgpu-install.

Шаг 3. Установка ROCm и драйверов с поддержкой графики и ROCm:

sudo amdgpu-install -y --usecase=graphics,rocm

Если установка прервалась с ошибкой, выполните sudo apt install -f и повторите команду.

Шаг 4. Права доступа. Добавьте пользователя в группы для доступа к GPU и проверьте, что в выводе есть render и video:

sudo usermod -a -G render,video $LOGNAME
groups $LOGNAME

Шаг 5. Переменная окружения. В ROCm 6.3 для совместимости MI50 нужна переменная HSA_OVERRIDE_GFX_VERSION:

echo 'export HSA_OVERRIDE_GFX_VERSION=9.0.6' >> ~/.bashrc
source ~/.bashrc
echo $HSA_OVERRIDE_GFX_VERSION

Последняя команда должна вывести 9.0.6. После этого перезагрузите систему командой sudo reboot, чтобы загрузились драйверы.

Шаг 6. Проверка. После перезагрузки выполните:

apt show rocm-core 2>/dev/null | grep "Version"

Если всё сделано верно, вы увидите установленную версию ROCm 6.3.

Что будет с поддержкой дальше

ROCm 6.3 является последней версией, официально работающей с MI50. Однако AMD заявила о возвращении поддержки MI50 и MI60 в анонсированной версии ROCm 7.9 при сборке через TheRock. Так что, несмотря на возраст, «пятидесятка» остаётся актуальным вычислителем, который пусть и с оговорками, но сможет работать и с новым ROCm.

Тесты на популярных языковых моделях

Набор моделей во многом повторяет тесты NVIDIA Tesla P40 и Tesla P100, но добавилось и немало новых позиций. Во всех запусках длина контекста составляла 4096.

# Модель Квантизация Скорость До первого токена Примечания
1 deepseek-r1-0528-qwen3-8b Q4_K_M 62.38 т/сек 0.21 сек Короткие, но верные ответы
2 Meta-Llama-3.1-8B-Instruct* Q4_K_M 64.39 т/сек 0.32 сек Немногословна, но отвечает верно
3 cwc-mistral-nemo-12b-v2 Q4_K_M 47 т/сек 0.29 сек Оптимизирована с помощью фреймворка NeMo от NVIDIA, но отлично работает на картах AMD; грамотно пишет по-русски и по-английски
4 Atom v1 Preview 12B I1 Q4_K_M 41.56 т/сек 0.33 сек Гибридная архитектура, лаконичные и правильные ответы, очень стабильна
5 griffin-3b-i1 Q4_K_M 21.08 т/сек (медленно) 0.18 сек Гибридная модель от Google; для своего размера работает вяло и не справляется с громоздкими задачами
6 OpenAI's gpt-oss 20B Q4_K_M 78.16 т/сек (быстро) 0.47 сек Лучшая по итогам теста: самые подробные и быстрые ответы
7 Mamba-gpt-7b-i1 Q4_K_M 86.31 т/сек (лучший результат) 0.18 сек Основана на State Space Models вместо Self-Attention; очень шустрая, но по умолчанию выдаёт короткие ответы
8 ministral-3-14b-instruct-2512 Q4_K_M 39.78 т/сек 3.18 сек (медленно) Свежая модель Mistral AI, быстрая и разумная
9 DeepSeek-R1-Distill-Llama-8B Q4_K_M 66.26 т/сек 0.21 сек Путает языки, вставляя китайские символы в русский и английский текст; может уйти в бесконечный цикл одинаковых рассуждений до ошибки
10 Llama-2-7B-Chat Q4_K_S 66.26 т/сек 0.21 сек Хорошо ведёт диалог, даёт правильные ответы
11 ministral-3-14b-instruct-2512 Q5_K_M 32.43 т/сек 3.30 сек (медленно) Чуть медленнее версии Q4_K_M, разницы в ответах нет
12 Mistral-7B-Instruct-v0.3 Q5_K_M 60.63 т/сек 0.22 сек Самая среднестатистическая, ничем не выделяется
13 Llama-3.2-8X3B-MOE-Instruct-18.4B Q5_K_M 58.17 т/сек 0.72 сек Генерирует быстро, изредка ошибается
14 Qwen3-4B-Thinking-2507 Q6_K 69.66 т/сек (быстро) 0.15 сек Качественные рассуждения, исчерпывающие ответы
15 gemma-3n-E4B-it-text Q6_K 41.62 т/сек 0.26 сек Иногда запинается и искажает предложения
16 Granite-4-h-tiny Q6_K 68.21 т/сек (быстро) 0.26 сек Гибридная модель IBM на архитектуре Mixture of Experts, быстрая и точная
17 phi-4-mini-reasoning Q8_0 67.39 т/сек (быстро) 0.12 сек Компактная модель Microsoft; по-русски общается неохотно, лучше использовать английский
18 Qwen3-4B-Thinking-2507 Q8_0 61.92 т/сек 0.15 сек Одна из самых разумных и быстрых моделей
19 LLaMA-7b-AWQ AWQ 78.21 т/сек (быстро) 0.17 сек Очень короткий и малосодержательный ответ
20 Qwen3-4B-Instruct-2507-F16 BF16 47.23 т/сек 0.14 сек Очень качественные ответы, но, как любая крупная модель, работает медленнее
21 Meta-Llama-3-8B-Instruct-bf16* BF16 28.82 т/сек (медленно) 0.32 сек Качественные ответы, но неповоротлива и очень долго грузится в память

Что показывают цифры

Даже с 16 ГБ памяти выбор моделей широкий: от компактных 3–4B до 14B и MoE-сборок на 18.4B. Для карты такого возраста результаты очень бодрые. Если же 16 ГБ окажется тесно, версия на 32 ГБ открывает возможность запускать более крупные модели и работать с длинным контекстом.

Практически это означает следующее:

  • Модели класса 7–8B в Q4–Q5 стабильно дают около 60–66 токенов в секунду.
  • gpt-oss 20B при Q4_K_M достигает 78.16 т/сек и оказался лучшей моделью теста по качеству и скорости.
  • Задержка до первого токена у большинства моделей составляет доли секунды; заметно дольше (около 3 сек) думают только 14B-варианты ministral.
  • Переход с квантизации на BF16 ощутимо снижает скорость: Llama-3-8B в bf16 выдала лишь 28.82 т/сек.

Температуры, охлаждение и питание

Благодаря 7-нм техпроцессу и микроархитектуре GCN 5.1 карта остаётся прохладной для своих характеристик. В тестовой системе рядом с MI50 (GPU0) стояла трёхвентиляторная Sapphire NITRO+ RX 5700 XT (GPU1), тоже на 7 нм, но на архитектуре RDNA 1. В простое обе карты холодные, а под серьёзной нагрузкой температура MI50 колебалась от 68 до 76 градусов и поднималась выше 80 только при очень длительной работе. Чаще всего она не превышала 75 градусов.

Но и такая «холодная» карта не обойдётся без активного охлаждения: у MI50 нет собственного вентилятора. В тесте использовалась слегка доработанная турбина от Tesla P40/P100. Крепёжные отверстия у турбины NVIDIA Tesla P40 не совпадают с отверстиями на MI50, так что узел пришлось фактически приклеивать.

Энергопотребление ограничено на уровне 225 Вт. Для сборки на базе десктопной платформы рекомендуется блок питания от 700 Вт и выше.

Итоги: кому подойдёт MI50

AMD Instinct MI50 — выдающаяся для своей цены видеокарта. Она даёт выгодное соотношение производительности и стоимости, а ещё и гибкость выбора:

  • 16 ГБ подойдут, если вы запускаете некрупные модели с обычной длиной контекста и хотите сэкономить;
  • 32 ГБ снимут ограничения по размеру моделей, если готовы заплатить больше.

Если вам нужна вычислительная мощность под Linux и вы готовы повозиться с ROCm или TheRock, MI50 будет правильным выбором. Если же вы не хотите самостоятельно подбирать плату, охлаждение и блок питания, проще обратиться к готовым решениям: посмотрите серверы для ИИ в каталоге или общий каталог серверов. Инженеры «СервакМастер» помогут подобрать конфигурацию под вашу задачу, достаточно связаться с нами.

*LLAMA — проект Meta Platforms Inc.**, деятельность которой в России признана экстремистской и запрещена.

**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена.