Ускорители для дата-центров устаревают быстро: новые поколения выходят одно за другим, а старые карты теряют актуальность. Но у части из них начинается вторая жизнь. Мы проверили, остаётся ли AMD Instinct MI50 на 16 ГБ выгодным решением для запуска нейросетей у себя на сервере или её время действительно прошло.
Откуда взялась MI50
Instinct MI50 появилась в ноябре 2018 года, когда рынок серверных ускорителей только формировался. AMD тогда показала первые в мире графические процессоры, выпущенные по 7-нм техпроцессу. Этим она заметно гордилась: NVIDIA в то время делала свои карты по 12-нм нормам. В продажу вышли сразу две модели, флагманская Instinct MI60 и более скромная MI50. Обе построены на чипе Vega 20 и поддерживали тогда ещё новый интерфейс PCIe 4.0.
Изначально карту проектировали для корпоративных ЦОД и научных расчётов. Никто не ожидал, что через несколько лет интерес к локальному запуску больших языковых моделей даст этим ускорителям новую жизнь.
Базовая комплектация предусматривала 16 ГБ памяти. Позднее вышла версия на 32 ГБ, и она настолько сбила спрос на дорогую MI60, что старшая модель постепенно ушла с рынка. Первой же из дата-центров начала выходить именно версия на 16 ГБ: из-за невысокой цены она попала к энтузиастам. Из этой цепочки обстоятельств и выросла репутация MI50 как одной из самых выгодных карт за свои деньги.
Технические характеристики
MI50 построена на архитектуре GCN 5.1 и выпускается по 7-нм техпроцессу TSMC. Ключевые параметры:
| Параметр | Значение |
|---|---|
| Потоковые процессоры | 3840 |
| FP32 | 13,4 TFLOPS |
| FP16 | 26,8 TFLOPS |
| FP64 (двойная точность) | 6,7 TFLOPS |
| Память | 16 ГБ HBM2, 1000 МГц |
| Пропускная способность памяти | 1024 ГБ/с |
| Лимит энергопотребления | 225 Вт |
По сути, MI50 можно описать как Radeon VII «в строгом костюме», причём карта очень близка и к Vega 64. Мощность FP64 делала её полезной в научных расчётах, а крупный объём быстрой HBM2 и грубая вычислительная сила множества потоковых процессоров были главными козырями при продажах.
Память как главное преимущество
Самое сильное место MI50 — подсистема памяти. HBM2 работает на частоте 1000 МГц, а шина шириной 4096 бит даёт 1024 ГБ/с. Сравним с картами NVIDIA:
- Tesla P100 предыдущего поколения: 732 ГБ/с;
- Tesla V100, прямая конкурентка: 897 ГБ/с.
Ни одна видеокарта NVIDIA на тот момент не предлагала такой пропускной способности. Для инференса языковых моделей, где скорость часто упирается именно в память, это очень важный параметр.
Подготовка платформы и установка ROCm
Здесь начинаются недостатки: от пользователя потребуются знания и подходящая конфигурация железа.
- Карта инициализируется только в режиме UEFI. Даже смешанный режим UEFI+Legacy не позволяет ей определиться в системе.
- Материнская плата должна поддерживать Above 4G Memory и Re-Size BAR (он же Large BAR).
- Желательно отключить CSM Support и Secure Boot.
Названия опций зависят от производителя платы, поэтому наличие нужных функций стоит проверять в официальной спецификации. Когда настройки BIOS выставлены правильно, карта появляется в системе, но до рабочего состояния ещё далеко: нужен стек ROCm.
Установка ROCm 6.3 по шагам
Шаг 1. Подготовка системы. Обновите пакеты и поставьте зависимости:
sudo apt update
sudo apt upgrade -y
sudo apt install -y linux-headers-$(uname -r)
sudo apt install -y linux-modules-extra-$(uname -r)
sudo apt install -y build-essential
sudo apt install -y python3-setuptools
sudo apt install -y python3-wheel
Обновление должно пройти без ошибок. Если они появились, перезагрузитесь и повторите.
Шаг 2. Установщик amdgpu-install для ROCm 6.3. Скачайте пакет:
cd ~/Downloads
wget https://repo.radeon.com/amdgpu-install/6.3.0/ubuntu/noble/amdgpu-install_6.3.60300-1_all.deb
ls -lah ~/Downloads/amdgpu-install_6.3.60300-1_all.deb
Файл должен занимать около 17 КБ. Затем установите его и проверьте результат:
sudo apt install ./amdgpu-install_6.3.60300-1_all.deb
which amdgpu-install
Ответом должен быть путь /usr/bin/amdgpu-install.
Шаг 3. Установка ROCm и драйверов с поддержкой графики и ROCm:
sudo amdgpu-install -y --usecase=graphics,rocm
Если установка прервалась с ошибкой, выполните sudo apt install -f и повторите команду.
Шаг 4. Права доступа. Добавьте пользователя в группы для доступа к GPU и проверьте, что в выводе есть render и video:
sudo usermod -a -G render,video $LOGNAME
groups $LOGNAME
Шаг 5. Переменная окружения. В ROCm 6.3 для совместимости MI50 нужна переменная HSA_OVERRIDE_GFX_VERSION:
echo 'export HSA_OVERRIDE_GFX_VERSION=9.0.6' >> ~/.bashrc
source ~/.bashrc
echo $HSA_OVERRIDE_GFX_VERSION
Последняя команда должна вывести 9.0.6. После этого перезагрузите систему командой sudo reboot, чтобы загрузились драйверы.
Шаг 6. Проверка. После перезагрузки выполните:
apt show rocm-core 2>/dev/null | grep "Version"
Если всё сделано верно, вы увидите установленную версию ROCm 6.3.
Что будет с поддержкой дальше
ROCm 6.3 является последней версией, официально работающей с MI50. Однако AMD заявила о возвращении поддержки MI50 и MI60 в анонсированной версии ROCm 7.9 при сборке через TheRock. Так что, несмотря на возраст, «пятидесятка» остаётся актуальным вычислителем, который пусть и с оговорками, но сможет работать и с новым ROCm.
Тесты на популярных языковых моделях
Набор моделей во многом повторяет тесты NVIDIA Tesla P40 и Tesla P100, но добавилось и немало новых позиций. Во всех запусках длина контекста составляла 4096.
| # | Модель | Квантизация | Скорость | До первого токена | Примечания |
|---|---|---|---|---|---|
| 1 | deepseek-r1-0528-qwen3-8b | Q4_K_M | 62.38 т/сек | 0.21 сек | Короткие, но верные ответы |
| 2 | Meta-Llama-3.1-8B-Instruct* | Q4_K_M | 64.39 т/сек | 0.32 сек | Немногословна, но отвечает верно |
| 3 | cwc-mistral-nemo-12b-v2 | Q4_K_M | 47 т/сек | 0.29 сек | Оптимизирована с помощью фреймворка NeMo от NVIDIA, но отлично работает на картах AMD; грамотно пишет по-русски и по-английски |
| 4 | Atom v1 Preview 12B I1 | Q4_K_M | 41.56 т/сек | 0.33 сек | Гибридная архитектура, лаконичные и правильные ответы, очень стабильна |
| 5 | griffin-3b-i1 | Q4_K_M | 21.08 т/сек (медленно) | 0.18 сек | Гибридная модель от Google; для своего размера работает вяло и не справляется с громоздкими задачами |
| 6 | OpenAI's gpt-oss 20B | Q4_K_M | 78.16 т/сек (быстро) | 0.47 сек | Лучшая по итогам теста: самые подробные и быстрые ответы |
| 7 | Mamba-gpt-7b-i1 | Q4_K_M | 86.31 т/сек (лучший результат) | 0.18 сек | Основана на State Space Models вместо Self-Attention; очень шустрая, но по умолчанию выдаёт короткие ответы |
| 8 | ministral-3-14b-instruct-2512 | Q4_K_M | 39.78 т/сек | 3.18 сек (медленно) | Свежая модель Mistral AI, быстрая и разумная |
| 9 | DeepSeek-R1-Distill-Llama-8B | Q4_K_M | 66.26 т/сек | 0.21 сек | Путает языки, вставляя китайские символы в русский и английский текст; может уйти в бесконечный цикл одинаковых рассуждений до ошибки |
| 10 | Llama-2-7B-Chat | Q4_K_S | 66.26 т/сек | 0.21 сек | Хорошо ведёт диалог, даёт правильные ответы |
| 11 | ministral-3-14b-instruct-2512 | Q5_K_M | 32.43 т/сек | 3.30 сек (медленно) | Чуть медленнее версии Q4_K_M, разницы в ответах нет |
| 12 | Mistral-7B-Instruct-v0.3 | Q5_K_M | 60.63 т/сек | 0.22 сек | Самая среднестатистическая, ничем не выделяется |
| 13 | Llama-3.2-8X3B-MOE-Instruct-18.4B | Q5_K_M | 58.17 т/сек | 0.72 сек | Генерирует быстро, изредка ошибается |
| 14 | Qwen3-4B-Thinking-2507 | Q6_K | 69.66 т/сек (быстро) | 0.15 сек | Качественные рассуждения, исчерпывающие ответы |
| 15 | gemma-3n-E4B-it-text | Q6_K | 41.62 т/сек | 0.26 сек | Иногда запинается и искажает предложения |
| 16 | Granite-4-h-tiny | Q6_K | 68.21 т/сек (быстро) | 0.26 сек | Гибридная модель IBM на архитектуре Mixture of Experts, быстрая и точная |
| 17 | phi-4-mini-reasoning | Q8_0 | 67.39 т/сек (быстро) | 0.12 сек | Компактная модель Microsoft; по-русски общается неохотно, лучше использовать английский |
| 18 | Qwen3-4B-Thinking-2507 | Q8_0 | 61.92 т/сек | 0.15 сек | Одна из самых разумных и быстрых моделей |
| 19 | LLaMA-7b-AWQ | AWQ | 78.21 т/сек (быстро) | 0.17 сек | Очень короткий и малосодержательный ответ |
| 20 | Qwen3-4B-Instruct-2507-F16 | BF16 | 47.23 т/сек | 0.14 сек | Очень качественные ответы, но, как любая крупная модель, работает медленнее |
| 21 | Meta-Llama-3-8B-Instruct-bf16* | BF16 | 28.82 т/сек (медленно) | 0.32 сек | Качественные ответы, но неповоротлива и очень долго грузится в память |
Что показывают цифры
Даже с 16 ГБ памяти выбор моделей широкий: от компактных 3–4B до 14B и MoE-сборок на 18.4B. Для карты такого возраста результаты очень бодрые. Если же 16 ГБ окажется тесно, версия на 32 ГБ открывает возможность запускать более крупные модели и работать с длинным контекстом.
Практически это означает следующее:
- Модели класса 7–8B в Q4–Q5 стабильно дают около 60–66 токенов в секунду.
- gpt-oss 20B при Q4_K_M достигает 78.16 т/сек и оказался лучшей моделью теста по качеству и скорости.
- Задержка до первого токена у большинства моделей составляет доли секунды; заметно дольше (около 3 сек) думают только 14B-варианты ministral.
- Переход с квантизации на BF16 ощутимо снижает скорость: Llama-3-8B в bf16 выдала лишь 28.82 т/сек.
Температуры, охлаждение и питание
Благодаря 7-нм техпроцессу и микроархитектуре GCN 5.1 карта остаётся прохладной для своих характеристик. В тестовой системе рядом с MI50 (GPU0) стояла трёхвентиляторная Sapphire NITRO+ RX 5700 XT (GPU1), тоже на 7 нм, но на архитектуре RDNA 1. В простое обе карты холодные, а под серьёзной нагрузкой температура MI50 колебалась от 68 до 76 градусов и поднималась выше 80 только при очень длительной работе. Чаще всего она не превышала 75 градусов.
Но и такая «холодная» карта не обойдётся без активного охлаждения: у MI50 нет собственного вентилятора. В тесте использовалась слегка доработанная турбина от Tesla P40/P100. Крепёжные отверстия у турбины NVIDIA Tesla P40 не совпадают с отверстиями на MI50, так что узел пришлось фактически приклеивать.
Энергопотребление ограничено на уровне 225 Вт. Для сборки на базе десктопной платформы рекомендуется блок питания от 700 Вт и выше.
Итоги: кому подойдёт MI50
AMD Instinct MI50 — выдающаяся для своей цены видеокарта. Она даёт выгодное соотношение производительности и стоимости, а ещё и гибкость выбора:
- 16 ГБ подойдут, если вы запускаете некрупные модели с обычной длиной контекста и хотите сэкономить;
- 32 ГБ снимут ограничения по размеру моделей, если готовы заплатить больше.
Если вам нужна вычислительная мощность под Linux и вы готовы повозиться с ROCm или TheRock, MI50 будет правильным выбором. Если же вы не хотите самостоятельно подбирать плату, охлаждение и блок питания, проще обратиться к готовым решениям: посмотрите серверы для ИИ в каталоге или общий каталог серверов. Инженеры «СервакМастер» помогут подобрать конфигурацию под вашу задачу, достаточно связаться с нами.
*LLAMA — проект Meta Platforms Inc.**, деятельность которой в России признана экстремистской и запрещена.
**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена.
