Intel Arc Pro B60 в vLLM: полноценный инференс крупных языковых моделей на доступном GPU
12.11.2025 · ~ 2 мин · СервакМастер
Что произошло
Разработчики vLLM совместно с командой Intel завершили интеграцию профессиональных ускорителей серии Arc Pro B в популярный фреймворк инференса. Теперь карты Intel Arc Pro B60 официально поддерживаются в vLLM — это означает, что организации и исследователи могут запускать крупные языковые модели локально, не прибегая к дорогостоящим вычислительным ускорителям корпоративного класса.
Arc Pro B60 позиционируется в среднем ценовом сегменте профессиональных GPU для ИИ-задач. Большой объём видеопамяти, поддержка многокарточных конфигураций и зрелый программный стек делают эту карту практичным выбором для развёртывания LLM-сервисов в собственной инфраструктуре.
Технические новшества поддержки Arc Pro B60 в vLLM
PCIe P2P и многокарточное масштабирование
Ключевое нововведение — прямая передача данных между GPU по шине PCIe (P2P) без участия оперативной памяти хоста. Это снижает задержки и увеличивает пропускную способность при работе нескольких карт в одной системе.
Поддерживаются все три основные схемы параллелизма:
- Data Parallelism (DP) — разные запросы обрабатываются разными GPU;
- Tensor Parallelism (TP) — вычисление одного слоя распределяется между несколькими картами;
- Pipeline Parallelism (PP) — слои модели распределяются по картам последовательно.
Поддерживаемые форматы точности
vLLM с Arc Pro B60 работает со следующими форматами:
- FP8, FP16, BF16 — для высокой точности вычислений;
- MXFP4 и INT4 — для агрессивного квантования.
Оптимизированное квантование обеспечивает до 30% экономии видеопамяти по сравнению с эталонными реализациями, что критично при работе с моделями на десятки миллиардов параметров.
Асинхронное планирование задач
Планировщик vLLM был доработан для минимизации простоев вычислительных блоков: асинхронная обработка очереди запросов снижает накладные расходы и сглаживает пики нагрузки при высоком трафике.
Оптимизация GEMM-ядра для архитектур MoE
Особого внимания заслуживает переработка ядра матричного умножения (GEMM) для моделей с архитектурой Mixture of Experts (MoE). В классической реализации неравномерное распределение «экспертов» по вычислительным группам GPU приводило к простоям и потере производительности.
Решение: persistent kernel (ядро с постоянным циклом) в сочетании с динамической балансировкой вычислительных групп. Результат:
- паузы при переключении между экспертами модели устранены;
- утилизация вычислительных ресурсов GPU достигает 80%;
- стабильная скорость генерации поддерживается для моделей типа DeepSeek и других LLM на базе MoE.
Совместимые модели
Поддержка Arc Pro B60 проверена на широком спектре современных LLM:
- DeepSeek — дистиллированные версии от 8B до 70B параметров;
- GPT-OSS — варианты 20B (1 GPU, MXFP4) и 120B (4 GPU, MXFP4);
- Qwen — различные размеры, включая мультимодальные версии;
- другие открытые архитектуры на базе Transformer и MoE.
Результаты тестирования производительности
DeepSeek (8 карт Intel Arc Pro B60)
При запуске дистиллированных моделей DeepSeek с 8 до 70 млрд параметров на восьми картах Arc Pro B60:
- TPOT (задержка следующего токена) — менее 100 мс даже при расширенном контексте;
- длина контекста до 40 000 токенов — скорость генерации остаётся стабильной.
Это ключевой показатель для практических задач: длинный контекст необходим при анализе объёмных документов, работе с кодовыми базами или многоходовыми диалогами.
GPT-OSS-20B (MXFP4, 1 GPU)
| Метрика | Значение |
|---|---|
| Пропускная способность (1024/1024 токенов) | ~1210 токенов/с |
| TTFT (задержка первого токена) | 7,6 с |
| TPOT (задержка следующего токена) | 54 мс |
| Пропускная способность (5120 токенов) | ~417 токенов/с |
При контексте 5120 токенов пропускная способность снижается до ~417 токенов/с — результат, вполне достаточный для производственных нагрузок среднего масштаба.
GPT-OSS-120B (MXFP4, 4 GPU)
| Метрика | Значение |
|---|---|
| Пропускная способность (1024/1024 токенов) | до 1495 токенов/с |
| TTFT (задержка первого токена) | менее 8,1 с |
| TPOT (задержка следующего токена) | ~59 мс |
Четыре карты Arc Pro B60 справляются с моделью на 120 млрд параметров с пропускной способностью до 1495 токенов/с — это конкурентный результат для ускорителей данного ценового диапазона.
Практический вывод
Добавление Intel Arc Pro B60 в экосистему vLLM существенно расширяет выбор аппаратных платформ для локального ИИ-инференса. Сочетание многокарточного масштабирования, поддержки квантования MXFP4/INT4 и оптимизированного GEMM-ядра для MoE-архитектур делает Arc Pro B60 реальной альтернативой более дорогим решениям в задачах разработки, тестирования и развёртывания LLM-сервисов с умеренной нагрузкой.
По абсолютной производительности Intel Arc Pro B60 ещё уступает топовым ускорителям NVIDIA и AMD корпоративного класса. Тем не менее для команд, которым важно соотношение стоимость/производительность и возможность гибко масштабироваться от одного до восьми GPU, это решение заслуживает внимания.
Если вам нужна помощь с подбором серверного оборудования для развёртывания LLM на Intel Arc Pro B60 или других профессиональных GPU — обращайтесь к специалистам СервакМастер. Поможем выбрать оптимальную конфигурацию под ваши задачи и бюджет.
Автор: редакция СервакМастер
