Intel Arc Pro B60 в vLLM: полноценный инференс крупных языковых моделей на доступном GPU

12.11.2025 · ~ 2 мин · СервакМастер


Что произошло

Разработчики vLLM совместно с командой Intel завершили интеграцию профессиональных ускорителей серии Arc Pro B в популярный фреймворк инференса. Теперь карты Intel Arc Pro B60 официально поддерживаются в vLLM — это означает, что организации и исследователи могут запускать крупные языковые модели локально, не прибегая к дорогостоящим вычислительным ускорителям корпоративного класса.

Arc Pro B60 позиционируется в среднем ценовом сегменте профессиональных GPU для ИИ-задач. Большой объём видеопамяти, поддержка многокарточных конфигураций и зрелый программный стек делают эту карту практичным выбором для развёртывания LLM-сервисов в собственной инфраструктуре.


Технические новшества поддержки Arc Pro B60 в vLLM

PCIe P2P и многокарточное масштабирование

Ключевое нововведение — прямая передача данных между GPU по шине PCIe (P2P) без участия оперативной памяти хоста. Это снижает задержки и увеличивает пропускную способность при работе нескольких карт в одной системе.

Поддерживаются все три основные схемы параллелизма:

  • Data Parallelism (DP) — разные запросы обрабатываются разными GPU;
  • Tensor Parallelism (TP) — вычисление одного слоя распределяется между несколькими картами;
  • Pipeline Parallelism (PP) — слои модели распределяются по картам последовательно.

Поддерживаемые форматы точности

vLLM с Arc Pro B60 работает со следующими форматами:

  • FP8, FP16, BF16 — для высокой точности вычислений;
  • MXFP4 и INT4 — для агрессивного квантования.

Оптимизированное квантование обеспечивает до 30% экономии видеопамяти по сравнению с эталонными реализациями, что критично при работе с моделями на десятки миллиардов параметров.

Асинхронное планирование задач

Планировщик vLLM был доработан для минимизации простоев вычислительных блоков: асинхронная обработка очереди запросов снижает накладные расходы и сглаживает пики нагрузки при высоком трафике.


Оптимизация GEMM-ядра для архитектур MoE

Особого внимания заслуживает переработка ядра матричного умножения (GEMM) для моделей с архитектурой Mixture of Experts (MoE). В классической реализации неравномерное распределение «экспертов» по вычислительным группам GPU приводило к простоям и потере производительности.

Решение: persistent kernel (ядро с постоянным циклом) в сочетании с динамической балансировкой вычислительных групп. Результат:

  • паузы при переключении между экспертами модели устранены;
  • утилизация вычислительных ресурсов GPU достигает 80%;
  • стабильная скорость генерации поддерживается для моделей типа DeepSeek и других LLM на базе MoE.

Совместимые модели

Поддержка Arc Pro B60 проверена на широком спектре современных LLM:

  • DeepSeek — дистиллированные версии от 8B до 70B параметров;
  • GPT-OSS — варианты 20B (1 GPU, MXFP4) и 120B (4 GPU, MXFP4);
  • Qwen — различные размеры, включая мультимодальные версии;
  • другие открытые архитектуры на базе Transformer и MoE.

Результаты тестирования производительности

DeepSeek (8 карт Intel Arc Pro B60)

При запуске дистиллированных моделей DeepSeek с 8 до 70 млрд параметров на восьми картах Arc Pro B60:

  • TPOT (задержка следующего токена) — менее 100 мс даже при расширенном контексте;
  • длина контекста до 40 000 токенов — скорость генерации остаётся стабильной.

Это ключевой показатель для практических задач: длинный контекст необходим при анализе объёмных документов, работе с кодовыми базами или многоходовыми диалогами.

GPT-OSS-20B (MXFP4, 1 GPU)

Метрика Значение
Пропускная способность (1024/1024 токенов) ~1210 токенов/с
TTFT (задержка первого токена) 7,6 с
TPOT (задержка следующего токена) 54 мс
Пропускная способность (5120 токенов) ~417 токенов/с

При контексте 5120 токенов пропускная способность снижается до ~417 токенов/с — результат, вполне достаточный для производственных нагрузок среднего масштаба.

GPT-OSS-120B (MXFP4, 4 GPU)

Метрика Значение
Пропускная способность (1024/1024 токенов) до 1495 токенов/с
TTFT (задержка первого токена) менее 8,1 с
TPOT (задержка следующего токена) ~59 мс

Четыре карты Arc Pro B60 справляются с моделью на 120 млрд параметров с пропускной способностью до 1495 токенов/с — это конкурентный результат для ускорителей данного ценового диапазона.


Практический вывод

Добавление Intel Arc Pro B60 в экосистему vLLM существенно расширяет выбор аппаратных платформ для локального ИИ-инференса. Сочетание многокарточного масштабирования, поддержки квантования MXFP4/INT4 и оптимизированного GEMM-ядра для MoE-архитектур делает Arc Pro B60 реальной альтернативой более дорогим решениям в задачах разработки, тестирования и развёртывания LLM-сервисов с умеренной нагрузкой.

По абсолютной производительности Intel Arc Pro B60 ещё уступает топовым ускорителям NVIDIA и AMD корпоративного класса. Тем не менее для команд, которым важно соотношение стоимость/производительность и возможность гибко масштабироваться от одного до восьми GPU, это решение заслуживает внимания.

Если вам нужна помощь с подбором серверного оборудования для развёртывания LLM на Intel Arc Pro B60 или других профессиональных GPU — обращайтесь к специалистам СервакМастер. Поможем выбрать оптимальную конфигурацию под ваши задачи и бюджет.


Автор: редакция СервакМастер