Что показали реальные тесты NVIDIA DGX Spark

24.10.2025 · ~ 2 мин

NVIDIA DGX Spark вызвал широкий интерес ещё на стадии анонса: компактный настольный суперкомпьютер обещал локальный запуск крупных языковых моделей без облаков и корпоративных ЦОД. Свежие бенчмарки на прошивке 580.95.05 с движком Ollama v0.12.6 дали противоречивый результат — блестящие показатели в одном сценарии соседствуют с ощутимым разочарованием в другом.

Команда СервакМастер разобрала опубликованные результаты, чтобы помочь вам сделать взвешенный выбор.


Нативный формат MXFP4: где DGX Spark действительно силён

В режиме MXFP4 устройство выдаёт цифры, которые трудно получить на компактном железе. На крупных MoE-архитектурах гигантского класса результаты говорят сами за себя:

  • gpt-oss 120B — 41–58 токенов/с, что опережает H200 при BF16
  • gpt-oss 20B — стабильно около 40 токенов/с с минимальной задержкой первого токена
  • Скорость префилла остаётся высокой даже для моделей с сотнями миллиардов параметров

Для корпоративного рабочего потока, целиком построенного на нативных моделях NVIDIA в формате MXFP4, DGX Spark практически не имеет конкурентов в своём форм-факторе. Это убедительный аргумент для edge-инференса в производственных средах с закрытым стеком.


Q4_K_M и Q8_0: где устройство теряет позиции

Картина резко меняется, когда в дело вступают популярные квантованные форматы открытой экосистемы — те самые, которые ежедневно используются в llama.cpp, Ollama и других проектах сообщества:

  • LLaMA 8B, Q4_K_M — префилл около 7k токенов/с, но декодирование падает до 10–30 токенов/с
  • Gemma 12B, Q4_K_M — префилл порядка 1,8k токенов/с, декодирование не превышает 20–25 токенов/с
  • Qwen3 32B, Q4_K_M — декодирование деградирует до 9 токенов/с
  • Qwen3 32B, Q8_0 — показатели ещё ниже, чем в Q4_K_M
  • DeepSeek-R1 14B — при переходе с MXFP4 на Q8_0 скорость снижается почти вдвое

Особенно показательно, что даже сравнительно небольшие модели не получают ожидаемого ускорения от аппаратной платформы. В ряде сценариев DGX Spark уступает решениям предыдущего поколения.


Причины: архитектурный выбор и незрелость программного стека

Всё указывает на то, что Grace Blackwell и сопутствующий программный стек оптимизировались под MXFP4 в первую очередь. Поддержка сторонних форматов пока реализована по остаточному принципу:

  • Специализированных ядер для Q4_K_M и Q8_0 под архитектуру Grace Blackwell пока нет
  • Ollama использует универсальные пути выполнения без задействования аппаратных инструкций платформы
  • Совместимость с широкой экосистемой открытых моделей остаётся ограниченной на момент тестирования

Это типичная ситуация для первых ревизий нового железа: оптимизации появятся с обновлениями, но ждать придётся.


Кому подходит DGX Spark, а кому — нет

Подходит, если:

  • Вы строите закрытый корпоративный инференс на официальных моделях NVIDIA
  • Рабочий поток целиком завязан на формат MXFP4
  • Приоритет — максимальная скорость на MoE-моделях класса 120B в компактном устройстве

Стоит подождать или рассмотреть альтернативы, если:

  • Основной сценарий — запуск open-source моделей через Ollama или llama.cpp
  • Вы используете форматы Q4_K_M, Q8_0 или FP8
  • Критична совместимость с широкой экосистемой открытых весов

СервакМастер рекомендует уточнять актуальный статус поддержки форматов перед покупкой: с выходом новых версий Ollama и фирменного ПО NVIDIA ситуация может измениться принципиально.


Итог

NVIDIA DGX Spark — это мощный специализированный инструмент, а не универсальное устройство для всех задач инференса. В MXFP4 на крупных MoE-моделях он демонстрирует результаты, недостижимые для конкурентов в аналогичном форм-факторе. Однако слабая оптимизация под форматы Q4_K_M и Q8_0 делает его неудобным выбором для тех, кто работает с открытой экосистемой LLM. Главный вопрос — когда NVIDIA закроет этот разрыв на уровне драйверов и движков инференса.

Если вам нужна консультация по подбору серверного оборудования для задач машинного обучения и инференса — свяжитесь с нами.