Что показали реальные тесты NVIDIA DGX Spark
24.10.2025 · ~ 2 мин
NVIDIA DGX Spark вызвал широкий интерес ещё на стадии анонса: компактный настольный суперкомпьютер обещал локальный запуск крупных языковых моделей без облаков и корпоративных ЦОД. Свежие бенчмарки на прошивке 580.95.05 с движком Ollama v0.12.6 дали противоречивый результат — блестящие показатели в одном сценарии соседствуют с ощутимым разочарованием в другом.
Команда СервакМастер разобрала опубликованные результаты, чтобы помочь вам сделать взвешенный выбор.
Нативный формат MXFP4: где DGX Spark действительно силён
В режиме MXFP4 устройство выдаёт цифры, которые трудно получить на компактном железе. На крупных MoE-архитектурах гигантского класса результаты говорят сами за себя:
- gpt-oss 120B — 41–58 токенов/с, что опережает H200 при BF16
- gpt-oss 20B — стабильно около 40 токенов/с с минимальной задержкой первого токена
- Скорость префилла остаётся высокой даже для моделей с сотнями миллиардов параметров
Для корпоративного рабочего потока, целиком построенного на нативных моделях NVIDIA в формате MXFP4, DGX Spark практически не имеет конкурентов в своём форм-факторе. Это убедительный аргумент для edge-инференса в производственных средах с закрытым стеком.
Q4_K_M и Q8_0: где устройство теряет позиции
Картина резко меняется, когда в дело вступают популярные квантованные форматы открытой экосистемы — те самые, которые ежедневно используются в llama.cpp, Ollama и других проектах сообщества:
- LLaMA 8B, Q4_K_M — префилл около 7k токенов/с, но декодирование падает до 10–30 токенов/с
- Gemma 12B, Q4_K_M — префилл порядка 1,8k токенов/с, декодирование не превышает 20–25 токенов/с
- Qwen3 32B, Q4_K_M — декодирование деградирует до 9 токенов/с
- Qwen3 32B, Q8_0 — показатели ещё ниже, чем в Q4_K_M
- DeepSeek-R1 14B — при переходе с MXFP4 на Q8_0 скорость снижается почти вдвое
Особенно показательно, что даже сравнительно небольшие модели не получают ожидаемого ускорения от аппаратной платформы. В ряде сценариев DGX Spark уступает решениям предыдущего поколения.
Причины: архитектурный выбор и незрелость программного стека
Всё указывает на то, что Grace Blackwell и сопутствующий программный стек оптимизировались под MXFP4 в первую очередь. Поддержка сторонних форматов пока реализована по остаточному принципу:
- Специализированных ядер для Q4_K_M и Q8_0 под архитектуру Grace Blackwell пока нет
- Ollama использует универсальные пути выполнения без задействования аппаратных инструкций платформы
- Совместимость с широкой экосистемой открытых моделей остаётся ограниченной на момент тестирования
Это типичная ситуация для первых ревизий нового железа: оптимизации появятся с обновлениями, но ждать придётся.
Кому подходит DGX Spark, а кому — нет
Подходит, если:
- Вы строите закрытый корпоративный инференс на официальных моделях NVIDIA
- Рабочий поток целиком завязан на формат MXFP4
- Приоритет — максимальная скорость на MoE-моделях класса 120B в компактном устройстве
Стоит подождать или рассмотреть альтернативы, если:
- Основной сценарий — запуск open-source моделей через Ollama или llama.cpp
- Вы используете форматы Q4_K_M, Q8_0 или FP8
- Критична совместимость с широкой экосистемой открытых весов
СервакМастер рекомендует уточнять актуальный статус поддержки форматов перед покупкой: с выходом новых версий Ollama и фирменного ПО NVIDIA ситуация может измениться принципиально.
Итог
NVIDIA DGX Spark — это мощный специализированный инструмент, а не универсальное устройство для всех задач инференса. В MXFP4 на крупных MoE-моделях он демонстрирует результаты, недостижимые для конкурентов в аналогичном форм-факторе. Однако слабая оптимизация под форматы Q4_K_M и Q8_0 делает его неудобным выбором для тех, кто работает с открытой экосистемой LLM. Главный вопрос — когда NVIDIA закроет этот разрыв на уровне драйверов и движков инференса.
Если вам нужна консультация по подбору серверного оборудования для задач машинного обучения и инференса — свяжитесь с нами.
