Устройство, о котором нельзя сказать «хорошее» или «плохое»
DGX Spark вызвал большой интерес ещё на анонсе: компактный настольный компьютер, обещающий локальный запуск крупных языковых моделей без облака и серверной.
Опубликованные результаты тестов дали картину, которую невозможно свести к одной оценке. В одном сценарии устройство показывает цифры, недостижимые для конкурентов его размера. В другом — уступает решениям предыдущего поколения.
Разберёмся, откуда такой разброс и что из этого следует при покупке.
Где устройство действительно сильно
В формате MXFP4 — родном для платформы — результаты впечатляют.
На крупных моделях архитектуры «смесь экспертов» получено:
- Модель на 120 миллиардов параметров — 41–58 токенов в секунду, что опережает результаты значительно более дорогих серверных ускорителей при работе в формате повышенной точности;
- Модель на 20 миллиардов параметров — стабильно около 40 токенов в секунду при минимальной задержке до первого токена;
- Скорость обработки входного запроса остаётся высокой даже на моделях с сотнями миллиардов параметров.
Для компактного настольного устройства это выдающийся результат. Если рабочий процесс целиком построен на моделях в этом формате, конкурентов в таком форм-факторе у него практически нет.
Где всё меняется
Картина разворачивается, как только в дело вступают квантования, которыми пользуется всё открытое сообщество:
| Модель и формат | Обработка запроса | Генерация |
|---|---|---|
| LLaMA 8B, Q4_K_M | около 7000 токенов/с | 10–30 токенов/с |
| Gemma 12B, Q4_K_M | около 1800 токенов/с | 20–25 токенов/с |
| Qwen3 32B, Q4_K_M | — | около 9 токенов/с |
| Qwen3 32B, Q8_0 | — | ниже, чем в Q4_K_M |
| DeepSeek-R1 14B | — | при переходе с MXFP4 на Q8_0 падение почти вдвое |
Обратите внимание на разрыв между двумя столбцами. Обработка входного запроса идёт быстро, а генерация ответа проваливается. Это характерный признак того, что вычислительная мощность есть, но конкретный путь исполнения не оптимизирован.
Особенно показательно, что даже небольшие модели не получают ожидаемого ускорения. То есть проблема не в нехватке ресурсов.
Почему так вышло
Причина в приоритетах разработки и незрелости программной части.
Платформа и сопутствующий стек оптимизировались в первую очередь под собственный формат. Поддержка сторонних квантований реализована по остаточному принципу:
- специализированных вычислительных ядер под популярные форматы квантования на момент тестов нет;
- распространённые движки инференса используют универсальные пути исполнения, не задействуя аппаратные возможности платформы;
- совместимость с широкой экосистемой открытых моделей остаётся ограниченной.
Это типичная ситуация для первой ревизии нового железа. Оптимизации со временем появятся — вопрос в том, сколько ждать и готовы ли вы ждать.
Кому подходит, а кому нет
Подходит, если:
- вы строите закрытый корпоративный инференс на официальных моделях производителя;
- рабочий процесс целиком завязан на родной формат платформы;
- нужна максимальная скорость на крупных моделях в компактном устройстве.
Стоит подождать или смотреть альтернативы, если:
- основной сценарий — запуск моделей из открытого доступа через популярные движки;
- вы работаете с распространёнными форматами квантования;
- критична совместимость с широкой экосистемой открытых весов.
Второй сценарий, надо признать, охватывает большинство тех, кто интересуется локальным запуском моделей. Именно ради свободы выбора моделей люди и уходят от облачных сервисов.
Что делать перед покупкой
Проверьте актуальный статус поддержки форматов. С выходом новых версий движков инференса и фирменного программного обеспечения ситуация может измениться принципиально. Данные тестов устаревают быстро.
Определите свои форматы заранее. Составьте список моделей и квантований, с которыми реально работаете. Если они все в родном формате платформы — вопросов нет. Если нет — вопрос открыт.
Не ориентируйтесь на пиковые цифры. Результат на одной модели в одном формате ничего не говорит о поведении на вашей задаче. Это тот случай, когда среднее по больнице бесполезно.
Итог
DGX Spark — специализированный инструмент, а не универсальное устройство для локального инференса. В родном формате на крупных моделях он показывает результаты, недостижимые для конкурентов его размера. На популярных открытых квантованиях — уступает решениям заметно проще и дешевле.
Разрыв объясняется незрелостью программной части, а не аппаратными ограничениями. Скорее всего, он сократится с обновлениями. Но покупать железо в расчёте на будущие оптимизации — решение, которое стоит принимать осознанно.
Практический вывод простой: определите свои форматы до покупки. Ответ на вопрос «подходит ли вам это устройство» полностью зависит от того, в чём вы запускаете модели.
Подбираете оборудование под локальный инференс — расскажите, какие модели и форматы используете, поможем сопоставить варианты.
