Введение

Текстовые языковые модели — только часть картины для многогпу-серверов. Гораздо интереснее посмотреть, на что способна та же машина при генерации изображений и видео. Именно это мы и проверили: взяли сервер с восемью Tesla P100, подняли на нём несколько экземпляров ComfyUI и прогнали четыре модели — от скоростных до качественных. Ниже — реальные цифры, наблюдения по качеству вывода и подводные камни, с которыми столкнулись при настройке.

Начнём с характеристик тестовой платформы, чтобы результаты можно было правильно интерпретировать.

Характеристики тестового сервера

  • Материнская плата: Supermicro X10DRG-O+-CPU
  • Чипсет: Intel C612
  • Форм-фактор: 4U GPU-сервер
  • Процессоры: 2 × Intel Xeon E5-2687W v4
  • Ядра / потоки: 24 ядра, 48 потоков суммарно
  • Частота CPU: 3,00 ГГц базовая, Turbo Boost до 3,50 ГГц
  • Кэш L3: 30 МБ на процессор, 60 МБ суммарно
  • ОЗУ: 128 ГБ DDR4 ECC
  • Видеокарты: 8 × NVIDIA Tesla P100 PCIe 16 ГБ
  • Суммарный объём VRAM: 128 ГБ
  • ОС: Ubuntu 24.04.4 LTS

Как устроена PCIe-топология

Подключение восьми ускорителей к двум процессорам реализовано через PCIe-коммутаторы, а не напрямую. Каждый процессор «ведёт» свою группу из четырёх карт: от CPU идёт одна PCIe-ветка к коммутатору, который затем делит её на пары ускорителей.

Причина архитектурная: процессоры Intel Xeon E5 v4 предоставляют ограниченное число PCIe-линий, и выдать каждому из восьми GPU честный слот x16 без коммутаторов просто невозможно. Данная схема несколько снижает межкарточную пропускную способность, однако для независимой параллельной генерации контента это несущественно — каждая карта работает со своим потоком данных и не нуждается в активном обмене с соседними.

Методология: почему именно параллельные потоки

Объединить VRAM нескольких Tesla P100 в единый пул для диффузионных моделей — в отличие от ситуации с языковыми моделями — невозможно. Ускорить генерацию одного изображения силами нескольких карт также не получится: диффузионный процесс принципиально последователен в рамках одного запроса.

Поэтому мы выбрали единственно осмысленный подход: запустили восемь независимых процессов ComfyUI — по одному на каждый GPU — и подавали им одинаковый промт одновременно. Замеряли среднее время завершения одного запроса. Такой подход позволяет оценить реальную пропускную способность кластера: вместо одного результата за N секунд — восемь результатов за примерно то же время.

В тестировании участвовали три модели для генерации изображений и одна — для видео.

Результаты тестирования

Модель Разрешение Среднее время, сек Примечание
Z-Image Turbo 1024×1024 67,55 Наибыстрейший результат; встречаются анатомические артефакты
FLUX 2 4B 1024×1024 195,04 Чистый вывод, артефактов практически нет
Kandinsky 5.0 Image Lite 1024×1024 689,89 Лучшее качество среди image-моделей, хорошо понимает русскоязычные промты
Kandinsky 5.0 Video Lite 768×512 2667,94 Приемлемое качество видео, поддерживает русский язык

Разбор результатов по моделям

Скорость отдельной Tesla P100 для диффузионных задач нельзя назвать впечатляющей: карты проектировались в 2016–2018 годах для научных расчётов, а не для работы с диффузионными нейросетями. Но восемь параллельных потоков кардинально меняют оценку с точки зрения суммарной производительности.

Z-Image Turbo — 67,55 секунды на изображение 1024×1024. Это самый быстрый результат в нашем тесте. Однако модель периодически выдаёт артефакты в области анатомии человеческих фигур. Если точность важна, приходится отсеивать часть генераций вручную. Подходит для сценариев, где нужна высокая скорость при умеренных требованиях к детализации.

FLUX 2 4B — 195,04 секунды. Качество стабильно высокое: изображения без выраженных артефактов, детали проработаны хорошо. За тройной прирост времени по сравнению с Z-Image Turbo получаем заметно более предсказуемый вывод. Оптимальный выбор, если нужен баланс между скоростью и качеством.

Kandinsky 5.0 Image Lite — 689,89 секунды, то есть почти 12 минут на одну карту. Зато это лучшее качество из трёх image-моделей и единственная из протестированных, которая уверенно обрабатывает промты на русском языке без предварительного перевода. Для русскоязычных проектов это конкурентное преимущество.

Kandinsky 5.0 Video Lite — 2667,94 секунды (около 44 минут) на одну видеогенерацию в режиме одной карты. Результат приемлемый, при этом модель также воспринимает русские промты. При восьми параллельных GPU за то же время можно получить восемь роликов, что принципиально меняет оценку целесообразности.

Сложности при настройке нескольких экземпляров ComfyUI

Неожиданно, но главные трудности обнаружились не в процессе генерации, а на этапе запуска восьми процессов ComfyUI одновременно. Проблема оказалась в общей базе данных: каждый экземпляр по умолчанию обращается к одному и тому же файлу comfyui.db, что при параллельном запуске порождает конфликты блокировок и ошибки.

Чтобы устранить коллизии, пришлось настроить каждый процесс отдельно:

  • назначить уникальный сетевой порт каждому экземпляру;
  • указать отдельную рабочую директорию со своей базой данных;
  • явно задать пути к директориям моделей и вывода для каждого процесса.

Это стандартная особенность ComfyUI: изначально инструмент рассчитан на работу с одной видеокартой, и поддержка нескольких GPU требует ручной конфигурации. После устранения конфликтов все восемь экземпляров работали стабильно на протяжении всего тестового прогона.

Для каких задач подходит такая конфигурация

Восемь Tesla P100 в ComfyUI — это не про скорость на один запрос. Это про пропускную способность при параллельной работе. Если стоит задача производить сотни изображений или десятки видеороликов за рабочую сессию, подобная платформа оправдана с экономической точки зрения: Tesla P100 значительно дешевле современных флагманских ускорителей, а суммарный объём VRAM в 128 ГБ позволяет держать несколько тяжёлых моделей в памяти одновременно.

Если же требуется максимальная скорость на единичный запрос или работа с моделями, которым нужна объединённая VRAM, — нужно смотреть в сторону более современных решений.

Вывод

Тест показал, что кластер из восьми NVIDIA Tesla P100 PCIe 16 ГБ вполне применим для коммерческой параллельной генерации изображений и видео. При правильной настройке восемь независимых потоков ComfyUI обеспечивают предсказуемую и линейно масштабируемую пропускную способность. СервакМастер предлагает серверы на базе Tesla P100 как в аренду, так и в продажу — обратитесь к нам, чтобы подобрать конфигурацию под конкретные производственные задачи.