В предыдущем материале мы разбирали локальный запуск популярных китайских нейросетей на оборудовании пользовательского уровня. Обычные ПК и недорогие серверы тянут только квантизированные версии DeepSeek, Qwen и других LLM из КНР. Но те же модели доступны в открытом доступе и в полном виде, без квантизации и с кратно большим числом параметров. Для их локальной установки нужно серьёзное серверное железо. Ниже разберём, зачем нужны полные версии, какие у них требования к видеопамяти и как собрать систему под такую нагрузку.
Зачем запускать полноразмерные модели
Резонный вопрос: зачем строить дорогую инфраструктуру под тяжёлую модель, если есть лёгкие, которые работают на недорогих устройствах? У полных версий LLM несколько весомых аргументов.
- Максимальная точность. Без квантизации модель сохраняет все параметры в полном объёме, а значит, реже ошибается и даёт меньше неточных ответов. Квантизация делает модель легче, но неизбежно немного снижает качество генерации, поэтому для критичных задач лучше брать полную версию.
- Конфиденциальность данных. Компании, которые работают с чувствительной информацией клиентов, не могут отправлять её в облачные ИИ-сервисы: утечка грозит судебными разбирательствами. При локальном развёртывании все данные остаются внутри сети организации и не выходят наружу.
- Возможность дообучения. Квантизация сильно ограничивает обучаемость модели, и адаптировать её под конкретные операции почти нельзя. Чтобы получить качественную нейросеть под свои задачи, нужен мощный сервер с полноразмерной моделью.
- Узкоспециализированные задачи. Часть неквантизированных моделей заточена под определённые операции, например, под работу с кодом. DeepSeek Coder v2 с 236 миллиардами параметров предназначена именно для этого. Такие модели можно развернуть у себя и автоматизировать рутину: проверку документов, поиск ошибок в коде и подобное.
- Интеграция с приложениями. Локальную модель можно напрямую подключить к внутренним системам компании. Тогда ИИ становится полноценной частью корпоративной инфраструктуры, а бизнес-процессы автоматизируются глубже.
Три модели и их требования к видеопамяти
DeepSeek R1 671B
DeepSeek R1 — самая популярная нейросеть в мире: меньше чем за месяц после выхода она обошла топовые модели ChatGPT и Llama. У неё есть несколько квантизированных версий и полная версия с 671 миллиардом параметров. Модель обучена на огромном массиве текстов методом дистилляции с участием нейросетей Qwen и Llama, поэтому разработчик потратил на неё заметно меньший бюджет, чем конкуренты на свои модели.
R1 применяют для автоматизации бизнес-процессов, создания контента, научных исследований, разработки ПО и многого другого. Хорошая масштабируемость при обучении и универсальность делают её одной из самых востребованных моделей для локального развёртывания.
Потребление видеопамяти на разных уровнях точности:
| Режим | Инференс | Обучение |
|---|---|---|
| FP32 («полная» точность) | 2700 ГБ VRAM | 5400 ГБ VRAM |
| FP16 (половинная точность) | 1350 ГБ VRAM | 2700 ГБ VRAM |
| FP8 / INT8 (низкая или целочисленная точность) | 680 ГБ VRAM | 1360 ГБ VRAM |
DeepSeek Coder v2 236B
DeepSeek Coder v2 — специализированная ветка линейки DeepSeek для генерации, анализа и исправления программного кода. У неё 236 миллиардов параметров, что делает её одной из самых производительных кодерских LLM на рынке, а по уровню она сопоставима с ChatGPT 4o. Модель обучена на огромном количестве кода на разных языках, среди которых Python, Java, C++, JavaScript, Go и многие другие. Поэтому она хорошо справляется с ускорением разработки, оптимизацией готового кода, написанием с нуля и обучением разработчиков. Кроме того, её можно дообучать, используя базу DeepSeek Coder V2-Base.
| Режим | Инференс | Обучение |
|---|---|---|
| FP32 («полная» точность) | 1830 ГБ VRAM | 2240 ГБ VRAM |
| FP16 (половинная точность) | 740 ГБ VRAM | 1120 ГБ VRAM |
| FP8 / INT8 (низкая или целочисленная точность) | 350 ГБ VRAM | 660 ГБ VRAM |
Qwen 2.5 72B
Qwen 2.5 — модель из серии LLM Qwen от Alibaba Cloud, в ней 72 миллиарда параметров. Её обучали на 18 триллионах токенов с использованием обширной базы данных Alibaba, благодаря чему по производительности она приближается к флагманской Qwen 2.5 Max. Модель мультимодальная: работает с текстом, кодом, математикой, изображениями, аудио и видео. Поддерживает контекст до 128 тысяч токенов и генерирует до 8 тысяч токенов за один запрос.
| Режим | Инференс | Обучение |
|---|---|---|
| FP32 («полная» точность) | 150 ГБ VRAM | 300 ГБ VRAM |
| FP16 (половинная точность) | 75 ГБ VRAM | 150 ГБ VRAM |
| FP8 / INT8 (низкая или целочисленная точность) | 40 ГБ VRAM | 80 ГБ VRAM |
Видно, что разброс огромный: Qwen 2.5 72B в FP8 уместится в память одного-двух ускорителей, а полный DeepSeek R1 требует терабайтов VRAM.
Чем хорошо отсутствие квантизации
Выше мы привели цифры для разных режимов. Теперь о том, что именно даёт работа без квантизации.
- Точность ответов. Неквантизированная модель при обработке запроса использует всю доступную точность представления данных. Если всё же выбираете квантизированную LLM, для обучения и инференса лучше брать режимы FP16 и FP8: они заметно уменьшают объём модели при минимальной потере точности.
- Дообучаемость. Полная модель сохраняет способность к эффективному дообучению, тогда как квантизированные версии из-за снижения точности весов могут стать практически необучаемыми.
- Связность ответов. Без квантизации модель лучше запоминает закономерности данных в текущем контекстном окне, поэтому сохраняет связь между ответами и выдаёт более релевантные результаты.
- Точность весов внимания. В современных LLM работает механизм внимания, который помогает фокусироваться на нужных деталях запроса. Полные модели вычисляют веса внимания точнее, а квантизированные теряют здесь качество и могут зацепиться за второстепенные детали.
- Длинные запросы. Неквантизированные ИИ обрабатывают длинные пользовательские токены без потери точности, поэтому можно писать проработанные промпты и получать более релевантные результаты.
Подробнее о тонкостях квантизации больших языковых моделей можно прочитать в других материалах блога «СервакМастер».
Как собрать систему под такие модели
Неквантизированные модели с большим числом параметров требуют терабайты видеопамяти, а у самых мощных графических ускорителей её всего несколько сотен гигабайт. Добиться нужного объёма можно двумя путями: собрать GPU-сервер из нескольких ускорителей или поставить в обычный сервер много оперативной памяти. В обоих случаях для инференса мощных китайских моделей понадобится высокопроизводительный серверный процессор.
GPU-сервер для DeepSeek R1 и Qwen 2.5
Самый популярный и эффективный, но и самый дорогой путь — GPU-сервер на восемь и более мощных ускорителей. Такая машина даёт порядка 2 ТБ VRAM, достаточно, чтобы разместить в видеопамяти веса модели. Варианты сборок:
Для DeepSeek R1 671B
- 8 ускорителей Nvidia B200 по 288 ГБ VRAM нового поколения, в сумме 2,3 ТБ.
- 8 ускорителей AMD Instinct MI325 по 256 ГБ VRAM: они дешевле и дают 2 ТБ видеопамяти.
Для Qwen 2.5 72B
- 8 ускорителей AMD MI300X по 192 ГБ VRAM, в сумме 1,5 ТБ.
- 8 ускорителей Nvidia H200 NVL по 141 ГБ VRAM, вместе около 1 ТБ.
Сервер с большим объёмом RAM
Существенно более бюджетная, но и заметно менее эффективная альтернатива — обычный сервер с несколькими терабайтами оперативной памяти (от 2 до 4 ТБ). У такого решения есть жёсткие ограничения: обучить модель на нём не получится, а инференс будет кратно медленнее, чем на GPU-сервере. Единственная причина выбрать этот вариант — экономия бюджета: столько RAM можно поставить практически в любой сервер, а модули памяти стоят намного дешевле мощных GPU. Большинство серверов поддерживает до 32 модулей оперативной памяти, так что объём масштабируется до нескольких терабайт.
Что выбрать
- Нужны обучение, дообучение и быстрый отклик — берите GPU-сервер с восемью ускорителями, ориентируясь на таблицы VRAM выше.
- Нужен только запуск, скорость вторична, а бюджет ограничен — подойдёт сервер на 2-4 ТБ RAM.
- Для Qwen 2.5 72B достаточно существенно меньшей конфигурации, чем для DeepSeek R1 671B; режимы FP16 и FP8 экономят видеопамять почти без потери точности.
Готовые решения для ИИ-нагрузок собраны в разделе ИИ-серверы, а универсальные платформы с большим объёмом RAM — в каталоге серверов.
Вывод
Высокая производительность при развёртывании ИИ без квантизации обходится дорого даже крупным IT-компаниям. Но с одной из больших китайских LLM, описанных выше, бизнес выходит на новый уровень: автоматизация рутинных процессов, быстрое создание кода для корпоративных приложений, упрощение составления документации — это лишь малая часть задач, с которыми справляются DeepSeek R1 и Qwen 2.5. Если вы хотите собрать сервер под эти нейросети, но не знаете, какие компоненты выбрать, обратитесь в «СервакМастер» через раздел контактов: специалисты проконсультируют и подберут конфигурацию под ваши задачи и требования.
