С момента выхода первой версии этого материала в 2024 году мир искусственного интеллекта сильно изменился. Локальный инференс перестал быть экспериментом: почти каждый энтузиаст теперь хочет собрать ИИ-ПК, рабочую станцию или целый сервер, чтобы запускать современные нейросети, которые на голову выше тех, что мы разбирали раньше. Команда «СервакМастер» обновила статью: ниже подборка лучших моделей для развертывания на собственном железе и честный разговор о том, сколько видеопамяти каждой из них нужно.
Зачем запускать нейросети у себя
Вопрос во многом риторический, но у локального ИИ есть вполне практические причины.
- Конфиденциальность. Данные, чаты и любые странные ночные диалоги с моделью остаются только у вас. Ничего не уходит в облако и не оседает в чужих базах, из которых потом строят профили для таргетированной рекламы.
- Автономность. Интернет не нужен. Если провайдер отключился посреди сессии вайбкодинга перед дедлайном, локальная модель продолжит выдавать код, пусть и с дырами, как вы и (не)хотели.
- Нет подписок и лимитов. Не нужно ежемесячно платить крупным ИИ-вендорам ради очередной порции токенов. Единственная статья расходов на работу модели, которой вы владеете, это счета за электричество.
- Гибкость. Можно экспериментировать с квантизациями, форматами вычислений и тонкими настройками, а универсальную языковую модель превратить в узкого специалиста: автора карточек товаров, генератор кода под корпоративные приложения или помощника по бухгалтерской документации. Дообучение заслуживает отдельной статьи, поэтому здесь мы говорим именно об инференсе.
Что нужно из железа
Если вы представляете, как заходите на GitHub, нажимаете Download и Install и сразу получаете собственный ИИ, придётся разочароваться. Сначала нужно развернуть программную среду, выбрать движок и разобраться, что и как устанавливать. Но главное препятствие всё же железо: нейросеть состоит из тысяч слоёв, между которыми гоняются огромные объёмы данных, и обычными бюджетными компонентами тут не отделаться.
| Компонент | Роль в системе | На что обратить внимание |
|---|---|---|
| Графический ускоритель | Двигатель: обрабатывает данные на тысячах потоков | Объём и тип видеопамяти (особенно HBM), производительность в нужных режимах вычислений, поддержка форматов |
| NVMe-накопители | Топливный бак: быстро подают веса модели в GPU | Скорость последовательного чтения и ёмкость; в агентных инфраструктурах без быстрых NVMe агентные рои «задыхаются» без данных |
| Центральный процессор | Руль: распределяет ресурсы, готовит данные для GPU, управляет очередями | Для одной лёгкой модели хватит потребительского чипа с PCIe 4.0/5.0 и 8/16 ядрами; для агентных нагрузок нужен мощный серверный CPU |
| Оперативная память | Хранит данные модели перед отправкой в VRAM | Для лёгких моделей около 30 млрд параметров нужно 64 ГБ; для инференса на CPU минимум 96 ГБ |
| Материнская плата | Рама системы | Должна поддерживать всё перечисленное и иметь достаточно слотов |
Особо отметим два момента. Во-первых, формат вычислений должен поддерживаться видеокартой: если веса модели загружены в FP4, а ускоритель умеет только FP8, придётся искать другую сборку модели. Чем лучше GPU работает в нужном режиме, тем быстрее генерируются токены. Во-вторых, времена инференса на процессоре через llama.cpp можно считать пройденным этапом: и оперативной памяти потребуется много, и скорость сильно просядет.
Сколько именно компонентов понадобится, зависит от модели, поэтому ниже для каждой нейросети указано, какой объём VRAM нужен в разных режимах вычислений и на каких GPU это реально запустить.
Лучшие локальные языковые модели
Большие языковые модели (LLM) практически захватили рынок локального ИИ, и неудивительно: около 90% пользователей применяют нейросети для работы с текстом, будь то документы, доклады, эссе или код. Архитектура Transformer хорошо масштабируется, поэтому появился и подтип VLM (Visual Language Model): такие модели не только пишут текст, но и распознают его на изображениях. Вот самые сильные «универсальные солдаты».
Qwen3.6-27b
Новейшая плотная мультимодальная модель Alibaba, вышедшая 22 апреля 2026 года и ставшая сенсацией среди опенсорсных нейросетей. У неё 27 миллиардов параметров и классическая плотная 64-слойная архитектура. Несмотря на это, она уверенно обходит прежний MoE-флагман компании Qwen3.5-397B-A17B на 397 миллиардов параметров по ключевым бенчмаркам, в том числе в сложных задачах агентного программирования. В сценариях вроде управления компьютером или распараллеливания агентного роя на несколько задач она вплотную подходит к проприетарной Claude 4.5 Opus.
Дополнительно у модели есть 27-слойный визуальный энкодер для анализа изображений, контекстное окно в 262 тысячи токенов и режим размышления для сложной аналитики, например написания кода и математики. Лицензия Apache 2.0 разрешает коммерческое использование и модификацию без ограничений.
| Формат | VRAM | Подходящий GPU |
|---|---|---|
| FP16/BF16 | ~55 ГБ | RTX PRO 6000 Blackwell (96 ГБ) |
| FP8 | ~27 ГБ | RTX PRO 4500 Blackwell (24 ГБ) |
| INT8 | ~27 ГБ | RTX PRO 5000 Blackwell (24 ГБ) |
| NVFP4 | ~20 ГБ | RTX 5090 (32 ГБ) |
Gemma 4-31b
Флагманская плотная модель Google DeepMind, выпущенная 2 апреля 2026 года. Архитектура из 60 слоёв с 32 головами внимания и 31 миллиард параметров позволили ей встать в один ряд с GLM-4.7, MiniMax-M2.5 и DeepSeek V3.2. Принимает текст и изображения, умеет обрабатывать видео как последовательность кадров, контекстное окно составляет 256 тысяч токенов. Важное архитектурное новшество: повторное использование KV-кэша на последних слоях, которое экономит до 14% видеопамяти при длинном контексте. Лицензия Apache 2.0 даёт полную свободу коммерческого использования и модификации.
| Формат | VRAM | Подходящий GPU |
|---|---|---|
| FP16/BF16 | ~62 ГБ | RTX PRO 6000 Blackwell (96 ГБ) |
| FP8 | ~36 ГБ | RTX 5090 (32 ГБ) |
| INT8 | ~33 ГБ | RTX 5090 (32 ГБ) |
| NVFP4 | ~23 ГБ | RTX 5090 (32 ГБ) |
DeepSeek V4-Flash-284b
Высокоскоростная версия флагманской MoE-линейки DeepSeek, представленная 24 апреля 2026 года. Из 284 миллиардов общих параметров на каждый токен активируется лишь 13 миллиардов благодаря 256 экспертам, поэтому инференс очень эффективен. Главная инновация: гибридное внимание CSA+HCA, которое снижает сложность вычислений на 73%, а память KV-кэша на 90%. Это делает практичными контекстные окна в 1 миллион токенов. Открытый код под лицензией MIT, а скорости и качества хватает, чтобы заменять проприетарные решения вроде Claude Sonnet 4.5 в сложных агентных задачах.
| Формат | VRAM | Подходящая конфигурация |
|---|---|---|
| BF16 | ~866 ГБ | 8× H200 (141 ГБ) |
| FP8 | ~500 ГБ | 4× H200 (141 ГБ) |
| INT8 | ~282 ГБ | 4× H100 (80 ГБ) |
| NVFP4 | ~168 ГБ | 2× H100 (80 ГБ) |
MiniMax 2.7-229b
Модель MiniMax, представленная в марте 2026 года и открытая 12 апреля. Её ключевая особенность: «самообучение». Модель сама участвовала в цикле собственного дообучения с подкреплением (RL), что вывело её в число лидеров агентного кодинга. Из 229 миллиардов параметров на токен активируется около 10 миллиардов (8 экспертов из 256). По уровню модель находится рядом с GPT-5.3-Codex и в задачах MLE Bench Lite уступает только Claude Opus 4.6. Лицензия: модифицированная MIT, разрешающая исследовательское и некоммерческое использование.
| Формат | VRAM | Подходящая конфигурация |
|---|---|---|
| BF16/F32 | ~460 ГБ | 6× H100 (80 ГБ) |
| FP8 | ~230 ГБ | 3× H100 (80 ГБ) |
| INT4 | ~140 ГБ | 2× H100 (80 ГБ) |
Mistral Medium 3.5-128b
Первая универсальная плотная модель Mistral AI, вышедшая 29 апреля 2026 года. Она заменила сразу три предыдущие разработки (Mistral Medium 3.1, Magistral и Devstral 2), объединив в одной плотной архитектуре на 128 миллиардов параметров генерацию текста, рассуждение и программирование. Особенность: настраиваемый уровень размышления, который позволяет выбирать между мгновенным ответом и глубоким анализом. Модель конкурирует с Qwen3.6 и GLM-5.1 и считается одной из самых эффективных в своём классе. Лицензия: модифицированная MIT.
| Формат | VRAM | Подходящая конфигурация |
|---|---|---|
| FP16/BF16 | ~260 ГБ | 4× H100 (80 ГБ) |
| FP8 (Native) | ~130 ГБ | 2× H100 (80 ГБ) |
| INT8 | ~130 ГБ | 2× H100 (80 ГБ) |
| NVFP4 | ~85 ГБ | RTX PRO 6000 Blackwell (96 ГБ) |
GPT-OSS-120b
Ветеран от OpenAI, вышедший ещё в 2025 году и ставший первой за долгое время полноценной открытой разработкой компании. Это MoE-архитектура на 117 миллиардов параметров, из которых на токен активируется 5.1 миллиарда. Такая экономия стала возможна благодаря нативной 4-битной квантизации MXFP4: модель, сопоставимая по качеству с o4-mini, помещается на одну карту H100. Поддерживаются три уровня «размышления», вызов функций и выполнение кода. Лицензия Apache 2.0 открывает путь к коммерческому применению.
| Формат | VRAM | Подходящая конфигурация |
|---|---|---|
| FP16 | ~234 ГБ | 3× H100 (80 ГБ) или 3× RTX PRO 6000 Blackwell (96 ГБ) |
| FP8 | ~120 ГБ | 2× H100 (80 ГБ) |
| INT8 | ~120 ГБ | 2× H100 (80 ГБ) |
| MXFP4 | ~80 ГБ | H100 (80 ГБ) |
GLM-5.1-754b
Самая современная открытая модель Z.ai (ранее Zhipu AI), вышедшая 7 апреля 2026 года, и вершина открытого кодинга. Архитектура Mixture-of-Experts содержит 754 миллиарда общих и 40 миллиардов активных параметров. Модель заняла первое место на Chatbot Arena среди всех open-source моделей с показателем Elo 1467 и обошла проприетарные Claude Opus 4.6 и GPT-5.4 в бенчмарке SWE-Bench Pro. Главная особенность: длительные автономные сессии программирования до 8 часов с сотнями итераций планирования, написания, тестирования и отладки кода. Лицензия MIT подходит для любых коммерческих проектов.
| Формат | VRAM | Подходящая конфигурация |
|---|---|---|
| FP16/BF16 | ~1,508 ГБ | 10× H100 (80 ГБ) |
| FP8 | ~755 ГБ | 10× H100 (80 ГБ) |
| INT8 | ~755 ГБ | 10× H100 (80 ГБ) |
| NVFP4 | ~206 ГБ | 3× H100 (80 ГБ) |
Лучшие локальные генеративные модели
Генеративные модели для изображений и видео в локальном сегменте встречаются реже, чем LLM. Причина простая: большинству пользователей проще открыть веб-интерфейс, нагенерировать картинок или шаблонных баннеров и уйти, чем ставить такую модель на своё железо. Тем не менее есть решения, которые вполне оправдывают место в вашей вычислительной инфраструктуре без привязки к облаку.
FLUX.2 Klein-9b
Компактная модель генерации изображений от Black Forest Labs, январь 2026 года. Архитектура Diffusion Transformer с 9 миллиардами параметров даёт реалистичные картинки, по качеству сопоставимые с моделями в 5 раз крупнее, включая SDXL и GPT-Image. Модель дистиллирована до 4 шагов, поэтому генерация очень быстрая, а режимы работы включают редактирование контента и смену композиции. Лицензия Apache 2.0 подходит и энтузиастам, и компаниям.
| Формат | VRAM | Подходящий GPU |
|---|---|---|
| FP16/BF16 | ~20 ГБ | RTX 5090 (32 ГБ) |
| FP8 | ~15 ГБ | RTX 5090 (32 ГБ) |
| INT8 | ~15 ГБ | RTX 5090 (32 ГБ) |
LTX-2.3-22b
Модель генерации видео от Lightricks, март 2026 года. Её главное достижение: синхронизированные аудио и видео в рамках единого пайплайна. У многих конкурентов многослойные архитектуры теряют скорость на передаче данных между VAE и трансформером, здесь этой проблемы нет. Основа: Diffusion Transformer на 22 миллиарда параметров, ролики можно получать в разрешении до 4K при 50 кадрах в секунду. Есть полная и дистиллированная (более быстрая) версии, лицензия Apache 2.0.
| Формат | VRAM | Подходящий GPU |
|---|---|---|
| FP16/BF16 | ~44 ГБ | RTX PRO 6000 Blackwell (96 ГБ) |
| FP8 | ~24 ГБ | RTX 5090 (32 ГБ) |
| INT8 | ~24 ГБ | RTX 5090 (32 ГБ) |
Z-Image Turbo-6b
Сверхбыстрая модель генерации изображений от Alibaba (Tongyi Lab), ноябрь 2025 года. Используется архитектура S3-DiT (Scalable Single-Stream Diffusion Transformer) на 6 миллиардов параметров, более эффективная, чем традиционные двухпоточные трансформеры. Ключевое преимущество: фотореалистичное изображение с текстом на русском, английском и китайском менее чем за секунду, что подходит для приложений реального времени. Скорость до 12 раз выше, чем у предыдущего поколения (Qwen-Image). Лицензия Apache 2.0.
| Формат | VRAM | Подходящий GPU |
|---|---|---|
| FP16/BF16 | ~16 ГБ | RTX 5090 (32 ГБ) |
| INT8 | ~10 ГБ | RTX 5090 (32 ГБ) |
Kandinsky 5.0 Pro-19b
Kandinsky 5.0 Video Pro: флагманская модель генерации видео от Kandinsky Lab (разработка Сбера), выпущенная 20 ноября 2025 года. Это заметное событие: ни одна российская ИИ-модель прежде не равнялась иностранным конкурентам, а эта превзошла многие флагманские нейросети КНР и некоторые западные модели. Помогли оптимизации для генерации текста на русском языке и глубокое понимание культуры СНГ. У модели 19 миллиардов параметров, архитектура Flow Matching, видео до 1080p длительностью до 10 секунд при 24 fps. Лицензия MIT.
| Формат | VRAM | Подходящий GPU |
|---|---|---|
| FP16 / BF16 | ~48 ГБ | RTX PRO 5000 Blackwell (48 ГБ) |
| INT8 | ~28 ГБ | RTX 5090 (32 ГБ) |
Как выбрать железо под модель
Из таблиц выше видны три практических ориентира.
- Одна карта класса RTX 5090 (32 ГБ). Закрывает Qwen3.6-27b и Gemma 4-31b в NVFP4, а также FLUX.2 Klein-9b, LTX-2.3-22b в FP8/INT8, Z-Image Turbo-6b и Kandinsky 5.0 Pro-19b в INT8. Это вход в мир локального ИИ для рабочей станции.
- Карты на 96 ГБ. RTX PRO 6000 Blackwell позволяет запускать Qwen3.6-27b и Gemma 4-31b в FP16/BF16, Mistral Medium 3.5-128b в NVFP4 и LTX-2.3-22b без сжатия.
- Многокарточные серверы на H100 и H200. Для DeepSeek V4-Flash-284b, MiniMax 2.7-229b, GPT-OSS-120b (в MXFP4 хватит одной H100 на 80 ГБ) и тем более GLM-5.1-754b нужны уже серверные платформы с несколькими ускорителями, быстрой памятью и NVMe.
Подобрать готовую платформу под выбранную модель можно в разделах серверы и ИИ-серверы каталога «СервакМастер».
Выводы
Развёртывание локального ИИ на своём ПК или сервере стоит в списке задач любого уважающего себя IT-энтузиаста: парадигма постепенно меняется, и каждое новое поколение открытых моделей всё ближе к облачным флагманам с триллионами параметров. Но взять любую нейросеть с GitHub или Hugging Face и поставить на своё железо недостаточно. Чтобы не разочароваться, используйте лучшие из доступных моделей и помните, что поколения ИИ сменяются буквально каждый месяц: те, кого мы сегодня называем лучшими локальными, завтра могут безнадёжно устареть.
Если не хочется самостоятельно разбираться с железом и программной средой, обратитесь в «СервакМастер» через раздел контактов. Наши ИИ-специалисты подберут оптимальную сборку и помогут с развёртыванием вашей первой локальной нейросети: от покупки оборудования до запуска в продакшен.
