Лаборатория Sber AI выпустила третье поколение своих языковых моделей, и это уже не одна нейросеть, а целое семейство: от компактной версии для обычного ноутбука до флагмана, которому нужен кластер из серверных ускорителей. В этом обзоре мы разберём, чем GigaChat3 отличается от предыдущих версий, как устроена его архитектура, какую модель выбрать под свои задачи и какое оборудование потребуется для локального запуска.
Что такое GigaChat3
GigaChat3 — полностью переработанное поколение MoE-моделей (Mixture of Experts). Сбер обучал их с нуля на собственных датасетах объёмом 5,5 триллиона токенов: в корпус вошли тексты на русском, английском, китайском и других языках. По сравнению с GigaChat 1.0 и 2.0 главное изменение в том, что одновременно вышло несколько вариантов модели:
- полноразмерная версия с огромным числом параметров для развёртывания на кластерах;
- компактная GGUF-версия для обычных пользовательских устройств;
- сопутствующие компоненты для работы с изображениями и звуком.
Веса открыты, а модели совместимы со стандартным open source-инструментарием. Поэтому GigaChat3 можно напрямую сравнивать с Qwen3, Mistral3 и DeepSeek 3.2. Дополнительный плюс — нативное понимание русского языка, что важно для российских компаний, которым нужен локальный ассистент без передачи данных в облако.
Что изменилось в архитектуре
Скачок в качестве обеспечили три технические новинки.
Multi-Head Latent Attention (MLA)
Это вариант механизма внимания, который работает со сжатыми («латентными») представлениями ключей и значений. За счёт этого вычислительные затраты и потребление памяти снижаются на 40%. На практике это даёт более высокую пропускную способность, более дешёвый инференс и стабильную работу с длинным контекстом.
Multi-Token Prediction (MTP)
Модель предсказывает сразу несколько следующих токенов, а не по одному. Похожий подход используется в Mistral и Gemini. Генерация текста ускоряется в 2–4 раза — это одно из главных отличий GigaChat3 от прошлых поколений.
Длинный контекст
Флагманская GigaChat3 Ultra поддерживает окно до 131 000 токенов. Такой контекст позволяет обрабатывать объёмные документы и удерживать нить разговора на протяжении всего диалога. По этому параметру модель встаёт в один ряд с OpenAI GPT-4.1, DeepSeek-R1, GPT-OSS-120B и Qwen 3.
Линейка моделей
Каждая модель семейства рассчитана на свой класс задач и оборудования. Сводка:
| Модель | Параметры | Для чего | Оборудование |
|---|---|---|---|
| GigaChat3-10B-A1.8B-GGUF | 10 млрд | локальный запуск на ПК, ноутбуке, телефоне | CPU, 8–16 ГБ RAM |
| GigaChat3-10B-A1.8B | 10 млрд, 1,8 млрд активных | разработка, fine-tuning, сервер | GPU уровня RTX 3090, 4080, 4090 |
| GigaChat3-702B-A36B | 702 млрд, около 36 млрд активных | продакшен, сложные рассуждения | кластер на A100/H100 или AMD MI300 |
GigaChat3-10B-A1.8B-GGUF: версия для обычного компьютера
Компактную модель с 10 млрд параметров называют Lightning за высокую скорость вывода. Формат GGUF рассчитан на эффективный инференс на CPU, а также на гибридных чипах Apple через Metal и Vulkan. Это первая действительно доступная локальная версия GigaChat3. Она работает с популярными оболочками:
- llama.cpp — запуск из командной строки;
- LM Studio и Jan.ai — для тех, кто предпочитает графический интерфейс;
- MCP (Model Context Protocol) — для интеграции в среду разработки.
Для запуска достаточно 8–16 ГБ оперативной памяти, так что подойдёт и современный ноутбук. Сообщество уже подготовило квантизированные сборки: в формате Q4_K_M требования снижаются до 6 ГБ RAM. Доступны и другие уровни квантизации — Q8, Q6, Q5_K_M и так далее. Модель размещена на Hugging Face.
GigaChat3-10B-A1.8B: универсальный вариант
Самая сбалансированная модель для энтузиастов и ML-разработчиков с производительной видеокартой. Всего в ней 10 млрд параметров, из которых активны 1,8 млрд. Индекс «A1.8B» означает новую архитектурную ревизию: улучшенное внимание, более длинный контекст и технологию MTP. Комфортно модель чувствует себя на GPU класса RTX 3090, 4080 или 4090.
Доступны разные форматы:
- Base-версия для обучения и дообучения, например через LoRA;
- BF16/FP16 для инференса на серверах и рабочих станциях.
Запускать её можно через vLLM (высокая производительность на GPU NVIDIA) или SGLang (минимальная задержка при локальном запуске). Квантизацию через GPTQ или AWQ можно выполнить самостоятельно.
GigaChat3-702B-A36B: флагман Ultra
GigaChat 3 Ultra — демонстрация возможностей Сбера. Это instruct-модель на 702 млрд параметров, из которых на каждом шаге задействуется около 36 млрд (A36B) благодаря MoE. Она сильна в задачах рассуждения, работает с контекстом до 131 тысячи токенов и хорошо понимает сложные постановки. Модель создана для профессионального продакшена и требует серверов с GPU уровня NVIDIA A100/H100 или AMD MI300.
В открытом доступе есть версии preview и BF16. Для развёртывания подходят движки vLLM, SGLang, LMDeploy и TensorRT-LLM. Допустима квантизация GPTQ или AWQ: при 4-битной Q4_K_M размер сжимается до 430 ГБ при исходных 1,43 ТБ. Есть также вариант в формате FP8 для последующего тюнинга.
Мультимодальность: изображения и голос
Распознавание изображений
Все модели семейства понимают картинки. Технически это реализовано через связку vision-encoder (он превращает изображение в последовательность токенов) и языковой модели. Можно загрузить фотографию, схему или скриншот: GigaChat3 опишет содержимое, ответит на вопросы или использует картинку как контекст диалога.
Генерации изображений и видео в самих моделях нет — этим занимаются отдельные модели Kandinsky 5.0. Обе системы можно объединить в одном рабочем процессе: текстовый запрос в GigaChat запускает создание картинки в Kandinsky.
GigaAM v3: распознавание речи
GigaAM v3 — end-to-end модель для преобразования речи в текст. В её основе подходы CTC (Connectionist Temporal Classification) и RNN-T (Recurrent Neural Network Transducer), поэтому аудиоввод напрямую встраивается в диалог с LLM. Получается единый контур: голос → текст (GigaAM) → понимание и ответ (GigaChat).
У модели всего 220–240 миллионов параметров, так что она развёртывается даже на очень слабом железе. Доступны базовая модель и ONNX-версия. Это первый полноценный отечественный конкурент Whisper от OpenAI.
Как запустить GigaChat3 локально
Способ зависит от задач и имеющегося оборудования.
Через GGUF и llama.cpp
Самый простой путь. Скачайте GGUF-файл с официального репозитория на Hugging Face, например GigaChat3-10B-Q4_K_M.gguf, и запустите его через llama.cpp, указав путь, размер контекста и параметры генерации:
./main -m /path/to/model.gguf -c 4096 -n 256 -ngl 40 -p "Ваш промпт"
FP16/BF16 на GPU-станции
Для модели 10B-A1.8B в формате SafeTensors нужна рабочая станция с видеокартой не менее чем на 16–24 ГБ VRAM — подойдут RTX 4090, RTX 3090 или RTX 4080. Веса загружаются с Hugging Face, после чего модель запускается через vLLM или SGLang (с FlashAttention и API) либо подключается к собственному приложению через Hugging Face Transformers. Этот вариант даёт максимальную производительность и минимальную задержку.
Через MCP
Model Context Protocol — открытый протокол для безопасного подключения моделей и данных к приложениям. Настройка MCP позволяет встроить локально работающий GigaChat3 в IDE (VS Code, JetBrains) или инструменты анализа кода и построить умных ассистентов прямо в среде разработки.
Где применять
- Генерация кода и ревью: функции, исправление ошибок, комментарии на Python, JavaScript, C++ и других языках.
- Сложные задачи (reasoning): многошаговые логические, математические и аналитические запросы.
- Анализ изображений: графики, диаграммы, фотографии оборудования с описанием или инструкцией.
- Суммаризация и перевод: сжатие длинных документов и перевод с учётом нюансов русского языка.
- Голосовой интерфейс: в связке с GigaAM v3 получается ассистент, который работает полностью офлайн.
Как подобрать железо
Практические выводы по оборудованию:
- Для знакомства и личных задач хватит ноутбука или ПК с 8–16 ГБ RAM и GGUF-версии; с квантизацией Q4_K_M — даже 6 ГБ.
- Для разработки, дообучения и сервиса на 10B-A1.8B нужна рабочая станция с видеокартой на 16–24 ГБ VRAM.
- Для флагманской Ultra необходим GPU-сервер на A100/H100 или MI300. Даже в 4-битном виде модель занимает порядка 430 ГБ, поэтому память и число ускорителей нужно планировать заранее.
- Если задуман гибрид с Kandinsky 5.0 или голосовой контур с GigaAM v3, закладывайте запас по GPU под несколько моделей одновременно.
Выводы
GigaChat3 — серьёзный шаг для всего российского ИИ-сообщества. Открытые веса, удобные GGUF-версии, vision, аудио, Multi-Token Prediction и Mixture of Experts приближают платформу к мировым лидерам, а каждый пользователь или компания может выбрать вариант под свои ресурсы.
В продакшене результат во многом зависит от правильно подобранного оборудования. В «СервакМастер» вы можете подобрать конфигурацию под нужную модель: от GPU-рабочих станций для 10B-моделей до полноценных серверов на картах A100/H100 для GigaChat3 Ultra. Посмотрите GPU-серверы для ИИ и каталог серверов или свяжитесь с нами — поможем с выбором и с настройкой гибридных сценариев с Kandinsky 5.0.
