Лаборатория Sber AI выпустила третье поколение своих языковых моделей, и это уже не одна нейросеть, а целое семейство: от компактной версии для обычного ноутбука до флагмана, которому нужен кластер из серверных ускорителей. В этом обзоре мы разберём, чем GigaChat3 отличается от предыдущих версий, как устроена его архитектура, какую модель выбрать под свои задачи и какое оборудование потребуется для локального запуска.

Что такое GigaChat3

GigaChat3 — полностью переработанное поколение MoE-моделей (Mixture of Experts). Сбер обучал их с нуля на собственных датасетах объёмом 5,5 триллиона токенов: в корпус вошли тексты на русском, английском, китайском и других языках. По сравнению с GigaChat 1.0 и 2.0 главное изменение в том, что одновременно вышло несколько вариантов модели:

  • полноразмерная версия с огромным числом параметров для развёртывания на кластерах;
  • компактная GGUF-версия для обычных пользовательских устройств;
  • сопутствующие компоненты для работы с изображениями и звуком.

Веса открыты, а модели совместимы со стандартным open source-инструментарием. Поэтому GigaChat3 можно напрямую сравнивать с Qwen3, Mistral3 и DeepSeek 3.2. Дополнительный плюс — нативное понимание русского языка, что важно для российских компаний, которым нужен локальный ассистент без передачи данных в облако.

Что изменилось в архитектуре

Скачок в качестве обеспечили три технические новинки.

Multi-Head Latent Attention (MLA)

Это вариант механизма внимания, который работает со сжатыми («латентными») представлениями ключей и значений. За счёт этого вычислительные затраты и потребление памяти снижаются на 40%. На практике это даёт более высокую пропускную способность, более дешёвый инференс и стабильную работу с длинным контекстом.

Multi-Token Prediction (MTP)

Модель предсказывает сразу несколько следующих токенов, а не по одному. Похожий подход используется в Mistral и Gemini. Генерация текста ускоряется в 2–4 раза — это одно из главных отличий GigaChat3 от прошлых поколений.

Длинный контекст

Флагманская GigaChat3 Ultra поддерживает окно до 131 000 токенов. Такой контекст позволяет обрабатывать объёмные документы и удерживать нить разговора на протяжении всего диалога. По этому параметру модель встаёт в один ряд с OpenAI GPT-4.1, DeepSeek-R1, GPT-OSS-120B и Qwen 3.

Линейка моделей

Каждая модель семейства рассчитана на свой класс задач и оборудования. Сводка:

Модель Параметры Для чего Оборудование
GigaChat3-10B-A1.8B-GGUF 10 млрд локальный запуск на ПК, ноутбуке, телефоне CPU, 8–16 ГБ RAM
GigaChat3-10B-A1.8B 10 млрд, 1,8 млрд активных разработка, fine-tuning, сервер GPU уровня RTX 3090, 4080, 4090
GigaChat3-702B-A36B 702 млрд, около 36 млрд активных продакшен, сложные рассуждения кластер на A100/H100 или AMD MI300

GigaChat3-10B-A1.8B-GGUF: версия для обычного компьютера

Компактную модель с 10 млрд параметров называют Lightning за высокую скорость вывода. Формат GGUF рассчитан на эффективный инференс на CPU, а также на гибридных чипах Apple через Metal и Vulkan. Это первая действительно доступная локальная версия GigaChat3. Она работает с популярными оболочками:

  • llama.cpp — запуск из командной строки;
  • LM Studio и Jan.ai — для тех, кто предпочитает графический интерфейс;
  • MCP (Model Context Protocol) — для интеграции в среду разработки.

Для запуска достаточно 8–16 ГБ оперативной памяти, так что подойдёт и современный ноутбук. Сообщество уже подготовило квантизированные сборки: в формате Q4_K_M требования снижаются до 6 ГБ RAM. Доступны и другие уровни квантизации — Q8, Q6, Q5_K_M и так далее. Модель размещена на Hugging Face.

GigaChat3-10B-A1.8B: универсальный вариант

Самая сбалансированная модель для энтузиастов и ML-разработчиков с производительной видеокартой. Всего в ней 10 млрд параметров, из которых активны 1,8 млрд. Индекс «A1.8B» означает новую архитектурную ревизию: улучшенное внимание, более длинный контекст и технологию MTP. Комфортно модель чувствует себя на GPU класса RTX 3090, 4080 или 4090.

Доступны разные форматы:

  • Base-версия для обучения и дообучения, например через LoRA;
  • BF16/FP16 для инференса на серверах и рабочих станциях.

Запускать её можно через vLLM (высокая производительность на GPU NVIDIA) или SGLang (минимальная задержка при локальном запуске). Квантизацию через GPTQ или AWQ можно выполнить самостоятельно.

GigaChat3-702B-A36B: флагман Ultra

GigaChat 3 Ultra — демонстрация возможностей Сбера. Это instruct-модель на 702 млрд параметров, из которых на каждом шаге задействуется около 36 млрд (A36B) благодаря MoE. Она сильна в задачах рассуждения, работает с контекстом до 131 тысячи токенов и хорошо понимает сложные постановки. Модель создана для профессионального продакшена и требует серверов с GPU уровня NVIDIA A100/H100 или AMD MI300.

В открытом доступе есть версии preview и BF16. Для развёртывания подходят движки vLLM, SGLang, LMDeploy и TensorRT-LLM. Допустима квантизация GPTQ или AWQ: при 4-битной Q4_K_M размер сжимается до 430 ГБ при исходных 1,43 ТБ. Есть также вариант в формате FP8 для последующего тюнинга.

Мультимодальность: изображения и голос

Распознавание изображений

Все модели семейства понимают картинки. Технически это реализовано через связку vision-encoder (он превращает изображение в последовательность токенов) и языковой модели. Можно загрузить фотографию, схему или скриншот: GigaChat3 опишет содержимое, ответит на вопросы или использует картинку как контекст диалога.

Генерации изображений и видео в самих моделях нет — этим занимаются отдельные модели Kandinsky 5.0. Обе системы можно объединить в одном рабочем процессе: текстовый запрос в GigaChat запускает создание картинки в Kandinsky.

GigaAM v3: распознавание речи

GigaAM v3 — end-to-end модель для преобразования речи в текст. В её основе подходы CTC (Connectionist Temporal Classification) и RNN-T (Recurrent Neural Network Transducer), поэтому аудиоввод напрямую встраивается в диалог с LLM. Получается единый контур: голос → текст (GigaAM) → понимание и ответ (GigaChat).

У модели всего 220–240 миллионов параметров, так что она развёртывается даже на очень слабом железе. Доступны базовая модель и ONNX-версия. Это первый полноценный отечественный конкурент Whisper от OpenAI.

Как запустить GigaChat3 локально

Способ зависит от задач и имеющегося оборудования.

Через GGUF и llama.cpp

Самый простой путь. Скачайте GGUF-файл с официального репозитория на Hugging Face, например GigaChat3-10B-Q4_K_M.gguf, и запустите его через llama.cpp, указав путь, размер контекста и параметры генерации:

./main -m /path/to/model.gguf -c 4096 -n 256 -ngl 40 -p "Ваш промпт"

FP16/BF16 на GPU-станции

Для модели 10B-A1.8B в формате SafeTensors нужна рабочая станция с видеокартой не менее чем на 16–24 ГБ VRAM — подойдут RTX 4090, RTX 3090 или RTX 4080. Веса загружаются с Hugging Face, после чего модель запускается через vLLM или SGLang (с FlashAttention и API) либо подключается к собственному приложению через Hugging Face Transformers. Этот вариант даёт максимальную производительность и минимальную задержку.

Через MCP

Model Context Protocol — открытый протокол для безопасного подключения моделей и данных к приложениям. Настройка MCP позволяет встроить локально работающий GigaChat3 в IDE (VS Code, JetBrains) или инструменты анализа кода и построить умных ассистентов прямо в среде разработки.

Где применять

  • Генерация кода и ревью: функции, исправление ошибок, комментарии на Python, JavaScript, C++ и других языках.
  • Сложные задачи (reasoning): многошаговые логические, математические и аналитические запросы.
  • Анализ изображений: графики, диаграммы, фотографии оборудования с описанием или инструкцией.
  • Суммаризация и перевод: сжатие длинных документов и перевод с учётом нюансов русского языка.
  • Голосовой интерфейс: в связке с GigaAM v3 получается ассистент, который работает полностью офлайн.

Как подобрать железо

Практические выводы по оборудованию:

  1. Для знакомства и личных задач хватит ноутбука или ПК с 8–16 ГБ RAM и GGUF-версии; с квантизацией Q4_K_M — даже 6 ГБ.
  2. Для разработки, дообучения и сервиса на 10B-A1.8B нужна рабочая станция с видеокартой на 16–24 ГБ VRAM.
  3. Для флагманской Ultra необходим GPU-сервер на A100/H100 или MI300. Даже в 4-битном виде модель занимает порядка 430 ГБ, поэтому память и число ускорителей нужно планировать заранее.
  4. Если задуман гибрид с Kandinsky 5.0 или голосовой контур с GigaAM v3, закладывайте запас по GPU под несколько моделей одновременно.

Выводы

GigaChat3 — серьёзный шаг для всего российского ИИ-сообщества. Открытые веса, удобные GGUF-версии, vision, аудио, Multi-Token Prediction и Mixture of Experts приближают платформу к мировым лидерам, а каждый пользователь или компания может выбрать вариант под свои ресурсы.

В продакшене результат во многом зависит от правильно подобранного оборудования. В «СервакМастер» вы можете подобрать конфигурацию под нужную модель: от GPU-рабочих станций для 10B-моделей до полноценных серверов на картах A100/H100 для GigaChat3 Ultra. Посмотрите GPU-серверы для ИИ и каталог серверов или свяжитесь с нами — поможем с выбором и с настройкой гибридных сценариев с Kandinsky 5.0.