За несколько лет российский ИИ вырос из набора исследовательских проектов в полноценную индустрию, за которой стоят крупные компании. Сегодня есть и облачные проприетарные сервисы с доступом по API, и open-source модели, которые можно поставить на ПК, рабочую станцию или сервер. Это не копии западных LLM: модели заточены под русский язык и реалии бизнеса в СНГ. Ниже разбираем, какие отечественные нейросети существуют, чем они отличаются и какое железо нужно для их автономной работы.

Почему российские модели всё чаще запускают локально

Локальные нейросети в 2025 году стали одним из главных трендов. Вместо облачных API компании ставят компактные, но сильные модели на собственные мощности. В России интерес к этому особенно высок, и причин несколько:

  • Безопасность данных. Для бизнеса и госсектора важно, чтобы тексты, аудио и изображения не покидали периметр локальных серверов.
  • Независимость. Локальная модель не зависит от внешних сервисов, санкционных рисков и смены тарифов.
  • Кастомизация. Такие модели проще дообучать, встраивать в существующие системы и адаптировать под отраслевые задачи.
  • Экономика. При интенсивной нагрузке собственный инференс нередко обходится дешевле облачных API.

В итоге локальный ИИ всё чаще воспринимается не как альтернатива облаку, а как инфраструктурный слой, который можно контролировать и масштабировать вместе с бизнесом.

Какие задачи закрывают отечественные модели

Российские разработки охватывают почти весь спектр машинного обучения:

  • LLM для генерации текста, диалогов, анализа документов и написания кода;
  • генерация изображений и видео (направление молодое, но уже конкурентное);
  • распознавание и синтез речи, востребованные в колл-центрах, голосовых ассистентах и медиа;
  • vision-модели и OCR для работы с изображениями и документами;
  • embedding-модели, на которых строятся RAG-системы, корпоративный поиск и чат-боты с базами знаний;
  • нишевые решения: от промышленной аналитики до моделей для финтеха и e-commerce.

Языковые модели: текст, код и рассуждения

LLM остаются основой, вокруг которой развиваются остальные направления, и именно им отечественные команды уделили больше всего сил.

GigaChat 3 (Сбер)

GigaChat3 — флагманская линейка Sber AI из трёх языковых моделей для диалогов, генерации текстов, анализа документов и задач на рассуждение. Две модели по 10 млрд параметров предназначены для локального развёртывания, а топовая на 702 млрд рассчитана на кластерный инференс. Линейка создана с нуля на гибридной архитектуре MoE+MLA+MTP, контекстное окно достигает 131 тысячи токенов, а старшая модель принимает мультимодальный ввод.

Для локального запуска нужны GPU с 16–24 ГБ VRAM, а квантованные версии снижают требование до 8–6 ГБ. Веса опубликованы на Hugging Face и GitHub. На сегодня это лучшее LLM-решение в РФ.

YandexGPT-5 (Яндекс)

Пятое поколение моделей Яндекса построено на decoder-only трансформерах и представлено двумя версиями: YandexGPT-5 Lite (Pretrain, Instruct, Instruct-GGUF) и YandexGPT-5 Pro. Lite доступна локально: 8 млрд параметров, контекст 32 000 токенов. Pro работает только в облаке.

Обучение шло в два этапа на многоязычном корпусе: 15 трлн токенов и 320 млрд токенов на русском, английском и других языках, математических задачах и языках программирования. Модели оптимизированы для генерации, классификации, суммаризации и кодирования, а по производительности находятся на уровне проприетарных LLM. Исходный код Lite выложен на Hugging Face.

T-pro 2.0 (Т-Банк)

Модель разработана отделом T-Tech на базе Qwen3-32b и нацелена на рассуждения, выполнение сложных инструкций и прикладную генерацию текста. Доступны instruct-, SFT- и Preference Tuning-варианты. Архитектура — decoder-only трансформер примерно на 33 млрд параметров, контекст до 32 000 токенов.

Для локального вывода есть форматы GGUF, FP8 и AWQ, а также вариант EAGLE на базе speculative-архитектуры. Помимо открытых весов на Hugging Face, модель доступна через облако и API.

Kodify-Nano (МТС)

Компактная LLM от МТС для генерации и анализа кода, порядка 2 млрд параметров. Это лёгкий decoder-only Transformer, настроенный под синтаксис и семантику языков программирования. Размер контекста официально не раскрыт; для моделей класса 2B он редко превышает 8–16 тысяч токенов.

Главное преимущество — запуск на недорогих потребительских GPU (8–16 GB VRAM) и даже на CPU. Модель опубликована на Hugging Face в форматах GGUF и GPTQ, поддерживает квантизацию и интеграцию в пайплайны разработки, а с VS Code и JetBrains работает через Docker-контейнеры.

A-vibe (Авито)

Модель AvitoTech построена на Qwen3-8B-Base и предназначена для работы с текстами объявлений, поиска, классификации и диалогов. В ней 8 млрд параметров и собственный токенизатор с оптимизацией под русский и английский, благодаря которому скорость вывода на 15–20% выше, чем у Qwen3-8B. Обучение включало SFT- и RL-этапы на большом корпусе объявлений платформы. На Hugging Face доступна базовая версия в BF16 и EAGLE-модель.

Генерация изображений: Kandinsky Image Lite (Сбер)

В российском генеративном ИИ пока выделяется одна модель, но результаты сопоставимы с зарубежными. Kandinsky Image Lite от Sber AI — это 6 млрд параметров, режимы text-to-image и image-to-image, разрешения 1280x768, 1024x1024 и другие в классе 1К. Задержка около 13 секунд, а функция editing позволяет редактировать готовые картинки.

Сильная сторона — русский язык и локальный культурный контекст, где западные модели чаще ошибаются. На Hugging Face и GitHub доступны версии SFT и Pretrain.

Генерация видео: Kandinsky Video Lite и Pro

Сбер стал первопроходцем и в видео: в семейство Kandinsky 5.0 вошли модели для фотореалистичных роликов. Поддерживаются сценарии T2V (text-to-video) и I2V (image-to-video), длительность видео от 5 до 10 секунд.

Версия Параметры Задержка Требования
Video Lite 2 млрд до 224 секунд запускается даже на самом слабом железе
Video Pro 19 млрд до 1241 секунд GPU-ускоритель уровня H100 или MI210

У Pro две версии: SFT для максимального качества и Pretrain для тонкой настройки. У Lite вариантов больше: SFT (высокое качество), CFG-distilled (быстрая генерация), Diffusion-distilled (быстрая генерация без потери качества) и Pretrain (для дообучения).

Распознавание речи (ASR)

Международных ASR-моделей с хорошей поддержкой русского немного, поэтому отечественные разработчики активно закрывают эту нишу.

GigaAM v3 (Сбер)

Модель преобразования речи в текст на архитектурах CTC и RNN-T. Она открыта, содержит всего 220–240 млн параметров и поэтому разворачивается даже на скромном оборудовании. Есть базовая модель и ONNX-версия. По сути, это единственный полноценный российский конкурент Whisper от OpenAI.

T-one (Т-Банк)

ASR-модель объёмом 71 млрд параметров, созданная Т-Банком для собственных сервисов и корпоративных клиентов. Аудио обрабатывается фрагментами по 300 мс, а расшифровка формируется сжатым декодированием или декодером CTC с поиском луча на основе KenLM. В основе — архитектура Conformer с модулями SwiGLU, ReLU, LayerNorm, RoPE и U-Net.

Акцент сделан на точности и устойчивости к шуму, а локальный запуск подходит для защищённых сред. Доступна одна полноразмерная версия в FP32; развёртывание возможно через Docker-контейнер, открытые веса лежат на Hugging Face.

Синтез речи (TTS): F5-TTS_RUSSIAN

Это версия архитектуры F5-TTS, дообученная на 5000 часах русской речи. Модель ориентирована на локальное использование и имеет всего 335 млн параметров, поэтому подходит для инфраструктур со скромным железом, при этом даёт насыщенную интонацию и качественное звучание. Большинство TTS-моделей появились на раннем этапе развития направления, но этот вариант оптимизирован под современные задачи.

Vision и OCR: A-vision (Авито)

Пока в мире на слуху DeepSeek-OCR и PaddleOCR, российские команды делают собственные решения. A-vision от AvitoTech — компактная vision-модель на 7 млрд параметров для анализа изображений в e-commerce: модерация, классификация, улучшение качества контента. Открытые веса на Hugging Face позволяют развернуть её локально.

Обучение шло на русскоязычном мультимодальном корпусе: 200 тысяч изображений объявлений и 1 миллион пар «вопрос–ответ». В модель встроен токенизатор Avito, дообучение выполнялось через SFT и RL-этап, что дало точность выше, чем у Qwen2.5-VL-7B-Instruct.

Embeddings и RAG

Для поиска и чат-ботов с базами знаний есть собственные и адаптированные модели, работающие без зарубежных API.

  • FRIDA (AI-Forever, команда Sber AI). Embedding-модель на базе T5, ruMTEB и ru-en-RoSBERTa, 800 млн параметров. Предназначена для семантического поиска и ассистентов, работающих с большими массивами русскоязычных данных, хорошо подходит для RAG-пайплайнов, поддерживает стандартные фреймворки и легко интегрируется с векторными базами.
  • Giga-Embeddings (Сбер). Instruct-embedding из семейства GigaChat3 на архитектуре Latent-Attention, 3 млрд параметров. Рассчитана на корпоративные сценарии: поиск по документам, боты поддержки, анализ внутренней базы знаний. Веса на Hugging Face.

Кто делает российские нейросети

Экосистему формируют крупные технологические компании и независимые команды. Ключевые игроки:

  • Сбер;
  • Яндекс;
  • Т-Банк;
  • Avito;
  • МТС.

Что это значит при выборе оборудования

Ориентиры по памяти видны из обзора: компактным моделям вроде Kodify-Nano достаточно 8–16 GB VRAM, GigaChat3 на 10 млрд параметров требует 16–24 ГБ (или 8–6 ГБ в квантованном виде), а видеомодель Kandinsky Video Pro рассчитана на ускорители класса H100 или MI210. Флагман GigaChat3 на 702 млрд параметров вообще требует кластера.

К 2025 году в России сложилась полноценная экосистема ИИ, и значительная часть моделей доступна для локального использования: веса можно скачать, развернуть у себя и встроить в собственную инфраструктуру. Выбор модели зависит от сценария и от доступного оборудования для инференса. Со сценарием определятся ваши разработчики, а с железом поможет «СервакМастер»: мы поставляем серверное оборудование для локального инференса. Посмотрите серверы для задач ИИ и общий каталог серверов либо свяжитесь с нашим специалистом: подберём, соберём и настроим конфигурацию под вашу задачу и бюджет.