Всего три года прошло с выхода GPT-3.5 от OpenAI, а рынок искусственного интеллекта из робкого начинания превратился в одну из самых дорогих отраслей мира и продолжает разгоняться. Двигатель этого роста — архитектуры машинного обучения. От того, насколько хорошо вы понимаете их устройство, зависит и внедрение нейросетей в бизнес-процессы, и решение повседневных задач. В этом материале специалисты «СервакМастер» прослеживают, как развивались архитектуры ИИ-моделей, какие из них востребованы сегодня и куда смещается вектор развития.

Зачем разбираться в устройстве нейросетей

Рынок open-source моделей, которые устанавливают и настраивают самостоятельно, растёт так быстро, что рано или поздно к ним придётся приглядеться почти любому, кто хочет пользоваться локальным и бесплатным ИИ. Проприетарные облачные модели от OpenAI, Google и Anthropic удобны, но платные, поэтому для масштабной работы в продакшене подходят далеко не всегда. Локальные модели доступны всем, у кого есть подходящее оборудование, и их можно доводить под себя: улучшать характеристики и добавлять функции.

Проще всего это показать на сравнении аренды и покупки автомобиля.

Облачная модель Локальная модель
Аналогия Аренда машины Собственный автомобиль
Оплата Подписка или плата за токены Единоразовые вложения в оборудование
Доступ к «двигателю» Исходного кода нет, модифицировать нельзя Полный доступ
Возможности Использовать как есть Дообучение, квантизация, подключение RAG-систем и другой «тюнинг»

Чтобы тюнинг был осмысленным, нужно понимать, как устроена архитектура модели. А для локального развёртывания потребуется мощное железо: подобрать конфигурацию можно в разделах серверов и ИИ-серверов.

Эволюция: от перцептрона до трансформера

История современных LLM — это не соревнование подходов, а последовательное преодоление чужих ограничений.

Ранние этапы

  • 1958 год — описан перцептрон, математическая модель биологического нейрона.
  • 1986 год — появились многослойные перцептроны (MLP). Именно они позволили объединять одиночные перцептроны в полноценные нейронные сети.
  • Сверточные сети (CNN) — совершили переворот в компьютерном зрении, научившись выделять паттерны, например контуры объектов.
  • Рекуррентные сети (RNN) и их улучшенные версии LSTM/GRU — предназначались для последовательностей вроде текста и речи, так как умели «помнить» предыдущие данные.

Проблема RNN и ответ Google

У RNN был серьёзный изъян: длинные зависимости им давались плохо. В 2017 году Google предложила механизм внимания (Self-Attention) и архитектуру трансформеров в статье «Attention Is All You Need». Это вывело отрасль из стагнации и оставило рекуррентные связи в прошлом. Механизм внимания позволяет модели видеть весь контекст запроса целиком и гибко решать, каким словам уделить больше внимания при генерации ответа, одновременно «предугадывая» продолжение.

Первые LLM

В 2018 году на базе трансформеров появились первые полноценные большие языковые модели: GPT-1 от OpenAI и BERT от Google. Они открыли эпоху LLM, а позднее GPT-3.5 стала первым ИИ-проектом, который привлёк массовую аудиторию и показал потенциал генеративного интеллекта.

Трансформеры: почему они стали основой

RNN читает предложение слово за словом. Трансформер анализирует все слова одновременно и определяет связи между ними, даже если они расположены в разных концах абзаца. Похоже на то, как человек при чтении интуитивно понимает, чем закончится фраза.

Вторая сильная сторона — масштабируемость: с ростом размера растёт и эффективность. Поэтому вскоре после GPT-1 и BERT появилось множество семейств моделей: LLaMA, Claude, Mistral, ERNIE, Gemini и другие. Параметров становилось всё больше, а вместе с ними росли производительность и вычислительные затраты.

Чтобы удешевить расчёты, придумали разновидность трансформера — MoE (Mixture-of-Experts), где разные части модели включаются в зависимости от запроса пользователя. Эффективность трансформеров сегодня повышают и другие приёмы:

  • FlashAttention и PagedAttention — ускоряют вычисления;
  • LoRA и QLoRA — быстрая адаптация модели под конкретную задачу;
  • Fine-Tuning — масштабная настройка LLM.

Диффузионные модели: новая волна генеративного ИИ

Языковые модели работали с текстом, и логичным следующим шагом стала генерация графики. В 2020 году появилась первая диффузионная модель DDPM (Denoising Diffusion Probabilistic Models). Принцип её работы — денойзинг: данные сначала зашумляются, а затем очищаются от шума, и из него постепенно проступает изображение или даже видео.

В 2021 году вышли первые массовые диффузионные модели, Stable Diffusion и DALL-E. На их идеях выросли Veo 3, Midjourney, DALL·E 3, Flux 1.1, Grok Image v0.9, Qwen‑Image и Wan 2.2, которые, по иронии автора оригинала, в ответе за поток «брейнрот-контента» в соцсетях.

Диффузия приходит в текст

Теперь тот же принцип переносят на языковые модели. Диффузионные LLM, например анонсированные Gemini Diffusion и Mercury, не предсказывают токены строго по очереди, а генерируют текст параллельно за несколько итераций «очистки». Методы вроде Latent Refinement Decoding (LRD) сначала формируют смысловой черновик в скрытом пространстве, а затем доводят его до грамматически правильного текста.

Преимущества заметны:

  • скорость 1000+ токенов/с против 200-300 токенов/с у классических трансформеров;
  • возможность самокоррекции ответа на лету.

Мультимодальные архитектуры

Надоело использовать трансформеры для текста и диффузию для картинок, поэтому границы решили стереть. В 2023 году появились массовые мультимодальные LLM (Vision-Language Models). Работать с изображениями ИИ умел и раньше, с 2019 года (VisualBERT), но опирался на устаревшие принципы CNN, чтобы распознавать содержимое кадра. Мультимодальные LLM — принципиально иная, целостная архитектура: кросс-модальное внимание ищет прямые связи между фрагментами изображения, словами запроса и даже тоном голоса.

Яркие представители:

  • китайские Qwen3-Omni и Qwen3-VL;
  • Gemini 2.5-Pro;
  • GPT-4, которая сделала VL-модели популярными.

Общение с такими моделями стало естественным за счёт сквозной обработки почти всех модальностей. Остаётся добавить осязание и вкус, но для этого нужно придумать адекватную реализацию. Мультимодальность из приятной функции превращается в архитектурную парадигму, благодаря которой нейросети будут воспринимать мир целостно, как человек.

Альтернативы трансформерам: State-Space, Mamba, RWKV

Несмотря на лидерство, у трансформеров есть слабое место: вычислительная сложность растёт квадратично с длиной контекста. Разбирать длинные книги, кодовые базы и объёмные документы поэтому крайне затратно. Пока диффузионные LLM не показали потенциал на практике, исследователи ищут альтернативу, отказываясь от механизма внимания.

Архитектура Суть
State-Space Models (S4/S5) Принципы теории управления для длинных последовательностей с почти линейной сложностью. Модель будто делает заметки, чтобы не забыть, о чём шла речь
Mamba Следующий шаг: селективный механизм, динамически решающий, какую информацию из контекста учитывать, а какую отбросить
RWKV Гибрид: эффективность RNN на инференсе в сочетании с эффективностью трансформеров. Возврат к классике, доработанный современными методами

Все они отвечают на запрос индустрии на более быстрые и экономичные модели без потери качества, что особенно важно для развёртывания на edge-устройствах. Подробнее об этих архитектурах мы расскажем в отдельной статье.

Архитектуры взаимодействия: RAG, Graph RAG, Agentic RAG, MCP

Современные модели редко работают поодиночке: из них собирают сложные системы, а эффективность определяют архитектуры взаимодействия.

  • RAG (Retrieval-Augmented Generation) — уже мейнстрим. Соединяет LLM с внешними базами знаний: модель опирается не только на собственную память, а берёт актуальные данные до генерации ответа. Точность растёт, галлюцинаций становится меньше.
  • Graph RAG и Agentic RAG — надстройки, превращающие цепочку RAG в агента с улучшенной памятью, планированием и ветвлением логики, способного выполнять многошаговые задачи.
  • Model Context Protocol (MCP) — стандартизированный протокол безопасного подключения моделей к внешним инструментам, данным и API; основа для сильных агентских экосистем.

Эти технологии не заменяют архитектуры нейросетей, а добавляют следующий уровень абстракции: одиночная модель превращается в интеллектуальную систему, способную решать сложные бизнес-задачи.

Практические выводы для тех, кто собирает ИИ-инфраструктуру

Хотя исходный материал посвящён теории, из него следуют вполне приземлённые вещи.

  1. Локальные модели дают свободу тюнинга (дообучение, квантизация, RAG), но требуют мощного оборудования, поэтому железо стоит подбирать под архитектуру и задачи.
  2. MoE-модели экономят вычисления, а FlashAttention и PagedAttention ускоряют расчёты. Выбирая ПО для инференса, проверяйте их поддержку.
  3. Диффузионные и мультимодальные модели предъявляют свои требования к ресурсам, так что под генерацию изображений и видео конфигурация может отличаться от конфигурации для текстовых LLM.
  4. Для RAG и агентских систем нужно закладывать ресурсы не только на саму модель, но и на сопутствующие компоненты.

Если вы не уверены, какая платформа подойдёт под ваш сценарий, специалисты «СервакМастер» помогут с подбором: загляните в каталог ИИ-серверов или свяжитесь с нами.

Выводы

Одна технология не вытеснит другую внезапно: эволюция ИИ-архитектур идёт по пути гибридизации. Уже сегодня появляются диффузионные LLM, набирают силу дифференциальные (Neural ODE) и энергетические (Energy-Based Models) нейросети, а множество других подходов пока остаётся в тени, но опирается на принципы современных моделей.

Всё это ведёт к системам, которые объединяют рассуждение, восприятие и память. Главное свойство интеллекта — способность адаптироваться к любым условиям, и ведущие разработчики стремятся к тому, чтобы следующее поколение LLM не просто предсказывало слова, а строило внутренние модели мира, планировало и рассуждало, как человеческий мозг.

Автор: СервакМастер