Всего три года прошло с выхода GPT-3.5 от OpenAI, а рынок искусственного интеллекта из робкого начинания превратился в одну из самых дорогих отраслей мира и продолжает разгоняться. Двигатель этого роста — архитектуры машинного обучения. От того, насколько хорошо вы понимаете их устройство, зависит и внедрение нейросетей в бизнес-процессы, и решение повседневных задач. В этом материале специалисты «СервакМастер» прослеживают, как развивались архитектуры ИИ-моделей, какие из них востребованы сегодня и куда смещается вектор развития.
Зачем разбираться в устройстве нейросетей
Рынок open-source моделей, которые устанавливают и настраивают самостоятельно, растёт так быстро, что рано или поздно к ним придётся приглядеться почти любому, кто хочет пользоваться локальным и бесплатным ИИ. Проприетарные облачные модели от OpenAI, Google и Anthropic удобны, но платные, поэтому для масштабной работы в продакшене подходят далеко не всегда. Локальные модели доступны всем, у кого есть подходящее оборудование, и их можно доводить под себя: улучшать характеристики и добавлять функции.
Проще всего это показать на сравнении аренды и покупки автомобиля.
| Облачная модель | Локальная модель | |
|---|---|---|
| Аналогия | Аренда машины | Собственный автомобиль |
| Оплата | Подписка или плата за токены | Единоразовые вложения в оборудование |
| Доступ к «двигателю» | Исходного кода нет, модифицировать нельзя | Полный доступ |
| Возможности | Использовать как есть | Дообучение, квантизация, подключение RAG-систем и другой «тюнинг» |
Чтобы тюнинг был осмысленным, нужно понимать, как устроена архитектура модели. А для локального развёртывания потребуется мощное железо: подобрать конфигурацию можно в разделах серверов и ИИ-серверов.
Эволюция: от перцептрона до трансформера
История современных LLM — это не соревнование подходов, а последовательное преодоление чужих ограничений.
Ранние этапы
- 1958 год — описан перцептрон, математическая модель биологического нейрона.
- 1986 год — появились многослойные перцептроны (MLP). Именно они позволили объединять одиночные перцептроны в полноценные нейронные сети.
- Сверточные сети (CNN) — совершили переворот в компьютерном зрении, научившись выделять паттерны, например контуры объектов.
- Рекуррентные сети (RNN) и их улучшенные версии LSTM/GRU — предназначались для последовательностей вроде текста и речи, так как умели «помнить» предыдущие данные.
Проблема RNN и ответ Google
У RNN был серьёзный изъян: длинные зависимости им давались плохо. В 2017 году Google предложила механизм внимания (Self-Attention) и архитектуру трансформеров в статье «Attention Is All You Need». Это вывело отрасль из стагнации и оставило рекуррентные связи в прошлом. Механизм внимания позволяет модели видеть весь контекст запроса целиком и гибко решать, каким словам уделить больше внимания при генерации ответа, одновременно «предугадывая» продолжение.
Первые LLM
В 2018 году на базе трансформеров появились первые полноценные большие языковые модели: GPT-1 от OpenAI и BERT от Google. Они открыли эпоху LLM, а позднее GPT-3.5 стала первым ИИ-проектом, который привлёк массовую аудиторию и показал потенциал генеративного интеллекта.
Трансформеры: почему они стали основой
RNN читает предложение слово за словом. Трансформер анализирует все слова одновременно и определяет связи между ними, даже если они расположены в разных концах абзаца. Похоже на то, как человек при чтении интуитивно понимает, чем закончится фраза.
Вторая сильная сторона — масштабируемость: с ростом размера растёт и эффективность. Поэтому вскоре после GPT-1 и BERT появилось множество семейств моделей: LLaMA, Claude, Mistral, ERNIE, Gemini и другие. Параметров становилось всё больше, а вместе с ними росли производительность и вычислительные затраты.
Чтобы удешевить расчёты, придумали разновидность трансформера — MoE (Mixture-of-Experts), где разные части модели включаются в зависимости от запроса пользователя. Эффективность трансформеров сегодня повышают и другие приёмы:
- FlashAttention и PagedAttention — ускоряют вычисления;
- LoRA и QLoRA — быстрая адаптация модели под конкретную задачу;
- Fine-Tuning — масштабная настройка LLM.
Диффузионные модели: новая волна генеративного ИИ
Языковые модели работали с текстом, и логичным следующим шагом стала генерация графики. В 2020 году появилась первая диффузионная модель DDPM (Denoising Diffusion Probabilistic Models). Принцип её работы — денойзинг: данные сначала зашумляются, а затем очищаются от шума, и из него постепенно проступает изображение или даже видео.
В 2021 году вышли первые массовые диффузионные модели, Stable Diffusion и DALL-E. На их идеях выросли Veo 3, Midjourney, DALL·E 3, Flux 1.1, Grok Image v0.9, Qwen‑Image и Wan 2.2, которые, по иронии автора оригинала, в ответе за поток «брейнрот-контента» в соцсетях.
Диффузия приходит в текст
Теперь тот же принцип переносят на языковые модели. Диффузионные LLM, например анонсированные Gemini Diffusion и Mercury, не предсказывают токены строго по очереди, а генерируют текст параллельно за несколько итераций «очистки». Методы вроде Latent Refinement Decoding (LRD) сначала формируют смысловой черновик в скрытом пространстве, а затем доводят его до грамматически правильного текста.
Преимущества заметны:
- скорость 1000+ токенов/с против 200-300 токенов/с у классических трансформеров;
- возможность самокоррекции ответа на лету.
Мультимодальные архитектуры
Надоело использовать трансформеры для текста и диффузию для картинок, поэтому границы решили стереть. В 2023 году появились массовые мультимодальные LLM (Vision-Language Models). Работать с изображениями ИИ умел и раньше, с 2019 года (VisualBERT), но опирался на устаревшие принципы CNN, чтобы распознавать содержимое кадра. Мультимодальные LLM — принципиально иная, целостная архитектура: кросс-модальное внимание ищет прямые связи между фрагментами изображения, словами запроса и даже тоном голоса.
Яркие представители:
- китайские Qwen3-Omni и Qwen3-VL;
- Gemini 2.5-Pro;
- GPT-4, которая сделала VL-модели популярными.
Общение с такими моделями стало естественным за счёт сквозной обработки почти всех модальностей. Остаётся добавить осязание и вкус, но для этого нужно придумать адекватную реализацию. Мультимодальность из приятной функции превращается в архитектурную парадигму, благодаря которой нейросети будут воспринимать мир целостно, как человек.
Альтернативы трансформерам: State-Space, Mamba, RWKV
Несмотря на лидерство, у трансформеров есть слабое место: вычислительная сложность растёт квадратично с длиной контекста. Разбирать длинные книги, кодовые базы и объёмные документы поэтому крайне затратно. Пока диффузионные LLM не показали потенциал на практике, исследователи ищут альтернативу, отказываясь от механизма внимания.
| Архитектура | Суть |
|---|---|
| State-Space Models (S4/S5) | Принципы теории управления для длинных последовательностей с почти линейной сложностью. Модель будто делает заметки, чтобы не забыть, о чём шла речь |
| Mamba | Следующий шаг: селективный механизм, динамически решающий, какую информацию из контекста учитывать, а какую отбросить |
| RWKV | Гибрид: эффективность RNN на инференсе в сочетании с эффективностью трансформеров. Возврат к классике, доработанный современными методами |
Все они отвечают на запрос индустрии на более быстрые и экономичные модели без потери качества, что особенно важно для развёртывания на edge-устройствах. Подробнее об этих архитектурах мы расскажем в отдельной статье.
Архитектуры взаимодействия: RAG, Graph RAG, Agentic RAG, MCP
Современные модели редко работают поодиночке: из них собирают сложные системы, а эффективность определяют архитектуры взаимодействия.
- RAG (Retrieval-Augmented Generation) — уже мейнстрим. Соединяет LLM с внешними базами знаний: модель опирается не только на собственную память, а берёт актуальные данные до генерации ответа. Точность растёт, галлюцинаций становится меньше.
- Graph RAG и Agentic RAG — надстройки, превращающие цепочку RAG в агента с улучшенной памятью, планированием и ветвлением логики, способного выполнять многошаговые задачи.
- Model Context Protocol (MCP) — стандартизированный протокол безопасного подключения моделей к внешним инструментам, данным и API; основа для сильных агентских экосистем.
Эти технологии не заменяют архитектуры нейросетей, а добавляют следующий уровень абстракции: одиночная модель превращается в интеллектуальную систему, способную решать сложные бизнес-задачи.
Практические выводы для тех, кто собирает ИИ-инфраструктуру
Хотя исходный материал посвящён теории, из него следуют вполне приземлённые вещи.
- Локальные модели дают свободу тюнинга (дообучение, квантизация, RAG), но требуют мощного оборудования, поэтому железо стоит подбирать под архитектуру и задачи.
- MoE-модели экономят вычисления, а FlashAttention и PagedAttention ускоряют расчёты. Выбирая ПО для инференса, проверяйте их поддержку.
- Диффузионные и мультимодальные модели предъявляют свои требования к ресурсам, так что под генерацию изображений и видео конфигурация может отличаться от конфигурации для текстовых LLM.
- Для RAG и агентских систем нужно закладывать ресурсы не только на саму модель, но и на сопутствующие компоненты.
Если вы не уверены, какая платформа подойдёт под ваш сценарий, специалисты «СервакМастер» помогут с подбором: загляните в каталог ИИ-серверов или свяжитесь с нами.
Выводы
Одна технология не вытеснит другую внезапно: эволюция ИИ-архитектур идёт по пути гибридизации. Уже сегодня появляются диффузионные LLM, набирают силу дифференциальные (Neural ODE) и энергетические (Energy-Based Models) нейросети, а множество других подходов пока остаётся в тени, но опирается на принципы современных моделей.
Всё это ведёт к системам, которые объединяют рассуждение, восприятие и память. Главное свойство интеллекта — способность адаптироваться к любым условиям, и ведущие разработчики стремятся к тому, чтобы следующее поколение LLM не просто предсказывало слова, а строило внутренние модели мира, планировало и рассуждало, как человеческий мозг.
Автор: СервакМастер
