Зачем нужна MoE: проблема масштабирования
Чем больше параметров у языковой модели — тем она умнее. Этот принцип работает, но создаёт серьёзную проблему: стоимость вычислений растёт вместе с размером модели. Модель на 400 миллиардов параметров требует пропорционально больше памяти и FLOPs, чем модель на 7 миллиардов. На практике это означает дорогое обучение, дорогой инференс и жёсткие требования к железу.
Решение, которое завоёвывает индустрию ИИ — архитектура Mixture of Experts (MoE). Её суть: модель хранит сотни миллиардов параметров, но при обработке каждого токена активирует лишь небольшую их часть. Итог — высокое качество флагманских систем при затратах, сопоставимых с гораздо меньшими плотными моделями.
В этой статье команда СервакМастер подробно разбирает устройство MoE, её преимущества и ограничения, а также конкретные реализации в современных топовых моделях.
Как устроена Mixture of Experts
Эксперты — специализированные подсети
Классический (плотный, или dense) трансформер обрабатывает каждый входной токен через все слои и все параметры целиком. MoE меняет эту логику: вместо единой монолитной FFN-сети в модели размещается набор специализированных подсетей — экспертов.
Каждый эксперт — это отдельный feed-forward блок со своими весами. По архитектуре они идентичны, но в процессе обучения каждый неявно специализируется на определённом типе данных:
- один эксперт тяготеет к научной и технической терминологии;
- другой — к неформальной разговорной речи;
- третий — к математическим и финансовым структурам;
- четвёртый — к синтаксическим паттернам и грамматике.
Специализация возникает сама — без ручных меток и явных ролей. Модель в ходе обучения сама распределяет «обязанности» между экспертами.
Разреженная активация: работает не всё сразу
Ключевая черта MoE — sparse activation (разреженная активация). На каждый токен активируется только топ-K экспертов — как правило, K = 2, 3 или 4. Остальные эксперты в этот момент не тратят ни одного FLO. Реальные вычисления проходят лишь через малую долю суммарных параметров модели — даже если их общее число исчисляется сотнями миллиардов.
Маршрутизатор: кто решает, какой эксперт работает
За выбор активных экспертов отвечает слой-маршрутизатор (Router Layer). Схема его работы:
- Маршрутизатор получает векторное представление текущего токена с учётом контекста.
- Для каждого из N экспертов вычисляется оценка релевантности — насколько данный эксперт подходит именно для этого токена.
- Отбираются K экспертов с максимальными оценками.
- Только выбранные эксперты выполняют вычисления над токеном — независимо друг от друга.
- Результаты взвешенно агрегируются (с весами из оценок маршрутизатора) и передаются дальше по сети.
Преимущества архитектуры MoE
Снижение вычислительных затрат при том же качестве
Разреженная активация — главный козырь MoE. Реальная вычислительная нагрузка определяется количеством активных параметров на токен, а не суммарным объёмом модели.
Пример: Mixtral 8x7B хранит 47B параметров, но на каждый токен активирует лишь около 12,9B. Это даёт скорость инференса примерно в 4 раза выше, чем у плотных моделей сопоставимого качества. DeepSeek R1 при 671B суммарных параметров использует только ~37B активных на токен.
Масштабирование без пропорционального роста затрат
MoE позволяет наращивать «знания» модели, добавляя экспертов, — при этом стоимость одного инференса остаётся фиксированной. Switch Transformer от Google достиг 1,6T параметров при скорости предобучения в 4 раза выше, чем у аналогичных плотных моделей.
Неявная специализация экспертов по доменам (математика, код, лингвистика) улучшает качество на сложных задачах — без усложнения самой архитектуры.
Трудности MoE и способы их решения
Дисбаланс нагрузки между экспертами
Маршрутизатор склонен «залипать» на одних и тех же экспертах: популярные эксперты обучаются лучше и становятся ещё популярнее, остальные деградируют. Это порочный круг, который негативно сказывается на качестве.
Как с этим борются:
- Noisy Top-k Gating — перед отбором топ-K к оценкам добавляется случайный гауссов шум. Небольшая случайность не даёт маршрутизатору жёстко фиксироваться на одних экспертах.
- Auxiliary Loss — специальный штрафной член в функции потерь, поощряющий равномерное распределение токенов по экспертам во время обучения.
- Expert Capacity — жёсткий лимит токенов на одного эксперта за шаг. Токены сверх лимита уходят к резервному эксперту или пропускаются, что принудительно размазывает нагрузку.
Высокое потребление памяти
Несмотря на то что в каждый момент активна лишь часть экспертов, все параметры модели должны находиться в VRAM одновременно. Mixtral 8x7B хранит полные 47B параметров — даже когда использует только 12,9B. Это существенно ограничивает запуск крупных MoE-моделей на потребительском железе.
Архитектурные решения для повышения стабильности
- Switch Transformer (K=1): выбор одного эксперта на токен упрощает маршрутизацию и снижает накладные расходы. В сочетании с ограничением ёмкости даёт ускорение предобучения в 4 раза.
- Иерархическая маршрутизация (DeepSeek-V2): часть экспертов объявляется «общими» (shared) и активируется всегда, остальные — специализированные, выбираются маршрутизатором. Такой подход улучшает стабильность и интерпретируемость.
MoE в ведущих современных моделях
Llama 4 Scout (16×17B)
Meta перевела линейку Llama 4 на архитектуру MoE:
- 16 экспертов, суммарный объём параметров — 109B.
- Активные параметры на токен: ~17B (1 маршрутизированный + 1 shared-эксперт).
- Контекстное окно: 10 млн токенов — рекорд для задач анализа больших кодовых баз и многодокументного суммирования.
Llama 4 Maverick (128×17B)
- 128 экспертов с узкой специализацией (математика, лингвистика, программирование).
- Суммарные параметры: ~400B.
- Активные параметры на токен: ~34B (1 маршрутизированный + 1 shared-эксперт).
- Эффективность: ELO 1417 на LMArena, опережает GPT-4o в мультимодальных бенчмарках при затратах на инференс примерно в 9 раз ниже.
Семейство Llama 4 включает более крупную модель Behemoth, которая выступает «учителем» для Scout и Maverick через дистилляцию знаний.
Как читать обозначение «128×17B»
В записи «128×17B» число 17B — это не размер одного эксперта, а активные параметры на токен. Полные 400B распределены по 128 экспертам, но благодаря shared-слоям и динамической маршрутизации один инференс-шаг нагружает GPU как модель ~34B.
DeepSeek-V2 (236B суммарных параметров)
- 160 специализированных + 2 shared-эксперта.
- Активируется 8 экспертов на токен; активные параметры — 21B, что в 11 раз меньше суммарного объёма.
Qwen2-MoE (Alibaba)
- Гибридная архитектура с экспертами под конкретные задачи: кодинг, математику, общий язык.
- Балансировка нагрузки через параметр Capacity Factor.
Mixtral 8x7B (Mistral)
- 8 экспертов, активируются 2 на токен.
- Активные параметры: 12,9B из 47B общих.
- Скорость инференса — примерно в 4 раза выше по сравнению с плотными моделями аналогичного качества.
MoE и Dense: когда что выбирать
Не все производительные модели переходят на MoE. Плотные трансформеры сохраняют преимущества в сценариях с жёсткими требованиями к задержкам или ограниченными ресурсами:
- Llama 3 (Meta*): до 405B параметров — все активируются на каждом токене. Простое развёртывание, предсказуемая латентность.
- Gemma 2/3 (Google): оптимизированы для мобильных устройств, диапазон 2B–7B параметров.
- Phi-3 (Microsoft): 3,8B параметров, работает на iPhone 14; на бенчмарке MMLU обходит Llama 3 8B (69% против 66%).
В чём принципиальная разница: плотные модели проще обучать и проще разворачивать. Но масштабировать «знания» без кратного роста вычислений в них практически невозможно — это слабое место dense-архитектуры при переходе за 100B параметров.
Итог
Mixture of Experts из академической концепции превратилась в фундамент production-LLM уровня Mixtral, DeepSeek-V2, Llama 4 и Switch Transformer. Разреженная активация всего 2–4 экспертов на токен позволяет строить модели с сотнями миллиардов параметров при затратах на инференс, сопоставимых с моделями в 10–20 раз меньшего объёма.
Плотные архитектуры (Llama 3, Gemma, Phi-3) сохранят свою нишу — прежде всего на edge-устройствах и в задачах с жёсткими требованиями к задержке. Но для флагманских систем, где качество при разумных затратах важнее простоты развёртывания, MoE уже сегодня является архитектурой выбора.
Вопрос о том, станет ли Mixture of Experts де-факто стандартом для всех крупных языковых моделей будущего, остаётся открытым. Одно уже очевидно: роль MoE в революции эффективности ИИ неоспорима — и СервакМастер продолжает следить за развитием этой архитектуры.
*LLAMA — проект Meta Platforms Inc., деятельность которой в России признана экстремистской и запрещена.
**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена.
