Зачем нужна MoE: проблема масштабирования

Чем больше параметров у языковой модели — тем она умнее. Этот принцип работает, но создаёт серьёзную проблему: стоимость вычислений растёт вместе с размером модели. Модель на 400 миллиардов параметров требует пропорционально больше памяти и FLOPs, чем модель на 7 миллиардов. На практике это означает дорогое обучение, дорогой инференс и жёсткие требования к железу.

Решение, которое завоёвывает индустрию ИИ — архитектура Mixture of Experts (MoE). Её суть: модель хранит сотни миллиардов параметров, но при обработке каждого токена активирует лишь небольшую их часть. Итог — высокое качество флагманских систем при затратах, сопоставимых с гораздо меньшими плотными моделями.

В этой статье команда СервакМастер подробно разбирает устройство MoE, её преимущества и ограничения, а также конкретные реализации в современных топовых моделях.


Как устроена Mixture of Experts

Эксперты — специализированные подсети

Классический (плотный, или dense) трансформер обрабатывает каждый входной токен через все слои и все параметры целиком. MoE меняет эту логику: вместо единой монолитной FFN-сети в модели размещается набор специализированных подсетей — экспертов.

Каждый эксперт — это отдельный feed-forward блок со своими весами. По архитектуре они идентичны, но в процессе обучения каждый неявно специализируется на определённом типе данных:

  • один эксперт тяготеет к научной и технической терминологии;
  • другой — к неформальной разговорной речи;
  • третий — к математическим и финансовым структурам;
  • четвёртый — к синтаксическим паттернам и грамматике.

Специализация возникает сама — без ручных меток и явных ролей. Модель в ходе обучения сама распределяет «обязанности» между экспертами.

Разреженная активация: работает не всё сразу

Ключевая черта MoE — sparse activation (разреженная активация). На каждый токен активируется только топ-K экспертов — как правило, K = 2, 3 или 4. Остальные эксперты в этот момент не тратят ни одного FLO. Реальные вычисления проходят лишь через малую долю суммарных параметров модели — даже если их общее число исчисляется сотнями миллиардов.

Маршрутизатор: кто решает, какой эксперт работает

За выбор активных экспертов отвечает слой-маршрутизатор (Router Layer). Схема его работы:

  1. Маршрутизатор получает векторное представление текущего токена с учётом контекста.
  2. Для каждого из N экспертов вычисляется оценка релевантности — насколько данный эксперт подходит именно для этого токена.
  3. Отбираются K экспертов с максимальными оценками.
  4. Только выбранные эксперты выполняют вычисления над токеном — независимо друг от друга.
  5. Результаты взвешенно агрегируются (с весами из оценок маршрутизатора) и передаются дальше по сети.

Преимущества архитектуры MoE

Снижение вычислительных затрат при том же качестве

Разреженная активация — главный козырь MoE. Реальная вычислительная нагрузка определяется количеством активных параметров на токен, а не суммарным объёмом модели.

Пример: Mixtral 8x7B хранит 47B параметров, но на каждый токен активирует лишь около 12,9B. Это даёт скорость инференса примерно в 4 раза выше, чем у плотных моделей сопоставимого качества. DeepSeek R1 при 671B суммарных параметров использует только ~37B активных на токен.

Масштабирование без пропорционального роста затрат

MoE позволяет наращивать «знания» модели, добавляя экспертов, — при этом стоимость одного инференса остаётся фиксированной. Switch Transformer от Google достиг 1,6T параметров при скорости предобучения в 4 раза выше, чем у аналогичных плотных моделей.

Неявная специализация экспертов по доменам (математика, код, лингвистика) улучшает качество на сложных задачах — без усложнения самой архитектуры.


Трудности MoE и способы их решения

Дисбаланс нагрузки между экспертами

Маршрутизатор склонен «залипать» на одних и тех же экспертах: популярные эксперты обучаются лучше и становятся ещё популярнее, остальные деградируют. Это порочный круг, который негативно сказывается на качестве.

Как с этим борются:

  • Noisy Top-k Gating — перед отбором топ-K к оценкам добавляется случайный гауссов шум. Небольшая случайность не даёт маршрутизатору жёстко фиксироваться на одних экспертах.
  • Auxiliary Loss — специальный штрафной член в функции потерь, поощряющий равномерное распределение токенов по экспертам во время обучения.
  • Expert Capacity — жёсткий лимит токенов на одного эксперта за шаг. Токены сверх лимита уходят к резервному эксперту или пропускаются, что принудительно размазывает нагрузку.

Высокое потребление памяти

Несмотря на то что в каждый момент активна лишь часть экспертов, все параметры модели должны находиться в VRAM одновременно. Mixtral 8x7B хранит полные 47B параметров — даже когда использует только 12,9B. Это существенно ограничивает запуск крупных MoE-моделей на потребительском железе.

Архитектурные решения для повышения стабильности

  • Switch Transformer (K=1): выбор одного эксперта на токен упрощает маршрутизацию и снижает накладные расходы. В сочетании с ограничением ёмкости даёт ускорение предобучения в 4 раза.
  • Иерархическая маршрутизация (DeepSeek-V2): часть экспертов объявляется «общими» (shared) и активируется всегда, остальные — специализированные, выбираются маршрутизатором. Такой подход улучшает стабильность и интерпретируемость.

MoE в ведущих современных моделях

Llama 4 Scout (16×17B)

Meta перевела линейку Llama 4 на архитектуру MoE:

  • 16 экспертов, суммарный объём параметров — 109B.
  • Активные параметры на токен: ~17B (1 маршрутизированный + 1 shared-эксперт).
  • Контекстное окно: 10 млн токенов — рекорд для задач анализа больших кодовых баз и многодокументного суммирования.

Llama 4 Maverick (128×17B)

  • 128 экспертов с узкой специализацией (математика, лингвистика, программирование).
  • Суммарные параметры: ~400B.
  • Активные параметры на токен: ~34B (1 маршрутизированный + 1 shared-эксперт).
  • Эффективность: ELO 1417 на LMArena, опережает GPT-4o в мультимодальных бенчмарках при затратах на инференс примерно в 9 раз ниже.

Семейство Llama 4 включает более крупную модель Behemoth, которая выступает «учителем» для Scout и Maverick через дистилляцию знаний.

Как читать обозначение «128×17B»

В записи «128×17B» число 17B — это не размер одного эксперта, а активные параметры на токен. Полные 400B распределены по 128 экспертам, но благодаря shared-слоям и динамической маршрутизации один инференс-шаг нагружает GPU как модель ~34B.

DeepSeek-V2 (236B суммарных параметров)

  • 160 специализированных + 2 shared-эксперта.
  • Активируется 8 экспертов на токен; активные параметры — 21B, что в 11 раз меньше суммарного объёма.

Qwen2-MoE (Alibaba)

  • Гибридная архитектура с экспертами под конкретные задачи: кодинг, математику, общий язык.
  • Балансировка нагрузки через параметр Capacity Factor.

Mixtral 8x7B (Mistral)

  • 8 экспертов, активируются 2 на токен.
  • Активные параметры: 12,9B из 47B общих.
  • Скорость инференса — примерно в 4 раза выше по сравнению с плотными моделями аналогичного качества.

MoE и Dense: когда что выбирать

Не все производительные модели переходят на MoE. Плотные трансформеры сохраняют преимущества в сценариях с жёсткими требованиями к задержкам или ограниченными ресурсами:

  • Llama 3 (Meta*): до 405B параметров — все активируются на каждом токене. Простое развёртывание, предсказуемая латентность.
  • Gemma 2/3 (Google): оптимизированы для мобильных устройств, диапазон 2B–7B параметров.
  • Phi-3 (Microsoft): 3,8B параметров, работает на iPhone 14; на бенчмарке MMLU обходит Llama 3 8B (69% против 66%).

В чём принципиальная разница: плотные модели проще обучать и проще разворачивать. Но масштабировать «знания» без кратного роста вычислений в них практически невозможно — это слабое место dense-архитектуры при переходе за 100B параметров.


Итог

Mixture of Experts из академической концепции превратилась в фундамент production-LLM уровня Mixtral, DeepSeek-V2, Llama 4 и Switch Transformer. Разреженная активация всего 2–4 экспертов на токен позволяет строить модели с сотнями миллиардов параметров при затратах на инференс, сопоставимых с моделями в 10–20 раз меньшего объёма.

Плотные архитектуры (Llama 3, Gemma, Phi-3) сохранят свою нишу — прежде всего на edge-устройствах и в задачах с жёсткими требованиями к задержке. Но для флагманских систем, где качество при разумных затратах важнее простоты развёртывания, MoE уже сегодня является архитектурой выбора.

Вопрос о том, станет ли Mixture of Experts де-факто стандартом для всех крупных языковых моделей будущего, остаётся открытым. Одно уже очевидно: роль MoE в революции эффективности ИИ неоспорима — и СервакМастер продолжает следить за развитием этой архитектуры.


*LLAMA — проект Meta Platforms Inc., деятельность которой в России признана экстремистской и запрещена.

**Деятельность Meta Platforms Inc. в России признана экстремистской и запрещена.