Второго декабря 2025 года французская компания Mistral AI выпустила третье поколение своих открытых моделей. Это не нейросеть «с нуля», а эволюция уже знакомого семейства: мультимодальные модели, которые работают с текстом и изображениями, понимают десятки языков и охватывают весь диапазон — от компактных решений для периферийных устройств до корпоративных систем уровня дата-центра. Ниже разберём, из чего состоит линейка, как устроена её архитектура, сколько памяти нужно под каждую модель и какое место Mistral 3 занимает среди конкурентов.

Что вошло в семейство Mistral 3

Линейка делится на две ветви. Первая — лёгкие модели Ministral 3 в трёх размерах: 3B, 8B и 14B. Вторая — флагман Mistral Large 3.

Параметр Ministral 3 (3B, 8B, 14B) Mistral Large 3
Архитектура Dense (плотная) MoE (granular mixture-of-experts)
Параметры 3B / 8B / 14B 41B active / 675B total (в других подсчётах 39B / 673B плюс vision encoder 2.5B)
Vision encoder 0.4B 2.5B
Контекст 256K токенов 256K токенов
Лицензия Apache 2.0 Apache 2.0

Ministral 3 выходят в вариантах Base, Instruct и Reasoning — для трёх размеров это девять моделей. Mistral Large 3 выпущен в вариантах Base и Instruct, а reasoning-версия заявлена на более поздний срок. Таким образом, для локального развёртывания и дообучения доступны девять открытых моделей, к которым добавляется флагман.

Флагман обучали на кластере примерно из трёх тысяч GPU NVIDIA H200, и это заметно по качеству. Для практика главное вот что: перед нами не очередная косметическая итерация, а действительно новое поколение открытых моделей.

Архитектура: два разных подхода

Семейство выделяется тем, что сочетает две архитектуры. Компактные плотные сети рассчитаны на периферийные сценарии, а крупная MoE-модель масштабируется до экстремальных нагрузок.

Как работает MoE в Large 3

Полный объём параметров Large 3 составляет 675B, но при обработке запроса задействуются не все слои и не все эксперты. Цифра 41B active — это число параметров, которые реально участвуют в расчёте одного прохода. Остальные «ждут» своей очереди, пока не понадобится их специализация. Аналогия простая: в большой компании вы не зовёте весь штат на консультацию, а обращаетесь к одному нужному специалисту.

По данным NVIDIA, в каждом слое Large 3 работает порядка 128 экспертов. Маршрутизатор выбирает из них несколько, и именно они формируют ответ. Поэтому 675B — это максимальный потенциал, своего рода «энциклопедия возможностей», а 41B active — рабочая часть в конкретный момент. В итоге получается гигантская модель со стоимостью вычислений, сопоставимой с моделью среднего размера. Именно такое сочетание мощности и эффективности позволяет открытой Large 3 конкурировать с системами уровня OpenAI и Google.

Почему Ministral — это dense-модели

У Ministral 3 другая задача: компактность, стабильность и предсказуемость на массовом железе. Разработчики отказались от MoE и выбрали классическую dense-архитектуру, где все параметры активны всегда и вычисления идут ровным фронтом по всей сети. Сильные стороны такого решения:

  • Простой локальный запуск. Dense-модели легче оптимизировать под ноутбуки, настольные GPU и даже мобильные устройства.
  • Предсказуемая производительность. Пиковых скачков почти нет, нагрузка равномерная.
  • Стабильность на edge-устройствах. Даже ограниченные по ресурсам GPU ведут себя предсказуемо, что важно для локальных ассистентов и офлайн-сценариев.

Есть и обратная сторона: dense-архитектуры хуже масштабируются вверх. Рост числа параметров напрямую увеличивает вычислительную стоимость, поэтому 600-миллиардная dense-модель нереалистична. Для визуальных задач Ministral оснащены компактным vision encoder на 0.4B параметров. Он заметно легче и менее требователен к памяти, чем 2.5-миллиардный энкодер у Large 3, что даёт больше свободы при развёртывании на ограниченных ресурсах.

Требования к памяти

Ниже приведены ориентиры по памяти для весов, без учёта KV-cache. Реальные требования зависят от длины контекста, размера batch и используемого движка.

Модель Q4K-M FP8 BF16 / FP16
Ministral 3B около 2.2 GB около 4.5 GB около 10 GB
Ministral 8B около 5.2 GB около 11 GB около 21 GB
Ministral 14B около 8.24 GB около 16 GB около 32 GB
Mistral Large 3 — около 682 GB около 1.35 TB (FP16); NVFP4 — 403 GB

Ministral 3B

Самая компактная модель семейства, рассчитанная на локальные сценарии. В квантизации Q4K-M для llama.cpp она занимает около 2.2 GB, чего достаточно для слабых устройств, вплоть до некоторых мини-ПК. Технически запуск возможен и на смартфонах через специальные сборки, но с ограничениями по скорости и контексту. В FP8 потребление вырастает до 4.5 GB. Важная оговорка: FP8-чекпойнты в первую очередь рассчитаны на Hopper и Blackwell с совместимым стеком, а на массовых GPU чаще используют BF16/FP16 или 4-битные кванты. В BF16 нужно около 10 GB, то есть подойдёт ноутбук с 12–16 GB VRAM или любая десктопная карта среднего класса. Это хороший вариант для лёгкого локального ассистента с быстрым стартом.

Ministral 8B

«Средний класс» линейки: заметно мощнее 3B, но всё ещё комфортно работает на обычных пользовательских видеокартах.

  • Q4K-M: примерно 5.2 GB VRAM — подходит для широкого круга домашних GPU.
  • FP8: около 11 GB — оптимальный режим для настольных ПК с картами на 12–16 GB (с учётом поддержки FP8).
  • BF16: около 21 GB — понадобится старшая потребительская видеокарта или single-GPU сервер начального уровня.

Модель удобна как универсальная основа для разработки, локальных ассистентов, экспериментов с RAG и мультимодальностью без перегрузки железа.

Ministral 14B

Старшая из компактных моделей, по качеству ощутимо приближающаяся к крупным системам, но всё ещё пригодная для локального запуска на мощной видеокарте.

  • Q4K-M: примерно 8.24 GB VRAM — уверенно работает на продвинутых домашних GPU.
  • FP8: около 16 GB — уровень видеокарт RTX 4080/4090 или серверных A-чипов начальной конфигурации (с учётом поддержки FP8).
  • BF16: около 32 GB — уже требуется single-GPU сервер или профессиональный ускоритель.

Ministral 14B стоит выбирать, когда нужны высокое качество, стабильный вывод и полноценная работа с длинным контекстом без перехода на тяжёлые MoE-модели.

Mistral Large 3

Это уже не локальная модель, а корпоративный флагман, которому нужна инфраструктура уровня дата-центра. В FP16 ему требуется около 1.35 TB видеопамяти, так что запуск на одиночном GPU исключён. В FP8 потребность снижается до примерно 682 GB VRAM, но и это возможно только на распределённых кластерных конфигурациях. Самый экономный вариант — NVFP4, где потребление уменьшается до 403 GB. Это всё ещё инфраструктурный уровень с множеством GPU и быстрыми межсоединениями, однако оптимизированный NVFP4-чекпойнт заявлен как запускаемый на одном узле 8×A100 или 8×H100.

Модель изначально создавалась для серверов с H100/H200 или новыми B-сериями, а её запуск подразумевает распределённый inference. Для локальных систем она не предназначена: это инструмент для компаний, которым нужны RAG-платформы, сложные аналитические сценарии и высоконагруженные агентные цепочки.

Что это значит при выборе железа

Из требований следуют несколько практических выводов.

  1. Локально запускаются только модели серии Ministral. Они рассчитаны на обычные видеокарты и даже на компактные устройства; единственный критерий выбора — объём видеопамяти. Чем он больше, тем «тяжелее» формат модели вы можете себе позволить. Подойдут как потребительские GPU NVIDIA, так и AMD.
  2. Серия Large — это минимум multi-GPU или multi-node. Веса в FP16 требуют порядка 1.35 TB суммарной VRAM, и это не прихоть, а прямое следствие масштаба MoE-архитектуры и огромного числа параметров.
  3. Оптимальные ускорители для Large-моделей хорошо известны: A100, H100, H200, B200 и B300. Они дают объём памяти и пропускную способность, без которых вывод просто не состоится.
  4. Один узел на восемь GPU — реалистичная точка входа. Раз NVFP4-чекпойнт Large 3 заявлен для одного узла 8×A100/8×H100, для многих компаний вопрос сводится не к кластеру, а к правильно собранному GPU-серверу.

Если вы планируете развернуть Ministral на одной карте или собрать узел под Large 3, подобрать конфигурацию под вашу задачу поможет каталог AI-серверов и серверного оборудования «СервакМастер», а с расчётом памяти, охлаждения и межсоединений можно обратиться к специалистам через страницу контактов.

Возможности моделей

Важно разделять то, что умеют сами модели (мультимодальность, многоязычность, длинный контекст), и то, что даёт окружающая экосистема: фреймворки, движки и серверы, которые уже внедрили поддержку Mistral 3.

Мультимодальность

Vision-версии уверенно работают с изображениями и документами. Они не заменяют узкоспециализированные CV-модели, но в задачах общего назначения достаточно гибки и надёжны. Основные сценарии:

  • Скриншоты: интерфейсы, ошибки, панели настроек, структура страниц — модель понимает и текст, и визуальный контекст.
  • Документы: распознавание структуры и логики блоков, извлечение ключевой информации.
  • Фото: описание, классификация, поиск объектов, базовый визуальный анализ.
  • PDF-страницы: чтение таблиц, заголовков, многоуровневых блоков, работа с реальными макетами.
  • Карточки товара: извлечение характеристик, сравнение вариантов, анализ изображений для e-commerce.

Vision-компонент универсальный, а не специализированный. На сложных задачах он уступает отдельным CV-моделям по точности, зато выигрывает в гибкости, особенно когда картинка становится частью многошагового рассуждения.

Многоязычность

Одно из заметных преимуществ — уверенная работа более чем с 40 языками, а не только с английским и китайским, как у многих крупных моделей. Это удобно для международных проектов и локальных ассистентов. Русский язык поддерживается, и качество на нём стало заметно лучше, чем в ранних версиях. Но обещать идеальный результат было бы неверно: лучший способ оценки — проверить модель на примерах, близких к вашему сценарию. В одних случаях текст получается чистым и связным, в других потребуются дополнительная настройка или уточнения.

Контекст в 256K токенов

Такой объём меняет сам подход к построению решений: в модель можно загружать не фрагменты, а целые массивы информации, не прибегая к агрессивному дроблению. Где это даёт максимум пользы:

  • RAG: большие фрагменты базы знаний анализируются целиком, ответы получаются точнее.
  • Юридические документы: многостраничные договоры, приложения и пакеты нормативных актов обрабатываются как единое целое.
  • Многостраничные спецификации: технические требования, стандарты и описания API можно загружать полностью.
  • Агентные пайплайны: модель удерживает историю рассуждений, инструкции и промежуточные выводы на больших дистанциях.
  • Длинные переписки: диалог не обрывается логически, модель помнит детали и корректно возвращается к старым темам.

Стоит помнить, что длинный контекст увеличивает размер KV-cache, поэтому при планировании видеопамяти нужен запас сверх цифр для весов.

Бенчмарки и LMArena

Выход Mistral 3 быстро отразился на публичных лидербордах, в частности на LMArena, где модели сравнивают в равных условиях по широкому набору задач. На момент анонса, 2 декабря 2025 года, представители семейства уверенно заняли верхние позиции среди открытых моделей (OSS). В сравнении участвовали также Qwen3-VL, DeepSeek-V3.2 и Kimi-K2.

Особенно заметен рост у Ministral 14B Instruct и Ministral 14B Reasoning, которые в некоторых тестах обгоняют более крупные модели других разработчиков. Флагман Mistral Large 3 вошёл в число лидеров OSS-сегмента и по ряду метрик приближается к закрытым системам уровня GPT-4.1 и Gemini Ultra. Абсолютного первого места у него нет, но разрыв между open-weight и закрытыми моделями стал минимальным за всю историю подобных сравнений.

Лидерборд LMArena динамический: позиции меняются буквально каждую неделю, модели дообучаются, появляются новые версии. Общий тренд при этом очевиден — релиз Mistral 3 перетасовал расклад сил, усилил открытую экосистему и закрепил присутствие Европы в верхнем сегменте мирового рынка ИИ.

Итоги

Mistral 3 — один из самых значимых релизов года для открытых моделей. Появление сильного open-weight решения, созданного не в США и не в Китае, делает глобальную гонку ИИ более сбалансированной. Для бизнеса и разработчиков это расширение выбора: компактные Ministral 3B, 8B и 14B запускаются на обычных видеокартах, а Mistral Large 3 с контекстом 256K и лицензией Apache 2.0 даёт корпоративный уровень на собственной инфраструктуре. Выбор между ними определяется в первую очередь доступной видеопамятью, поэтому начинать планирование стоит именно с неё.