Второго декабря 2025 года французская компания Mistral AI выпустила третье поколение своих открытых моделей. Это не нейросеть «с нуля», а эволюция уже знакомого семейства: мультимодальные модели, которые работают с текстом и изображениями, понимают десятки языков и охватывают весь диапазон — от компактных решений для периферийных устройств до корпоративных систем уровня дата-центра. Ниже разберём, из чего состоит линейка, как устроена её архитектура, сколько памяти нужно под каждую модель и какое место Mistral 3 занимает среди конкурентов.
Что вошло в семейство Mistral 3
Линейка делится на две ветви. Первая — лёгкие модели Ministral 3 в трёх размерах: 3B, 8B и 14B. Вторая — флагман Mistral Large 3.
| Параметр | Ministral 3 (3B, 8B, 14B) | Mistral Large 3 |
|---|---|---|
| Архитектура | Dense (плотная) | MoE (granular mixture-of-experts) |
| Параметры | 3B / 8B / 14B | 41B active / 675B total (в других подсчётах 39B / 673B плюс vision encoder 2.5B) |
| Vision encoder | 0.4B | 2.5B |
| Контекст | 256K токенов | 256K токенов |
| Лицензия | Apache 2.0 | Apache 2.0 |
Ministral 3 выходят в вариантах Base, Instruct и Reasoning — для трёх размеров это девять моделей. Mistral Large 3 выпущен в вариантах Base и Instruct, а reasoning-версия заявлена на более поздний срок. Таким образом, для локального развёртывания и дообучения доступны девять открытых моделей, к которым добавляется флагман.
Флагман обучали на кластере примерно из трёх тысяч GPU NVIDIA H200, и это заметно по качеству. Для практика главное вот что: перед нами не очередная косметическая итерация, а действительно новое поколение открытых моделей.
Архитектура: два разных подхода
Семейство выделяется тем, что сочетает две архитектуры. Компактные плотные сети рассчитаны на периферийные сценарии, а крупная MoE-модель масштабируется до экстремальных нагрузок.
Как работает MoE в Large 3
Полный объём параметров Large 3 составляет 675B, но при обработке запроса задействуются не все слои и не все эксперты. Цифра 41B active — это число параметров, которые реально участвуют в расчёте одного прохода. Остальные «ждут» своей очереди, пока не понадобится их специализация. Аналогия простая: в большой компании вы не зовёте весь штат на консультацию, а обращаетесь к одному нужному специалисту.
По данным NVIDIA, в каждом слое Large 3 работает порядка 128 экспертов. Маршрутизатор выбирает из них несколько, и именно они формируют ответ. Поэтому 675B — это максимальный потенциал, своего рода «энциклопедия возможностей», а 41B active — рабочая часть в конкретный момент. В итоге получается гигантская модель со стоимостью вычислений, сопоставимой с моделью среднего размера. Именно такое сочетание мощности и эффективности позволяет открытой Large 3 конкурировать с системами уровня OpenAI и Google.
Почему Ministral — это dense-модели
У Ministral 3 другая задача: компактность, стабильность и предсказуемость на массовом железе. Разработчики отказались от MoE и выбрали классическую dense-архитектуру, где все параметры активны всегда и вычисления идут ровным фронтом по всей сети. Сильные стороны такого решения:
- Простой локальный запуск. Dense-модели легче оптимизировать под ноутбуки, настольные GPU и даже мобильные устройства.
- Предсказуемая производительность. Пиковых скачков почти нет, нагрузка равномерная.
- Стабильность на edge-устройствах. Даже ограниченные по ресурсам GPU ведут себя предсказуемо, что важно для локальных ассистентов и офлайн-сценариев.
Есть и обратная сторона: dense-архитектуры хуже масштабируются вверх. Рост числа параметров напрямую увеличивает вычислительную стоимость, поэтому 600-миллиардная dense-модель нереалистична. Для визуальных задач Ministral оснащены компактным vision encoder на 0.4B параметров. Он заметно легче и менее требователен к памяти, чем 2.5-миллиардный энкодер у Large 3, что даёт больше свободы при развёртывании на ограниченных ресурсах.
Требования к памяти
Ниже приведены ориентиры по памяти для весов, без учёта KV-cache. Реальные требования зависят от длины контекста, размера batch и используемого движка.
| Модель | Q4K-M | FP8 | BF16 / FP16 |
|---|---|---|---|
| Ministral 3B | около 2.2 GB | около 4.5 GB | около 10 GB |
| Ministral 8B | около 5.2 GB | около 11 GB | около 21 GB |
| Ministral 14B | около 8.24 GB | около 16 GB | около 32 GB |
| Mistral Large 3 | — | около 682 GB | около 1.35 TB (FP16); NVFP4 — 403 GB |
Ministral 3B
Самая компактная модель семейства, рассчитанная на локальные сценарии. В квантизации Q4K-M для llama.cpp она занимает около 2.2 GB, чего достаточно для слабых устройств, вплоть до некоторых мини-ПК. Технически запуск возможен и на смартфонах через специальные сборки, но с ограничениями по скорости и контексту. В FP8 потребление вырастает до 4.5 GB. Важная оговорка: FP8-чекпойнты в первую очередь рассчитаны на Hopper и Blackwell с совместимым стеком, а на массовых GPU чаще используют BF16/FP16 или 4-битные кванты. В BF16 нужно около 10 GB, то есть подойдёт ноутбук с 12–16 GB VRAM или любая десктопная карта среднего класса. Это хороший вариант для лёгкого локального ассистента с быстрым стартом.
Ministral 8B
«Средний класс» линейки: заметно мощнее 3B, но всё ещё комфортно работает на обычных пользовательских видеокартах.
- Q4K-M: примерно 5.2 GB VRAM — подходит для широкого круга домашних GPU.
- FP8: около 11 GB — оптимальный режим для настольных ПК с картами на 12–16 GB (с учётом поддержки FP8).
- BF16: около 21 GB — понадобится старшая потребительская видеокарта или single-GPU сервер начального уровня.
Модель удобна как универсальная основа для разработки, локальных ассистентов, экспериментов с RAG и мультимодальностью без перегрузки железа.
Ministral 14B
Старшая из компактных моделей, по качеству ощутимо приближающаяся к крупным системам, но всё ещё пригодная для локального запуска на мощной видеокарте.
- Q4K-M: примерно 8.24 GB VRAM — уверенно работает на продвинутых домашних GPU.
- FP8: около 16 GB — уровень видеокарт RTX 4080/4090 или серверных A-чипов начальной конфигурации (с учётом поддержки FP8).
- BF16: около 32 GB — уже требуется single-GPU сервер или профессиональный ускоритель.
Ministral 14B стоит выбирать, когда нужны высокое качество, стабильный вывод и полноценная работа с длинным контекстом без перехода на тяжёлые MoE-модели.
Mistral Large 3
Это уже не локальная модель, а корпоративный флагман, которому нужна инфраструктура уровня дата-центра. В FP16 ему требуется около 1.35 TB видеопамяти, так что запуск на одиночном GPU исключён. В FP8 потребность снижается до примерно 682 GB VRAM, но и это возможно только на распределённых кластерных конфигурациях. Самый экономный вариант — NVFP4, где потребление уменьшается до 403 GB. Это всё ещё инфраструктурный уровень с множеством GPU и быстрыми межсоединениями, однако оптимизированный NVFP4-чекпойнт заявлен как запускаемый на одном узле 8×A100 или 8×H100.
Модель изначально создавалась для серверов с H100/H200 или новыми B-сериями, а её запуск подразумевает распределённый inference. Для локальных систем она не предназначена: это инструмент для компаний, которым нужны RAG-платформы, сложные аналитические сценарии и высоконагруженные агентные цепочки.
Что это значит при выборе железа
Из требований следуют несколько практических выводов.
- Локально запускаются только модели серии Ministral. Они рассчитаны на обычные видеокарты и даже на компактные устройства; единственный критерий выбора — объём видеопамяти. Чем он больше, тем «тяжелее» формат модели вы можете себе позволить. Подойдут как потребительские GPU NVIDIA, так и AMD.
- Серия Large — это минимум multi-GPU или multi-node. Веса в FP16 требуют порядка 1.35 TB суммарной VRAM, и это не прихоть, а прямое следствие масштаба MoE-архитектуры и огромного числа параметров.
- Оптимальные ускорители для Large-моделей хорошо известны: A100, H100, H200, B200 и B300. Они дают объём памяти и пропускную способность, без которых вывод просто не состоится.
- Один узел на восемь GPU — реалистичная точка входа. Раз NVFP4-чекпойнт Large 3 заявлен для одного узла 8×A100/8×H100, для многих компаний вопрос сводится не к кластеру, а к правильно собранному GPU-серверу.
Если вы планируете развернуть Ministral на одной карте или собрать узел под Large 3, подобрать конфигурацию под вашу задачу поможет каталог AI-серверов и серверного оборудования «СервакМастер», а с расчётом памяти, охлаждения и межсоединений можно обратиться к специалистам через страницу контактов.
Возможности моделей
Важно разделять то, что умеют сами модели (мультимодальность, многоязычность, длинный контекст), и то, что даёт окружающая экосистема: фреймворки, движки и серверы, которые уже внедрили поддержку Mistral 3.
Мультимодальность
Vision-версии уверенно работают с изображениями и документами. Они не заменяют узкоспециализированные CV-модели, но в задачах общего назначения достаточно гибки и надёжны. Основные сценарии:
- Скриншоты: интерфейсы, ошибки, панели настроек, структура страниц — модель понимает и текст, и визуальный контекст.
- Документы: распознавание структуры и логики блоков, извлечение ключевой информации.
- Фото: описание, классификация, поиск объектов, базовый визуальный анализ.
- PDF-страницы: чтение таблиц, заголовков, многоуровневых блоков, работа с реальными макетами.
- Карточки товара: извлечение характеристик, сравнение вариантов, анализ изображений для e-commerce.
Vision-компонент универсальный, а не специализированный. На сложных задачах он уступает отдельным CV-моделям по точности, зато выигрывает в гибкости, особенно когда картинка становится частью многошагового рассуждения.
Многоязычность
Одно из заметных преимуществ — уверенная работа более чем с 40 языками, а не только с английским и китайским, как у многих крупных моделей. Это удобно для международных проектов и локальных ассистентов. Русский язык поддерживается, и качество на нём стало заметно лучше, чем в ранних версиях. Но обещать идеальный результат было бы неверно: лучший способ оценки — проверить модель на примерах, близких к вашему сценарию. В одних случаях текст получается чистым и связным, в других потребуются дополнительная настройка или уточнения.
Контекст в 256K токенов
Такой объём меняет сам подход к построению решений: в модель можно загружать не фрагменты, а целые массивы информации, не прибегая к агрессивному дроблению. Где это даёт максимум пользы:
- RAG: большие фрагменты базы знаний анализируются целиком, ответы получаются точнее.
- Юридические документы: многостраничные договоры, приложения и пакеты нормативных актов обрабатываются как единое целое.
- Многостраничные спецификации: технические требования, стандарты и описания API можно загружать полностью.
- Агентные пайплайны: модель удерживает историю рассуждений, инструкции и промежуточные выводы на больших дистанциях.
- Длинные переписки: диалог не обрывается логически, модель помнит детали и корректно возвращается к старым темам.
Стоит помнить, что длинный контекст увеличивает размер KV-cache, поэтому при планировании видеопамяти нужен запас сверх цифр для весов.
Бенчмарки и LMArena
Выход Mistral 3 быстро отразился на публичных лидербордах, в частности на LMArena, где модели сравнивают в равных условиях по широкому набору задач. На момент анонса, 2 декабря 2025 года, представители семейства уверенно заняли верхние позиции среди открытых моделей (OSS). В сравнении участвовали также Qwen3-VL, DeepSeek-V3.2 и Kimi-K2.
Особенно заметен рост у Ministral 14B Instruct и Ministral 14B Reasoning, которые в некоторых тестах обгоняют более крупные модели других разработчиков. Флагман Mistral Large 3 вошёл в число лидеров OSS-сегмента и по ряду метрик приближается к закрытым системам уровня GPT-4.1 и Gemini Ultra. Абсолютного первого места у него нет, но разрыв между open-weight и закрытыми моделями стал минимальным за всю историю подобных сравнений.
Лидерборд LMArena динамический: позиции меняются буквально каждую неделю, модели дообучаются, появляются новые версии. Общий тренд при этом очевиден — релиз Mistral 3 перетасовал расклад сил, усилил открытую экосистему и закрепил присутствие Европы в верхнем сегменте мирового рынка ИИ.
Итоги
Mistral 3 — один из самых значимых релизов года для открытых моделей. Появление сильного open-weight решения, созданного не в США и не в Китае, делает глобальную гонку ИИ более сбалансированной. Для бизнеса и разработчиков это расширение выбора: компактные Ministral 3B, 8B и 14B запускаются на обычных видеокартах, а Mistral Large 3 с контекстом 256K и лицензией Apache 2.0 даёт корпоративный уровень на собственной инфраструктуре. Выбор между ними определяется в первую очередь доступной видеопамятью, поэтому начинать планирование стоит именно с неё.
