DeepSeekMath-V2: самопроверяемые рассуждения вместо угадывания ответов
Что случилось
DeepSeek выпустила модель, которая переосмысляет саму задачу «математического ИИ». DeepSeekMath-V2 с 685 миллиардами параметров не просто генерирует числовые ответы на задачи — она выстраивает пошаговые доказательства и контролирует их корректность через встроенный верификатор. Результат: золотые медали IMO 2025 и CMO 2024, а также 118 очков из 120 возможных на конкурсе Putnam 2024. В блоге СервакМастер подробно разбираем, как это устроено и почему это важно для серверной индустрии.
Архитектурный фундамент: DeepSeekV3.2-Exp-Base
Базой для новой модели послужила DeepSeekV3.2-Exp-Base — крупная архитектура с развитыми языковыми способностями. Поверх неё инженеры DeepSeek выстроили двухкомпонентную систему, в которой работа с математическими задачами разбита на два взаимосвязанных процесса:
- Генератор доказательств — формирует цепочку шагов рассуждения, последовательно двигаясь от условия задачи к итоговому ответу.
- Верификатор — оценивает каждый промежуточный шаг независимо от генератора и выносит суждение о его корректности.
Ключевая инновация в том, как эти два компонента учатся вместе. Верификатор служит моделью вознаграждения для генератора: хорошие шаги получают положительный сигнал, ошибочные — отрицательный. Генератор, в свою очередь, повышает точность шагов, которые верификатор оценивает высоко. Цикл повторяется: по мере сложности задач верификатор сам создаёт новые обучающие примеры, подталкивая систему к ещё более глубокому пониманию математических структур.
Это принципиально отличается от классических LLM, где модель «угадывает» конечный ответ без явного контроля промежуточных рассуждений.
Математические соревнования: три результата, которые говорят сами за себя
Проверка моделей на реальных олимпийских задачах — один из наиболее объективных способов оценить глубину математических способностей ИИ. DeepSeekMath-V2 участвовала в трёх крупнейших соревнованиях:
| Соревнование | Уровень | Результат |
|---|---|---|
| IMO 2025 — Международная математическая олимпиада | Мировой уровень | Золотая медаль |
| CMO 2024 — Китайская математическая олимпиада | Национальный топ | Золотая медаль |
| Putnam 2024 — Американский межуниверситетский конкурс | Университетский уровень | 118 / 120 баллов |
Результат на Putnam 2024 заслуживает отдельного внимания: подавляющее большинство студентов-участников набирают менее 20 баллов, а медиана среди финалистов редко превышает 60. Набрать 118/120 — это не просто «лучше чем ИИ прежде», это уровень, недоступный большинству людей с математическим образованием.
Конкурентное поле: кого обошла DeepSeekMath-V2
В прямых сравнительных тестах по математическим задачам DeepSeekMath-V2 превзошла все актуальные флагманские системы:
- GPT-5 (OpenAI)
- Claude Sonnet 4 (Anthropic)
- Gemini 2.5 Pro (Google)
- Grok 4 (xAI)
- Qwen3-235b (Alibaba)
Показательно, что этот список включает модели компаний с крупнейшими исследовательскими бюджетами. Архитектурное решение DeepSeek — а не масштаб финансирования — обеспечило лидерство в нише математических рассуждений.
Инфраструктурный контекст: что нужно для работы с моделью такого масштаба
685 миллиардов параметров — это не просто большое число. Это требования к железу, которые выходят далеко за рамки типового GPU-сервера:
- GPU-кластеры с поддержкой тензорного параллелизма — для распределённого инференса и обучения обоих компонентов системы одновременно.
- Высокоскоростное NVMe-хранилище — для потоковой загрузки чекпоинтов и обучающих корпусов математических доказательств, объём которых исчисляется сотнями гигабайт.
- Серверы с объёмом оперативной памяти от нескольких терабайт — для размещения весов модели в продакшн-окружении без деградации скорости обслуживания запросов.
- Высокоскоростные межузловые интерконнекты (InfiniBand или аналоги) — для минимизации задержек при взаимодействии генератора и верификатора в мульти-GPU-конфигурациях.
Если ваша организация разворачивает инфраструктуру для работы с крупными языковыми моделями или обучения собственных ИИ-систем, СервакМастер поможет подобрать подходящую конфигурацию серверов под конкретный рабочий сценарий.
Итог
DeepSeekMath-V2 демонстрирует, что путь к по-настоящему надёжному математическому ИИ пролегает через самопроверяемые рассуждения, а не через простое масштабирование параметров. Связка генератор + верификатор с взаимным обучением позволяет системе замечать и исправлять собственные ошибки на этапе рассуждения — до того, как сформирован финальный ответ. Золото IMO 2025, золото CMO 2024 и 118/120 на Putnam — не случайный всплеск, а воспроизводимый результат, подтверждающий состоятельность подхода.
Следите за блогом СервакМастер: мы публикуем разборы ключевых событий в мире ИИ и серверных технологий, которые влияют на выбор и эксплуатацию вычислительного оборудования.
