DeepSeekMath-V2: самопроверяемые рассуждения вместо угадывания ответов

Что случилось

DeepSeek выпустила модель, которая переосмысляет саму задачу «математического ИИ». DeepSeekMath-V2 с 685 миллиардами параметров не просто генерирует числовые ответы на задачи — она выстраивает пошаговые доказательства и контролирует их корректность через встроенный верификатор. Результат: золотые медали IMO 2025 и CMO 2024, а также 118 очков из 120 возможных на конкурсе Putnam 2024. В блоге СервакМастер подробно разбираем, как это устроено и почему это важно для серверной индустрии.


Архитектурный фундамент: DeepSeekV3.2-Exp-Base

Базой для новой модели послужила DeepSeekV3.2-Exp-Base — крупная архитектура с развитыми языковыми способностями. Поверх неё инженеры DeepSeek выстроили двухкомпонентную систему, в которой работа с математическими задачами разбита на два взаимосвязанных процесса:

  • Генератор доказательств — формирует цепочку шагов рассуждения, последовательно двигаясь от условия задачи к итоговому ответу.
  • Верификатор — оценивает каждый промежуточный шаг независимо от генератора и выносит суждение о его корректности.

Ключевая инновация в том, как эти два компонента учатся вместе. Верификатор служит моделью вознаграждения для генератора: хорошие шаги получают положительный сигнал, ошибочные — отрицательный. Генератор, в свою очередь, повышает точность шагов, которые верификатор оценивает высоко. Цикл повторяется: по мере сложности задач верификатор сам создаёт новые обучающие примеры, подталкивая систему к ещё более глубокому пониманию математических структур.

Это принципиально отличается от классических LLM, где модель «угадывает» конечный ответ без явного контроля промежуточных рассуждений.


Математические соревнования: три результата, которые говорят сами за себя

Проверка моделей на реальных олимпийских задачах — один из наиболее объективных способов оценить глубину математических способностей ИИ. DeepSeekMath-V2 участвовала в трёх крупнейших соревнованиях:

Соревнование Уровень Результат
IMO 2025 — Международная математическая олимпиада Мировой уровень Золотая медаль
CMO 2024 — Китайская математическая олимпиада Национальный топ Золотая медаль
Putnam 2024 — Американский межуниверситетский конкурс Университетский уровень 118 / 120 баллов

Результат на Putnam 2024 заслуживает отдельного внимания: подавляющее большинство студентов-участников набирают менее 20 баллов, а медиана среди финалистов редко превышает 60. Набрать 118/120 — это не просто «лучше чем ИИ прежде», это уровень, недоступный большинству людей с математическим образованием.


Конкурентное поле: кого обошла DeepSeekMath-V2

В прямых сравнительных тестах по математическим задачам DeepSeekMath-V2 превзошла все актуальные флагманские системы:

  • GPT-5 (OpenAI)
  • Claude Sonnet 4 (Anthropic)
  • Gemini 2.5 Pro (Google)
  • Grok 4 (xAI)
  • Qwen3-235b (Alibaba)

Показательно, что этот список включает модели компаний с крупнейшими исследовательскими бюджетами. Архитектурное решение DeepSeek — а не масштаб финансирования — обеспечило лидерство в нише математических рассуждений.


Инфраструктурный контекст: что нужно для работы с моделью такого масштаба

685 миллиардов параметров — это не просто большое число. Это требования к железу, которые выходят далеко за рамки типового GPU-сервера:

  • GPU-кластеры с поддержкой тензорного параллелизма — для распределённого инференса и обучения обоих компонентов системы одновременно.
  • Высокоскоростное NVMe-хранилище — для потоковой загрузки чекпоинтов и обучающих корпусов математических доказательств, объём которых исчисляется сотнями гигабайт.
  • Серверы с объёмом оперативной памяти от нескольких терабайт — для размещения весов модели в продакшн-окружении без деградации скорости обслуживания запросов.
  • Высокоскоростные межузловые интерконнекты (InfiniBand или аналоги) — для минимизации задержек при взаимодействии генератора и верификатора в мульти-GPU-конфигурациях.

Если ваша организация разворачивает инфраструктуру для работы с крупными языковыми моделями или обучения собственных ИИ-систем, СервакМастер поможет подобрать подходящую конфигурацию серверов под конкретный рабочий сценарий.


Итог

DeepSeekMath-V2 демонстрирует, что путь к по-настоящему надёжному математическому ИИ пролегает через самопроверяемые рассуждения, а не через простое масштабирование параметров. Связка генератор + верификатор с взаимным обучением позволяет системе замечать и исправлять собственные ошибки на этапе рассуждения — до того, как сформирован финальный ответ. Золото IMO 2025, золото CMO 2024 и 118/120 на Putnam — не случайный всплеск, а воспроизводимый результат, подтверждающий состоятельность подхода.

Следите за блогом СервакМастер: мы публикуем разборы ключевых событий в мире ИИ и серверных технологий, которые влияют на выбор и эксплуатацию вычислительного оборудования.