Что сделали иначе

Обычная языковая модель, решая математическую задачу, по сути угадывает правдоподобный ответ. Она видела много решений и генерирует то, что статистически похоже на правильное. Промежуточные шаги при этом никто не проверяет — и модель может выдать верный ответ с неверным рассуждением или наоборот.

DeepSeekMath-V2 устроена принципиально иначе. В ней два компонента:

  • Генератор доказательств строит цепочку шагов от условия к ответу;
  • Верификатор независимо оценивает каждый промежуточный шаг на корректность.

Ключевое — как они обучались. Верификатор служит источником сигнала для генератора: корректные шаги поощряются, ошибочные — нет. Генератор учится делать шаги, которые верификатор признаёт верными. По мере усложнения задач верификатор порождает новые обучающие примеры, и цикл повторяется.

Это переносит акцент с угадывания результата на построение проверяемого рассуждения.

Результаты

Модель содержит 685 миллиардов параметров и построена на базе крупной языковой архитектуры того же разработчика.

Соревнование Уровень Результат
IMO 2025 Международная олимпиада школьников Золотая медаль
CMO 2024 Национальная олимпиада Китая Золотая медаль
Putnam 2024 Студенческий конкурс, США 118 из 120

Последняя строка требует пояснения, иначе цифра не читается. Putnam — конкурс, где подавляющее большинство участников (а участвуют сильные студенты математических специальностей) набирает менее 20 баллов из 120. Медиана среди финалистов редко превышает 60.

118 из 120 — это результат за пределами того, что показывают почти все люди с математическим образованием.

В прямых сравнениях на математических задачах модель обошла флагманские системы других разработчиков — включая компании с несопоставимо большими исследовательскими бюджетами. Показательно, что решающим оказался архитектурный подход, а не объём финансирования.

Почему самопроверка важнее размера

Здесь стоит остановиться, потому что это главный вывод, выходящий за рамки одной модели.

Основная претензия к языковым моделям в задачах, требующих строгости, — они уверенно выдают неверный результат. В математике это особенно заметно: ответ либо верен, либо нет, промежуточных состояний не бывает.

Наращивание числа параметров эту проблему не решает — более крупная модель просто ошибается реже, но так же уверенно. Встроенная проверка меняет саму механику: система способна заметить ошибку на этапе рассуждения, до того как сформирован окончательный ответ.

Подход применим далеко за пределами математики. Везде, где результат можно формально проверить — код, логические выводы, работа с формальными системами, — связка «генератор плюс верификатор» выглядит перспективнее простого масштабирования.

Что нужно для развёртывания

685 миллиардов параметров — это не абстрактная цифра, а вполне конкретные требования:

Кластер ускорителей. Одной картой здесь не обойтись: модель распределяется между несколькими ускорителями с высокой пропускной способностью между ними.

Быстрое хранилище. Загрузка контрольных точек модели, объём которых измеряется сотнями гигабайт, требует накопителей NVMe — на обычных дисках это займёт неприемлемое время.

Оперативная память от нескольких терабайт для промышленной эксплуатации без деградации скорости обслуживания.

Быстрая межузловая связь. Генератор и верификатор взаимодействуют постоянно, и задержки между узлами напрямую влияют на скорость работы. Здесь нужны специализированные интерконнекты, а не обычная сеть.

Практический вывод для планирования: это инфраструктура уровня вычислительного кластера, а не сервера. Организациям, которым нужны математические возможности эпизодически, доступ через API окажется дешевле на порядки.

Кому это действительно нужно

Исследовательским группам в областях, где требуется формальная строгость: доказательства, верификация, символьные вычисления.

Разработчикам инструментов — как основа для специализированных систем в образовании и инженерных расчётах.

Организациям с требованиями к данным, для которых передача задач во внешний сервис исключена.

Всем остальным собственное развёртывание не окупится: стоимость кластера несопоставима с оплатой обращений по мере необходимости.

Коротко

DeepSeekMath-V2 интересна не размером, а архитектурой: встроенный верификатор проверяет каждый шаг рассуждения, а не только итоговый ответ.

Результаты подтверждают состоятельность подхода — золото международной олимпиады и 118 из 120 на студенческом конкурсе, где большинство участников набирает менее 20.

Главный вывод шире одной модели: там, где результат поддаётся формальной проверке, связка генератора с верификатором даёт больше, чем наращивание параметров.

Для развёртывания нужен вычислительный кластер, а не сервер. При эпизодическом использовании доступ через API несопоставимо дешевле.

Планируете инфраструктуру под крупные модели — опишите задачу и ожидаемую нагрузку, рассчитаем требования.