Что сделали иначе
Обычная языковая модель, решая математическую задачу, по сути угадывает правдоподобный ответ. Она видела много решений и генерирует то, что статистически похоже на правильное. Промежуточные шаги при этом никто не проверяет — и модель может выдать верный ответ с неверным рассуждением или наоборот.
DeepSeekMath-V2 устроена принципиально иначе. В ней два компонента:
- Генератор доказательств строит цепочку шагов от условия к ответу;
- Верификатор независимо оценивает каждый промежуточный шаг на корректность.
Ключевое — как они обучались. Верификатор служит источником сигнала для генератора: корректные шаги поощряются, ошибочные — нет. Генератор учится делать шаги, которые верификатор признаёт верными. По мере усложнения задач верификатор порождает новые обучающие примеры, и цикл повторяется.
Это переносит акцент с угадывания результата на построение проверяемого рассуждения.
Результаты
Модель содержит 685 миллиардов параметров и построена на базе крупной языковой архитектуры того же разработчика.
| Соревнование | Уровень | Результат |
|---|---|---|
| IMO 2025 | Международная олимпиада школьников | Золотая медаль |
| CMO 2024 | Национальная олимпиада Китая | Золотая медаль |
| Putnam 2024 | Студенческий конкурс, США | 118 из 120 |
Последняя строка требует пояснения, иначе цифра не читается. Putnam — конкурс, где подавляющее большинство участников (а участвуют сильные студенты математических специальностей) набирает менее 20 баллов из 120. Медиана среди финалистов редко превышает 60.
118 из 120 — это результат за пределами того, что показывают почти все люди с математическим образованием.
В прямых сравнениях на математических задачах модель обошла флагманские системы других разработчиков — включая компании с несопоставимо большими исследовательскими бюджетами. Показательно, что решающим оказался архитектурный подход, а не объём финансирования.
Почему самопроверка важнее размера
Здесь стоит остановиться, потому что это главный вывод, выходящий за рамки одной модели.
Основная претензия к языковым моделям в задачах, требующих строгости, — они уверенно выдают неверный результат. В математике это особенно заметно: ответ либо верен, либо нет, промежуточных состояний не бывает.
Наращивание числа параметров эту проблему не решает — более крупная модель просто ошибается реже, но так же уверенно. Встроенная проверка меняет саму механику: система способна заметить ошибку на этапе рассуждения, до того как сформирован окончательный ответ.
Подход применим далеко за пределами математики. Везде, где результат можно формально проверить — код, логические выводы, работа с формальными системами, — связка «генератор плюс верификатор» выглядит перспективнее простого масштабирования.
Что нужно для развёртывания
685 миллиардов параметров — это не абстрактная цифра, а вполне конкретные требования:
Кластер ускорителей. Одной картой здесь не обойтись: модель распределяется между несколькими ускорителями с высокой пропускной способностью между ними.
Быстрое хранилище. Загрузка контрольных точек модели, объём которых измеряется сотнями гигабайт, требует накопителей NVMe — на обычных дисках это займёт неприемлемое время.
Оперативная память от нескольких терабайт для промышленной эксплуатации без деградации скорости обслуживания.
Быстрая межузловая связь. Генератор и верификатор взаимодействуют постоянно, и задержки между узлами напрямую влияют на скорость работы. Здесь нужны специализированные интерконнекты, а не обычная сеть.
Практический вывод для планирования: это инфраструктура уровня вычислительного кластера, а не сервера. Организациям, которым нужны математические возможности эпизодически, доступ через API окажется дешевле на порядки.
Кому это действительно нужно
Исследовательским группам в областях, где требуется формальная строгость: доказательства, верификация, символьные вычисления.
Разработчикам инструментов — как основа для специализированных систем в образовании и инженерных расчётах.
Организациям с требованиями к данным, для которых передача задач во внешний сервис исключена.
Всем остальным собственное развёртывание не окупится: стоимость кластера несопоставима с оплатой обращений по мере необходимости.
Коротко
DeepSeekMath-V2 интересна не размером, а архитектурой: встроенный верификатор проверяет каждый шаг рассуждения, а не только итоговый ответ.
Результаты подтверждают состоятельность подхода — золото международной олимпиады и 118 из 120 на студенческом конкурсе, где большинство участников набирает менее 20.
Главный вывод шире одной модели: там, где результат поддаётся формальной проверке, связка генератора с верификатором даёт больше, чем наращивание параметров.
Для развёртывания нужен вычислительный кластер, а не сервер. При эпизодическом использовании доступ через API несопоставимо дешевле.
Планируете инфраструктуру под крупные модели — опишите задачу и ожидаемую нагрузку, рассчитаем требования.
