Curiosity-Driven Exploration: как механизм «любопытства» меняет обучение языковых моделей


Что стоит за этим методом

Трое исследователей — Руньпэн Дай, Линьфэн Сун и Хаолин Лю — предложили систему обучения с подкреплением под названием Curiosity-Driven Exploration. Её ключевая идея состоит в том, чтобы встроить в алгоритм обучения большой языковой модели (LLM) аналог человеческого любопытства: явное побуждение пробовать разные варианты ответа вместо того, чтобы закрепляться на одном привычном шаблоне.

Главная проблема, которую решает этот метод, — энтропийный коллапс. Это явление, при котором модель в ходе стандартного обучения с подкреплением постепенно сужает разнообразие генерируемых ответов и начинает воспроизводить одни и те же формулировки снова и снова. В итоге качество рассуждений деградирует, а вероятность галлюцинаций растёт.


Как работает двухканальный механизм исследования

Curiosity-Driven Exploration реализует «любопытство» через два независимых сигнала, которые вместе образуют исследовательский бонус:

  • Бонус агента — формируется на стороне генерации ответов. Он снижает чрезмерную уверенность модели при выводе токенов и стимулирует её пробовать разнообразные формулировки, не останавливаясь на первом же «удобном» варианте.
  • Бонус критика — формируется на стороне оценки результатов. Он направляет модель к эффективным стратегиям исследования обучающих данных и согласуется с лучшими практиками в области обучения с подкреплением.

Оба сигнала действуют одновременно: агент получает вознаграждение не только за правильный ответ, но и за достаточное разнообразие в процессе поиска этого ответа. Это принципиально отличает метод от классических схем, где вознаграждение завязано исключительно на итоговую корректность.


Техническая архитектура: MDP и multi-head критики

В основе метода лежат два ключевых компонента:

  1. Линейные марковские процессы принятия решений (MDP). Они формализуют задачу генерации текста как последовательность состояний и переходов. Это позволяет модели учитывать долгосрочные последствия каждого выбранного токена, а не только немедленный эффект от конкретного слова или фразы.

  2. Multi-head критики с бутстрэппингом. Система включает несколько параллельных оценщиков стоимости (value heads). Использование ансамбля оценщиков совместно с техникой бутстрэппинга позволяет вычислять исследовательский бонус значительно точнее, чем при наличии единственного критика. Каждый «голос» в ансамбле фиксирует немного разные аспекты качества генерации, что делает итоговую оценку более устойчивой к шуму.

Такая архитектура особенно ценна для задач многошагового вывода: модель оценивает не отдельное звено цепочки рассуждений, а всю её перспективу целиком.


Результаты на бенчмарке AIME

Метод был проверен на AIME (American Invitational Mathematics Examination) — одном из наиболее авторитетных тестов для оценки математического мышления моделей. Итоги эксперимента:

  • Производительность модели выросла примерно на три балла на сложных задачах математического рассуждения.
  • Бонус агента подтвердил свою эффективность: он статистически значимо снизил чрезмерную самоуверенность модели при генерации.
  • Бонус критика показал, что его применение соответствует передовым методам исследования данных и позволяет выявить оптимальные стратегии обучения.

Прирост в три балла на AIME звучит скромно, однако для задач этого уровня сложности — это существенный шаг вперёд, поскольку маржа для улучшения там крайне мала.


Калибровка уверенности и проблема галлюцинаций

Исследование поднимает вопрос, который давно волнует разработчиков ИИ-систем: почему стандартное обучение с подкреплением нарушает калибровку модели? Проще говоря — почему модель начинает «верить» в свои ответы сильнее, чем следует, и как это связано с галлюцинациями?

Авторы показывают прямую связь: энтропийный коллапс → однообразие ответов → модель выбирает «привычный» путь рассуждений, даже если он неверен → уверенные ошибки. Цепочка замкнута.

Один из перспективных инструментов для разрыва этой цепочки — бонус на основе перплексии (perplexity-based bonus). Он даёт модели явный стимул искать нестандартные, но корректные формулировки, что снижает вероятность галлюцинаций при работе с реальными запросами.


Применимость и масштабируемость

Несмотря на то что эксперименты проводились в области математики, метод имеет куда более широкий потенциал:

  • Программирование и отладка кода — задачи, где требуется перебор разных подходов к решению.
  • Логика и аналитические рассуждения — домены с высокой ценой ошибочной уверенности.
  • Научные вычисления — многошаговые задачи, где промежуточные ошибки накапливаются.
  • Диалоговые системы — снижение монотонности и шаблонности ответов.

С точки зрения масштабирования архитектура multi-head критиков хорошо адаптируется: добавление новых оценщиков позволяет увеличить точность бонуса без кардинальной перестройки всего пайплайна обучения. Это делает метод практичным не только для исследовательских экспериментов, но и для промышленных LLM.


Итог

Curiosity-Driven Exploration — это концептуально новый взгляд на обучение с подкреплением для языковых моделей. Вместо того чтобы просто наказывать за неправильные ответы, метод поощряет само исследование: он вознаграждает разнообразие, снижает чрезмерную самоуверенность и не даёт модели «застрять» в одном шаблоне рассуждений. Результаты на AIME подтверждают: подход работает.

Команда СервакМастер следит за развитием технологий искусственного интеллекта и помогает подобрать серверное оборудование для любых вычислительных задач — от инференса LLM до полноценного обучения нейронных сетей. Если вам нужна консультация по выбору серверов или GPU-ускорителей — свяжитесь с нами.


Автор: редакция СервакМастер