olmOCR 2: AllenAI переписывает правила оптического распознавания документов

23.10.2025 · ~ 2 мин

Команда AllenAI (AI2) выпустила olmOCR 2 — модель нового поколения для автоматического распознавания текста в документах. На собственном бенчмарке olmOCR-Bench новинка зафиксировала результат 82,4 балла, что на момент публикации является наивысшим показателем среди всех доступных открытых OCR-решений.


Архитектура и сравнение с конкурентами

В основе olmOCR 2 лежит мультимодальная языковая модель Qwen2.5-VL-7B. Именно эта база позволила системе не просто распознавать отдельные символы, а понимать структуру документа целиком — включая таблицы, формулы и многоколоночные макеты.

Сравнительная таблица по результатам olmOCR-Bench:

Решение Балл
olmOCR 2 82,4
PaddleOCR-VL 80,0
Marker 76,1
DeepSeek-OCR 75,7
MinerU 75,2

Отрыв от ближайшего конкурента — PaddleOCR-VL — составляет 2,4 балла, а от Marker и MinerU разрыв превышает 6–7 пунктов. Это существенное преимущество, учитывая, что все перечисленные системы являются зрелыми продуктами с многолетней историей.

Отдельный плюс olmOCR 2 — поддержка трёх форматов вывода без постобработки: Markdown, HTML и LaTeX. Это значит, что результат распознавания готов к немедленной интеграции в редакционные системы, научные репозитории и корпоративные порталы.


Датасет olmOCR-mix-1025: разнообразие как фундамент точности

Для обучения модели исследователи AI2 собрали специальный датасет olmOCR-mix-1025, включающий 270 тысяч страниц из самых разных источников:

  • технические и научные публикации в формате PDF;
  • юридические договоры и нормативные документы;
  • архивные и исторические сканы;
  • рукописные тексты различных эпох.

Такое разнообразие принципиально отличает olmOCR 2 от систем, обученных преимущественно на современных печатных текстах. Модель способна стабильно работать с нечёткими изображениями, нестандартными гарнитурами и документами с неравномерной плотностью текста.


GRPO: обучение с подкреплением на проверяемых результатах

Главная методологическая инновация olmOCR 2 — применение обучения с подкреплением (Reinforcement Learning) с функцией награды, основанной не на приблизительном сходстве строк, а на формально проверяемой корректности вывода.

Для этого AI2 разработал метод Group Relative Policy Optimization (GRPO). Система тестирует каждое распознавание по трём независимым критериям:

  1. Точность таблиц — сохранение строк, столбцов и вложенных ячеек;
  2. Математические обозначения — корректность формул, индексов, знаков операций;
  3. Порядок чтения — правильная последовательность блоков в многоколоночных документах.

Для обучения по этим критериям команда дополнительно создала синтетический датасет olmOCR-synthmix-10252186 PDF-документов и свыше 30 тысяч размеченных тестовых примеров. Стоимость инференса при этом составляет около 12 центов за страницу, что вполне конкурентоспособно для промышленного масштаба.


Где olmOCR 2 опережает традиционные OCR-системы

Наиболее заметные улучшения наблюдаются именно там, где классические движки исторически уязвимы:

  • Математические формулы — модель корректно интерпретирует многоуровневые выражения с дробями, суммами и интегралами, не теряя структуру;
  • Многоколоночные разворо​ты — текст из газетных и журнальных макетов восстанавливается в правильном логическом порядке, а не вразнобой;
  • Исторические рукописи — olmOCR 2 уверенно прочитала дату в оригинальном письме Авраама Линкольна от 10 января 1864 года, тогда как предыдущие версии давали ошибочный результат из-за неразборчивого почерка.

Последний случай показательно демонстрирует потенциал модели для оцифровки архивных фондов — задача, которая прежде требовала ручного участия экспертов.


Доступность: Hugging Face, DeepInfra и Parasail

AllenAI опубликовала веса olmOCR 2, код обучения и все материалы бенчмарка на платформе Hugging Face — модель можно развернуть локально или в корпоративном облаке. Параллельно olmOCR 2 доступна через готовые API на сервисах DeepInfra и Parasail, что позволяет подключить её к действующим пайплайнам без необходимости строить собственную инфраструктуру вывода.


Итог: OCR переходит в режим верифицируемого распознавания

olmOCR 2 знаменует смену парадигмы: оптическое распознавание символов перестаёт быть вероятностной задачей «насколько похоже» и превращается в воспроизводимый и проверяемый процесс с формальными критериями качества. Это открывает возможности для применения OCR в строгих корпоративных, государственных и научных системах, где недостаточно «приблизительного совпадения» — необходима подтверждённая точность.

В СервакМастер мы отслеживаем развитие ИИ-инструментов, которые напрямую влияют на требования к серверной инфраструктуре. Развёртывание и обслуживание моделей класса olmOCR 2 предъявляет конкретные требования к вычислительным мощностям. Если вам нужна консультация по подбору серверного оборудования для задач OCR или машинного обучения — обратитесь к нам, и мы поможем подобрать оптимальную конфигурацию.