olmOCR 2: AllenAI переписывает правила оптического распознавания документов
23.10.2025 · ~ 2 мин
Команда AllenAI (AI2) выпустила olmOCR 2 — модель нового поколения для автоматического распознавания текста в документах. На собственном бенчмарке olmOCR-Bench новинка зафиксировала результат 82,4 балла, что на момент публикации является наивысшим показателем среди всех доступных открытых OCR-решений.
Архитектура и сравнение с конкурентами
В основе olmOCR 2 лежит мультимодальная языковая модель Qwen2.5-VL-7B. Именно эта база позволила системе не просто распознавать отдельные символы, а понимать структуру документа целиком — включая таблицы, формулы и многоколоночные макеты.
Сравнительная таблица по результатам olmOCR-Bench:
| Решение | Балл |
|---|---|
| olmOCR 2 | 82,4 |
| PaddleOCR-VL | 80,0 |
| Marker | 76,1 |
| DeepSeek-OCR | 75,7 |
| MinerU | 75,2 |
Отрыв от ближайшего конкурента — PaddleOCR-VL — составляет 2,4 балла, а от Marker и MinerU разрыв превышает 6–7 пунктов. Это существенное преимущество, учитывая, что все перечисленные системы являются зрелыми продуктами с многолетней историей.
Отдельный плюс olmOCR 2 — поддержка трёх форматов вывода без постобработки: Markdown, HTML и LaTeX. Это значит, что результат распознавания готов к немедленной интеграции в редакционные системы, научные репозитории и корпоративные порталы.
Датасет olmOCR-mix-1025: разнообразие как фундамент точности
Для обучения модели исследователи AI2 собрали специальный датасет olmOCR-mix-1025, включающий 270 тысяч страниц из самых разных источников:
- технические и научные публикации в формате PDF;
- юридические договоры и нормативные документы;
- архивные и исторические сканы;
- рукописные тексты различных эпох.
Такое разнообразие принципиально отличает olmOCR 2 от систем, обученных преимущественно на современных печатных текстах. Модель способна стабильно работать с нечёткими изображениями, нестандартными гарнитурами и документами с неравномерной плотностью текста.
GRPO: обучение с подкреплением на проверяемых результатах
Главная методологическая инновация olmOCR 2 — применение обучения с подкреплением (Reinforcement Learning) с функцией награды, основанной не на приблизительном сходстве строк, а на формально проверяемой корректности вывода.
Для этого AI2 разработал метод Group Relative Policy Optimization (GRPO). Система тестирует каждое распознавание по трём независимым критериям:
- Точность таблиц — сохранение строк, столбцов и вложенных ячеек;
- Математические обозначения — корректность формул, индексов, знаков операций;
- Порядок чтения — правильная последовательность блоков в многоколоночных документах.
Для обучения по этим критериям команда дополнительно создала синтетический датасет olmOCR-synthmix-1025 — 2186 PDF-документов и свыше 30 тысяч размеченных тестовых примеров. Стоимость инференса при этом составляет около 12 центов за страницу, что вполне конкурентоспособно для промышленного масштаба.
Где olmOCR 2 опережает традиционные OCR-системы
Наиболее заметные улучшения наблюдаются именно там, где классические движки исторически уязвимы:
- Математические формулы — модель корректно интерпретирует многоуровневые выражения с дробями, суммами и интегралами, не теряя структуру;
- Многоколоночные развороты — текст из газетных и журнальных макетов восстанавливается в правильном логическом порядке, а не вразнобой;
- Исторические рукописи — olmOCR 2 уверенно прочитала дату в оригинальном письме Авраама Линкольна от 10 января 1864 года, тогда как предыдущие версии давали ошибочный результат из-за неразборчивого почерка.
Последний случай показательно демонстрирует потенциал модели для оцифровки архивных фондов — задача, которая прежде требовала ручного участия экспертов.
Доступность: Hugging Face, DeepInfra и Parasail
AllenAI опубликовала веса olmOCR 2, код обучения и все материалы бенчмарка на платформе Hugging Face — модель можно развернуть локально или в корпоративном облаке. Параллельно olmOCR 2 доступна через готовые API на сервисах DeepInfra и Parasail, что позволяет подключить её к действующим пайплайнам без необходимости строить собственную инфраструктуру вывода.
Итог: OCR переходит в режим верифицируемого распознавания
olmOCR 2 знаменует смену парадигмы: оптическое распознавание символов перестаёт быть вероятностной задачей «насколько похоже» и превращается в воспроизводимый и проверяемый процесс с формальными критериями качества. Это открывает возможности для применения OCR в строгих корпоративных, государственных и научных системах, где недостаточно «приблизительного совпадения» — необходима подтверждённая точность.
В СервакМастер мы отслеживаем развитие ИИ-инструментов, которые напрямую влияют на требования к серверной инфраструктуре. Развёртывание и обслуживание моделей класса olmOCR 2 предъявляет конкретные требования к вычислительным мощностям. Если вам нужна консультация по подбору серверного оборудования для задач OCR или машинного обучения — обратитесь к нам, и мы поможем подобрать оптимальную конфигурацию.
