PaddleOCR-VL-1.6: точность распознавания текста достигла 96,33%

~ 2 мин


Что произошло

Команда PaddlePaddle выпустила PaddleOCR-VL-1.6 — новую версию своей мультиязычной OCR-нейросети с поддержкой русского и десятков других языков. Релиз примечателен прежде всего тремя рекордными результатами на публичных бенчмарках: OmniDocBench, OmniDocBench v1.5 и Real5-OmniDocBench. На основном из них — OmniDocBench — модель показала 96,33% точности, установив новый абсолютный максимум среди всех известных OCR-решений, как открытых, так и проприетарных.

Предыдущая версия PaddleOCR-VL-1.5 набирала на том же бенчмарке 95,52%. На первый взгляд разрыв в 0,81 процентного пункта выглядит незначительным, однако в терминах реального числа ошибок это означает сокращение примерно на 18% — что весьма ощутимо в задачах промышленной обработки документов.


Ключевые технологические решения

Архитектура PaddleOCR-VL-1.6 осталась идентичной версии 1.5, но работа над качеством велась по двум параллельным направлениям.

Регионально-ориентированная оптимизация данных. Разработчики проанализировали, в каких категориях контента предыдущая модель систематически ошибалась, и целенаправленно расширили обучающую выборку именно в этих областях. Такой подход позволяет добиваться максимального прироста точности без общего раздувания датасета.

Прогрессивное пост-обучение с элементами RL. После базового дообучения (fine-tuning) модель проходила несколько последовательных этапов на постепенно усложняющихся примерах. Финальная стадия использует обучение с подкреплением, которое дополнительно стабилизирует результат на нетипичных и труднораспознаваемых фрагментах текста.


Прирост по категориям контента

По сравнению с PaddleOCR-VL-1.5 наиболее заметное улучшение зафиксировано в следующих областях:

  • Таблицы со сложной структурой — объединённые ячейки, многоуровневые заголовки, вложенные данные;
  • Исторические и архивные документы — старопечатные шрифты, потёртые оригиналы, нетипичные начертания;
  • Редкие иероглифы — специализированная лексика восточноазиатских языков, включая профессиональную терминологию;
  • Рукописный текст — произвольный почерк, рукописные пометки и подписи;
  • Печати и штампы — извлечение текста из круговых, прямоугольных и угловых печатей;
  • Диаграммы и инфографика — подписи осей, легенды, текстовые элементы внутри графических объектов.

Совместимость и простота обновления

Архитектура осталась неизменной по сравнению с версией 1.5: интерфейс, команды и параметры API не менялись. Для перехода достаточно заменить файл весов модели — никакой доработки кода интеграции не требуется. Это позволяет обновить даже крупные производственные инсталляции в рамках планового обслуживания без остановки сервиса.

Модель поддерживает развёртывание через стандартную библиотеку transformers, что упрощает начало работы для новых пользователей. Веса, документация и примеры кода опубликованы на Hugging Face.


Где это применяется

Высокая точность PaddleOCR-VL-1.6 делает её актуальной для организаций, которые обрабатывают большие объёмы документов:

  • Финансовый сектор — автоматический разбор договоров, банковских выписок, страховых полисов со сложными таблицами;
  • Логистика и таможня — обработка накладных, деклараций, актов, где важна точность данных о грузах и суммах;
  • Юридические службы — оцифровка архивных документов, нотариальных записей, исторических актов;
  • Медицина — извлечение структурированных данных из карт, направлений, протоколов;
  • Государственный документооборот — перевод бумажных архивов в цифровой формат с минимальными ошибками.

Чем точнее распознавание, тем меньше документов требуют ручной проверки — а значит, снижается себестоимость обработки и растёт пропускная способность всей системы.


Итог

PaddleOCR-VL-1.6 демонстрирует, что грамотная работа с обучающими данными и точечное дообучение слабых мест способны дать больший практический эффект, чем усложнение архитектуры. Рост с 95,52% до 96,33% — это не косметическое обновление, а реальное сокращение числа ошибок почти на пятую часть.

Полная обратная совместимость с версией 1.5 снимает барьер внедрения даже для крупных инсталляций, а новый рекорд SOTA подтверждает, что PaddleOCR остаётся одной из ведущих платформ интеллектуальной обработки документов в open-source экосистеме.

Если вы планируете развернуть AI-сервисы распознавания документов и ищете подходящее серверное оборудование — обращайтесь в СервакМастер: поможем подобрать оптимальную конфигурацию под требования вашей задачи.