PaddleOCR-VL-1.6: точность распознавания текста достигла 96,33%
~ 2 мин
Что произошло
Команда PaddlePaddle выпустила PaddleOCR-VL-1.6 — новую версию своей мультиязычной OCR-нейросети с поддержкой русского и десятков других языков. Релиз примечателен прежде всего тремя рекордными результатами на публичных бенчмарках: OmniDocBench, OmniDocBench v1.5 и Real5-OmniDocBench. На основном из них — OmniDocBench — модель показала 96,33% точности, установив новый абсолютный максимум среди всех известных OCR-решений, как открытых, так и проприетарных.
Предыдущая версия PaddleOCR-VL-1.5 набирала на том же бенчмарке 95,52%. На первый взгляд разрыв в 0,81 процентного пункта выглядит незначительным, однако в терминах реального числа ошибок это означает сокращение примерно на 18% — что весьма ощутимо в задачах промышленной обработки документов.
Ключевые технологические решения
Архитектура PaddleOCR-VL-1.6 осталась идентичной версии 1.5, но работа над качеством велась по двум параллельным направлениям.
Регионально-ориентированная оптимизация данных. Разработчики проанализировали, в каких категориях контента предыдущая модель систематически ошибалась, и целенаправленно расширили обучающую выборку именно в этих областях. Такой подход позволяет добиваться максимального прироста точности без общего раздувания датасета.
Прогрессивное пост-обучение с элементами RL. После базового дообучения (fine-tuning) модель проходила несколько последовательных этапов на постепенно усложняющихся примерах. Финальная стадия использует обучение с подкреплением, которое дополнительно стабилизирует результат на нетипичных и труднораспознаваемых фрагментах текста.
Прирост по категориям контента
По сравнению с PaddleOCR-VL-1.5 наиболее заметное улучшение зафиксировано в следующих областях:
- Таблицы со сложной структурой — объединённые ячейки, многоуровневые заголовки, вложенные данные;
- Исторические и архивные документы — старопечатные шрифты, потёртые оригиналы, нетипичные начертания;
- Редкие иероглифы — специализированная лексика восточноазиатских языков, включая профессиональную терминологию;
- Рукописный текст — произвольный почерк, рукописные пометки и подписи;
- Печати и штампы — извлечение текста из круговых, прямоугольных и угловых печатей;
- Диаграммы и инфографика — подписи осей, легенды, текстовые элементы внутри графических объектов.
Совместимость и простота обновления
Архитектура осталась неизменной по сравнению с версией 1.5: интерфейс, команды и параметры API не менялись. Для перехода достаточно заменить файл весов модели — никакой доработки кода интеграции не требуется. Это позволяет обновить даже крупные производственные инсталляции в рамках планового обслуживания без остановки сервиса.
Модель поддерживает развёртывание через стандартную библиотеку transformers, что упрощает начало работы для новых пользователей. Веса, документация и примеры кода опубликованы на Hugging Face.
Где это применяется
Высокая точность PaddleOCR-VL-1.6 делает её актуальной для организаций, которые обрабатывают большие объёмы документов:
- Финансовый сектор — автоматический разбор договоров, банковских выписок, страховых полисов со сложными таблицами;
- Логистика и таможня — обработка накладных, деклараций, актов, где важна точность данных о грузах и суммах;
- Юридические службы — оцифровка архивных документов, нотариальных записей, исторических актов;
- Медицина — извлечение структурированных данных из карт, направлений, протоколов;
- Государственный документооборот — перевод бумажных архивов в цифровой формат с минимальными ошибками.
Чем точнее распознавание, тем меньше документов требуют ручной проверки — а значит, снижается себестоимость обработки и растёт пропускная способность всей системы.
Итог
PaddleOCR-VL-1.6 демонстрирует, что грамотная работа с обучающими данными и точечное дообучение слабых мест способны дать больший практический эффект, чем усложнение архитектуры. Рост с 95,52% до 96,33% — это не косметическое обновление, а реальное сокращение числа ошибок почти на пятую часть.
Полная обратная совместимость с версией 1.5 снимает барьер внедрения даже для крупных инсталляций, а новый рекорд SOTA подтверждает, что PaddleOCR остаётся одной из ведущих платформ интеллектуальной обработки документов в open-source экосистеме.
Если вы планируете развернуть AI-сервисы распознавания документов и ищете подходящее серверное оборудование — обращайтесь в СервакМастер: поможем подобрать оптимальную конфигурацию под требования вашей задачи.
