За два года рынок наполнился десятками открытых OCR-нейросетей, и каждая по заявлениям авторов показывает феноменальные результаты. На Hugging Face глаза разбегаются, а выбор модели растягивается на недели. Мы в «СервакМастер» прогнали шесть самых заметных вариантов через одинаковый набор документов, чтобы понять, какие из них действительно стоят затраченных вычислительных ресурсов, а какие нет.

Что такое OCR-нейросети и зачем они бизнесу

OCR (Optical Character Recognition) — это модели, которые превращают изображения с текстом (сканы, фотографии, PDF, рукописные материалы) в редактируемый текст, по которому можно искать. Это не классические языковые модели, а мультимодальный гибрид из специально обученных архитектур (CNN + RNN/Transformer). Каждый слой такого пайплайна отвечает за свою задачу: предобработку, детекцию текста, распознавание символов и постобработку.

Ценность OCR в том, что ручной перенос текста из документов отнимает часы, а иногда и дни. Нейросеть сокращает время на извлечение, сверку и разметку в десятки раз. Поэтому OCR прижились в корпоративных контурах:

  • бухгалтерский учёт и работа с накладными;
  • ведение и оцифровка архивов;
  • аналитика и векторный поиск по извлечённым данным;
  • наполнение баз данных для RAG-систем.

Участники теста

Мы отобрали шесть моделей, которые не раз оказывались в лидерах профильных бенчмарков, и разделили их на две весовые категории.

Группа Модель Параметров
До 1.5 млрд PaddleOCR-VLM 1.5 1.5b
До 1.5 млрд MinerU 2.5 Pro 1.2b
До 1.5 млрд GLM-OCR 0.9b
До 7 млрд Chandra OCR2 5b
До 7 млрд OlmoOCR2 7b
Универсальная VLM Qwen3.6 35B-A3B 35b (MoE, 3b активных)

Qwen3.6 35B-A3B добавили из практических соображений: это не классический OCR, а мультимодальная языковая модель, но распознавать текст на изображениях она умеет.

Как мы оценивали результат

Одного взгляда на выдачу недостаточно, поэтому качество считали по двум метрикам.

  1. Text Accuracy на основе CER — сравнение распознанного текста с эталоном. Чем выше значение, тем ближе результат к оригиналу.
  2. Unit Test Pass Rate — проверка того, найдены ли 8 ключевых элементов: суммы, формулы, имена, названия, смысловые блоки. Чем больше элементов распознано, тем выше балл.

Тестовый набор состоял из шести изображений:

  • страница с текстом, заголовками и форматированием — проверка распознавания обычного текста;
  • страница с текстом, цифрами и большой таблицей накладной — текст, таблицы и числа;
  • страница с текстом и математическими формулами;
  • скан бухгалтерского накладного отчёта;
  • две страницы рукописного текста на русском языке;
  • рукописное задание ЕГЭ по математике — самая тяжёлая задача для OCR.

Помимо точности смотрели на сохранение структуры страницы и на то, насколько результат удобен для дальнейшей обработки.

Результаты по моделям

MinerU 2.5 Pro 1.2b

Главная фишка MinerU — функция bound-and-box: нейросеть делит страницу на блоки и определяет тип каждого (текст, заголовок, формула, таблица, диаграмма). Это сильно упрощает проверку результата. Модель хорошо сохраняет разметку, форматирование и порядок строк и слов. По метрикам она не всегда занимала верхние места, но работа со структурой страницы — её козырь. На обычных сканах MinerU уверенна, а вот на русском рукописном тексте качество резко падает.

PaddleOCR-VLM 1.5 1.5b

Китайская модель справляется со стандартными документами неплохо, но точность немного ниже, чем у MinerU. Она изредка пропускала ячейки таблиц, отдельные строки, формулы и слова, что некритично. На простых страницах всё в порядке, а вот на таблицах, формулах и рукописи производительность заметно проседает. Возможная причина — изначальная ориентация на китайский синтаксис и компактный размер. Но авторы позиционируют модель как универсальную, так что оправданием это служить не может.

GLM-OCR 0.9b

Самая лёгкая и компактная модель в списке. На первый взгляд она не уступает MinerU, но в сложных сценариях (формулы, русская рукопись) структура документа и порядок слов могут ломаться. Простые документы она щёлкает как орешки, однако на рукописях и сложных страницах эффективность снижается, особенно по ключевым элементам. Для модели менее чем на миллиард параметров результат всё же достойный.

Chandra OCR2 5b

От модели среднего размера ожидания выше, и она их оправдала: заметно лучше определяет текст, строит bound-and-box и структурирует документы. По метрикам держится выше компактных конкурентов, но безусловным лидером не стала. На русской рукописи проблемы остались, и не все ключевые элементы удавалось найти во всех сценариях.

OlmoOCR2 7b

Самая крупная из специализированных OCR-моделей. Функции bound-and-box у неё пока нет, поэтому оценивали только итоговую разметку и метрики. Оцифровки получаются визуально аккуратными, со структурой, практически идентичной оригиналу, а ошибок в тексте, цифрах и таблицах минимум. Даже без bound-and-box именно OlmoOCR2 7b стала фаворитом.

Qwen3.6 35B-A3B

Универсальная языковая модель с мультимодальным функционалом. Классического OCR-пайплайна с bound-and-box у неё нет, но LLM-ядро лучше понимает контекст, а мощный мультимодальный движок бережно сохраняет структуру. По метрикам Qwen3.6 35B-A3B местами сильнее специализированных конкурентов, особенно на формулах, таблицах и рукописи. Цена — размер: 35 миллиардов параметров, и несмотря на MoE-архитектуру с 3 миллиардами активных параметров, видеопамяти для развёртывания нужно заметно больше, чем для компактных OCR.

Итоговое сравнение

Первое место заняла OlmoOCR2 7b: лучшие показатели по разметке, метрикам и точности текста, цифр и прочих элементов. На втором месте Qwen3.6 35B-A3B — благодаря числу параметров, мультимодальному движку и пониманию контекста. MinerU 2.5 Pro 1.2b совсем немного обошла Chandra OCR2 5b, по эффективности и сохранению структуры они идут практически вровень. Замыкают список GLM-OCR 0.9b и PaddleOCR-VLM 1.5 1.5b.

Теперь по тестам отдельно:

  • Простой документ. Все модели справились уверенно: сложных символов и структурных элементов там нет.
  • Таблица. Результаты неоднозначны. Маленькие модели теряют производительность, крупные удерживают структуру, столбцы и важные примечания. Qwen3.6 35B-A3B здесь сильно просела, а лучшее качество дали OlmoOCR2 7b и MinerU 2.5 Pro 1.2b.
  • Формулы. Многие модели резко потеряли в качестве. Увереннее остальных выглядят Qwen3.6 35B-A3B и MinerU 2.5 Pro 1.2b.
  • Русская рукопись. Просели почти все. Небольшую эффективность сохранила только OlmoOCR2 7b, но по-настоящему хорошего результата не дала ни маленькая, ни большая модель.
  • Рукописный ЕГЭ. Здесь важна оговорка: Text Accuracy у большинства моделей выглядит прилично, но это обманчиво. Метрика считается посимвольно, и если модель угадала часть букв или пробелов, балл будет высоким, даже когда текст мало похож на оригинал. Реалистичнее Unit Test Pass Rate, который показал, что многие нейросети потеряли ключевые элементы. В лидерах снова OlmoOCR2 7b и Qwen3.6 35B-A3B.

Практические выводы

Главная слабость всех OCR — рукописный текст. Для оцифровки экзаменов, докладов, отчётов или рапортов без ручного ввода и проверки пока не обойтись. Если же ваши задачи — машинописные тексты без сложных элементов, выбор модели можно не усложнять: с этим справляются все участники теста. Если же в документах есть нестандартное форматирование, таблицы, числа, названия и имена, лучше остановиться на более крупных моделях.

Какое железо нужно для локального OCR

Выбор модели напрямую определяет требования к серверу:

  • компактные GLM-OCR, MinerU и PaddleOCR (0.9–1.5b) подойдут для небольших нагрузок и недорогих конфигураций с одной видеокартой;
  • Chandra OCR2 5b и OlmoOCR2 7b требуют больше видеопамяти, зато дают лучшее качество на сложных документах;
  • Qwen3.6 35B-A3B нужна конфигурация с заметным запасом по видеопамяти, даже с учётом 3 миллиардов активных параметров.

Если вы планируете развернуть OCR внутри компании для бухгалтерии, архива или RAG-системы, посмотрите решения в разделах серверы и серверы для ИИ. Специалисты «СервакМастер» помогут подобрать конфигурацию под вашу модель и объём документов — напишите нам через страницу контактов.