За два года рынок наполнился десятками открытых OCR-нейросетей, и каждая по заявлениям авторов показывает феноменальные результаты. На Hugging Face глаза разбегаются, а выбор модели растягивается на недели. Мы в «СервакМастер» прогнали шесть самых заметных вариантов через одинаковый набор документов, чтобы понять, какие из них действительно стоят затраченных вычислительных ресурсов, а какие нет.
Что такое OCR-нейросети и зачем они бизнесу
OCR (Optical Character Recognition) — это модели, которые превращают изображения с текстом (сканы, фотографии, PDF, рукописные материалы) в редактируемый текст, по которому можно искать. Это не классические языковые модели, а мультимодальный гибрид из специально обученных архитектур (CNN + RNN/Transformer). Каждый слой такого пайплайна отвечает за свою задачу: предобработку, детекцию текста, распознавание символов и постобработку.
Ценность OCR в том, что ручной перенос текста из документов отнимает часы, а иногда и дни. Нейросеть сокращает время на извлечение, сверку и разметку в десятки раз. Поэтому OCR прижились в корпоративных контурах:
- бухгалтерский учёт и работа с накладными;
- ведение и оцифровка архивов;
- аналитика и векторный поиск по извлечённым данным;
- наполнение баз данных для RAG-систем.
Участники теста
Мы отобрали шесть моделей, которые не раз оказывались в лидерах профильных бенчмарков, и разделили их на две весовые категории.
| Группа | Модель | Параметров |
|---|---|---|
| До 1.5 млрд | PaddleOCR-VLM 1.5 | 1.5b |
| До 1.5 млрд | MinerU 2.5 Pro | 1.2b |
| До 1.5 млрд | GLM-OCR | 0.9b |
| До 7 млрд | Chandra OCR2 | 5b |
| До 7 млрд | OlmoOCR2 | 7b |
| Универсальная VLM | Qwen3.6 35B-A3B | 35b (MoE, 3b активных) |
Qwen3.6 35B-A3B добавили из практических соображений: это не классический OCR, а мультимодальная языковая модель, но распознавать текст на изображениях она умеет.
Как мы оценивали результат
Одного взгляда на выдачу недостаточно, поэтому качество считали по двум метрикам.
- Text Accuracy на основе CER — сравнение распознанного текста с эталоном. Чем выше значение, тем ближе результат к оригиналу.
- Unit Test Pass Rate — проверка того, найдены ли 8 ключевых элементов: суммы, формулы, имена, названия, смысловые блоки. Чем больше элементов распознано, тем выше балл.
Тестовый набор состоял из шести изображений:
- страница с текстом, заголовками и форматированием — проверка распознавания обычного текста;
- страница с текстом, цифрами и большой таблицей накладной — текст, таблицы и числа;
- страница с текстом и математическими формулами;
- скан бухгалтерского накладного отчёта;
- две страницы рукописного текста на русском языке;
- рукописное задание ЕГЭ по математике — самая тяжёлая задача для OCR.
Помимо точности смотрели на сохранение структуры страницы и на то, насколько результат удобен для дальнейшей обработки.
Результаты по моделям
MinerU 2.5 Pro 1.2b
Главная фишка MinerU — функция bound-and-box: нейросеть делит страницу на блоки и определяет тип каждого (текст, заголовок, формула, таблица, диаграмма). Это сильно упрощает проверку результата. Модель хорошо сохраняет разметку, форматирование и порядок строк и слов. По метрикам она не всегда занимала верхние места, но работа со структурой страницы — её козырь. На обычных сканах MinerU уверенна, а вот на русском рукописном тексте качество резко падает.
PaddleOCR-VLM 1.5 1.5b
Китайская модель справляется со стандартными документами неплохо, но точность немного ниже, чем у MinerU. Она изредка пропускала ячейки таблиц, отдельные строки, формулы и слова, что некритично. На простых страницах всё в порядке, а вот на таблицах, формулах и рукописи производительность заметно проседает. Возможная причина — изначальная ориентация на китайский синтаксис и компактный размер. Но авторы позиционируют модель как универсальную, так что оправданием это служить не может.
GLM-OCR 0.9b
Самая лёгкая и компактная модель в списке. На первый взгляд она не уступает MinerU, но в сложных сценариях (формулы, русская рукопись) структура документа и порядок слов могут ломаться. Простые документы она щёлкает как орешки, однако на рукописях и сложных страницах эффективность снижается, особенно по ключевым элементам. Для модели менее чем на миллиард параметров результат всё же достойный.
Chandra OCR2 5b
От модели среднего размера ожидания выше, и она их оправдала: заметно лучше определяет текст, строит bound-and-box и структурирует документы. По метрикам держится выше компактных конкурентов, но безусловным лидером не стала. На русской рукописи проблемы остались, и не все ключевые элементы удавалось найти во всех сценариях.
OlmoOCR2 7b
Самая крупная из специализированных OCR-моделей. Функции bound-and-box у неё пока нет, поэтому оценивали только итоговую разметку и метрики. Оцифровки получаются визуально аккуратными, со структурой, практически идентичной оригиналу, а ошибок в тексте, цифрах и таблицах минимум. Даже без bound-and-box именно OlmoOCR2 7b стала фаворитом.
Qwen3.6 35B-A3B
Универсальная языковая модель с мультимодальным функционалом. Классического OCR-пайплайна с bound-and-box у неё нет, но LLM-ядро лучше понимает контекст, а мощный мультимодальный движок бережно сохраняет структуру. По метрикам Qwen3.6 35B-A3B местами сильнее специализированных конкурентов, особенно на формулах, таблицах и рукописи. Цена — размер: 35 миллиардов параметров, и несмотря на MoE-архитектуру с 3 миллиардами активных параметров, видеопамяти для развёртывания нужно заметно больше, чем для компактных OCR.
Итоговое сравнение
Первое место заняла OlmoOCR2 7b: лучшие показатели по разметке, метрикам и точности текста, цифр и прочих элементов. На втором месте Qwen3.6 35B-A3B — благодаря числу параметров, мультимодальному движку и пониманию контекста. MinerU 2.5 Pro 1.2b совсем немного обошла Chandra OCR2 5b, по эффективности и сохранению структуры они идут практически вровень. Замыкают список GLM-OCR 0.9b и PaddleOCR-VLM 1.5 1.5b.
Теперь по тестам отдельно:
- Простой документ. Все модели справились уверенно: сложных символов и структурных элементов там нет.
- Таблица. Результаты неоднозначны. Маленькие модели теряют производительность, крупные удерживают структуру, столбцы и важные примечания. Qwen3.6 35B-A3B здесь сильно просела, а лучшее качество дали OlmoOCR2 7b и MinerU 2.5 Pro 1.2b.
- Формулы. Многие модели резко потеряли в качестве. Увереннее остальных выглядят Qwen3.6 35B-A3B и MinerU 2.5 Pro 1.2b.
- Русская рукопись. Просели почти все. Небольшую эффективность сохранила только OlmoOCR2 7b, но по-настоящему хорошего результата не дала ни маленькая, ни большая модель.
- Рукописный ЕГЭ. Здесь важна оговорка: Text Accuracy у большинства моделей выглядит прилично, но это обманчиво. Метрика считается посимвольно, и если модель угадала часть букв или пробелов, балл будет высоким, даже когда текст мало похож на оригинал. Реалистичнее Unit Test Pass Rate, который показал, что многие нейросети потеряли ключевые элементы. В лидерах снова OlmoOCR2 7b и Qwen3.6 35B-A3B.
Практические выводы
Главная слабость всех OCR — рукописный текст. Для оцифровки экзаменов, докладов, отчётов или рапортов без ручного ввода и проверки пока не обойтись. Если же ваши задачи — машинописные тексты без сложных элементов, выбор модели можно не усложнять: с этим справляются все участники теста. Если же в документах есть нестандартное форматирование, таблицы, числа, названия и имена, лучше остановиться на более крупных моделях.
Какое железо нужно для локального OCR
Выбор модели напрямую определяет требования к серверу:
- компактные GLM-OCR, MinerU и PaddleOCR (0.9–1.5b) подойдут для небольших нагрузок и недорогих конфигураций с одной видеокартой;
- Chandra OCR2 5b и OlmoOCR2 7b требуют больше видеопамяти, зато дают лучшее качество на сложных документах;
- Qwen3.6 35B-A3B нужна конфигурация с заметным запасом по видеопамяти, даже с учётом 3 миллиардов активных параметров.
Если вы планируете развернуть OCR внутри компании для бухгалтерии, архива или RAG-системы, посмотрите решения в разделах серверы и серверы для ИИ. Специалисты «СервакМастер» помогут подобрать конфигурацию под вашу модель и объём документов — напишите нам через страницу контактов.
