📊 DocOCR-Eval: выбор OCR-движка без разметки и аннотаций Распознавание текста на сканах — базовая операция для извлечения ключевой информации или ответов на вопросы по документу. Но подобрать OCR-движок или подходящую мультимодальную языковую модель (MLLM) под конкретную коллекцию до сих пор непросто: без аннотаций почти невозможно понять, кто справится лучше. Статья на arXiv предлагает фреймворк DocOCR-Eval, который обходит это ограничение. В основе — трёхстадийная стратегия: сначала извлекают текст сырым OCR, затем несколько MLLM исправляют ошибки, после чего алгоритм ранжирует инструменты, не требуя ни одного проверочного образца. Авторы показали, что объединение исправлений от разных MLLM последовательно улучшает соответствие с аннотационным ранжированием — то есть выбор без ground truth всё ближе к тому, какой вы бы сделали с полной разметкой. Эксперименты ставили на скановых бенчмарках из разных доменов и языков. → Три стадии: извлечение → исправление несколькими MLLM → ранжирование без ground truth → В тесты включены классические OCR-движки и современные MLLM (конкретный список в статье) → Корреляция с «эталонным» выбором растёт с каждым дополнительным корректором Метод полностью завязан на способности MLLM исправлять ошибки, а значит, для редких шрифтов или языков ранжирование может поплыть. Зато для типовых офисных сканов это рабочий инструмент, который снимает с разработчика бремя разметки ещё до того, как он выбрал OCR. arXiv #OCR #DocUnderstanding #MLLM #evaluation #безразметки