Мне нужно извлечь информацию с помощью OCR из двух отсканированных PDF-файлов ниже. Я пробовал использовать традиционные инструменты оптического распознавания символов, а также запускал модели на Python, а также пытался создать собственный шаблон, но это не сработало. Мне рекомендовали использовать модели для многоколоночных макетов. Как его настроить и выполнить извлечение информации?
Пример PDF-документа представлен на этих двух изображениях.
Подробнее здесь:
https://stackoverflow.com/questions/789 ... canned-pdf