Мне нужно извлечь информацию с помощью OCR из двух отсканированных PDF-файлов ниже. Я пробовал использовать традиционные инструменты оптического распознавания символов, а также запускал модели из Layout Parser, например PubLay, а также пытался создать собственный шаблон с помощью Label Studio, но это не сработало. Мне рекомендовали использовать PubLay для макетов с несколькими столбцами. Как его настроить и выполнить извлечение информации?
Пример PDF-документа представлен на этих двух изображениях.
Подробнее здесь:
https://stackoverflow.com/questions/789 ... canned-pdf