Я экспериментировал с pypdf и pdfMiner для извлечения текста из файлов PDF. У меня есть несколько недружественных PDF-файлов, которые успешно извлекает только pdfMiner. Я использую этот код для извлечения текста для всего файла. Однако мне бы очень хотелось извлекать текст постранично, как это делает функцияpages.extract_text() в pypdf. Кто-нибудь знает, как извлечь текст на страницу с помощью pdfMiner?
Подробнее здесь: https://stackoverflow.com/questions/126 ... n-pdfminer