Я использую pypdf для извлечения текста и использую этот код ниже. Это работает, если таблица представляет собой одну страницу (закрытие таблицы), но если таблица расширяется на другую страницу (частично на одной странице, а остальное на последующей странице), данные извлекаются только со 2-й страницы. Есть ли какие-либо настройки, которые я могу использовать, или могу ли я удалить разрывы страниц из PDF-файла? Любая помощь очень ценится.
txt = page.extract_text(extraction_mode="layout", layout_mode_space_vertically=True)
Подробнее здесь: https://stackoverflow.com/questions/786 ... -on-one-pa