Преобразование PDF в Markdown в Python с сохранением структурыPython

Программы на Python
Anonymous
Преобразование PDF в Markdown в Python с сохранением структуры

Сообщение Anonymous »

Мне нужно преобразовать текстовый документ PDF в Markdown и сохранить его структуру (т. е. индексированные пронумерованные заголовки и подзаголовки должны иметь соответствующее количество хэштегов # в уценке, чтобы сохранить одно и то же дерево структуры).
Я изучил только PDFMinersix, но я в основном извлекаю текст и не вижу функции, способной сопоставить дерево структуры с форматом уценки, или я ошибаюсь?
Для меня это важно для преобразования документа в текст и сохранения иерархии дерева структуры. Для меня это одно и то же: 1 или 2 шага.
Есть ли рекомендации по библиотекам Python или передовым методам, которые доказали свою эффективность в аналогичных сценариях? Я ищу решение, которое могло бы масштабировать сотни документов и, возможно, не иметь ничего жестко запрограммированного, хотя на самом деле документы будут иметь общую структуру и индексацию.

Подробнее здесь: https://stackoverflow.com/questions/778 ... eservation

Вернуться в «Python»