Мне нужно преобразовать текстовый документ PDF в Markdown и сохранить его структуру (т. е. индексированные пронумерованные заголовки и подзаголовки должны иметь соответствующее количество хэштегов # в уценке, чтобы сохранить одно и то же дерево структуры).
Я изучил только PDFMinersix, но я в основном извлекаю текст и не вижу функции, способной сопоставить дерево структуры с форматом уценки, или я ошибаюсь?
Для меня это важно для преобразования документа в текст и сохранения иерархии дерева структуры. Для меня это одно и то же: 1 или 2 шага.
Есть ли рекомендации по библиотекам Python или передовым методам, которые доказали свою эффективность в аналогичных сценариях? Я ищу решение, которое могло бы масштабировать сотни документов и, возможно, не иметь ничего жестко запрограммированного, хотя на самом деле документы будут иметь общую структуру и индексацию.
Подробнее здесь: https://stackoverflow.com/questions/778 ... eservation