Проблема в следующем:
У меня есть тысячи файлов .xps, включая конкретные данные, таблицы и графики. Для целей инженерии данных мне нужно будет автоматически извлечь определенные значения данных (строки) (не графики или изображения) из этих файлов в один файл Excel. Я могу получить доступ к данным вручную и могу скопировать и вставить нужные значения и переменные, но это не имеет никакого смысла. Мне нужно будет сделать это автоматически, зацикливая все файлы и структурируя их. Таким образом, python.
Что я нарисовал на данный момент:
Используйте библиотеки PyMuPDF, pandas и openpyxl
- Откройте каждый файл OXPS и определите нужные значения данных. Я понятия не имею, как это сделать на практике. Данные .xps находятся в переменных, например. значение1=0,434 значение5=0,443 и так далее). Как точно определить эти значения value1 и value5 и исключить все остальное?
- Создать фрейм данных «Pandas» из собранных данных
- экспортировать его в файл Excel
Подробнее здесь: https://stackoverflow.com/questions/785 ... omatically