В настоящее время я разрабатываю программное обеспечение, которое извлекает важные данные из бизнес-презентации (версия tl:dr). Частично это включает в себя получение текста из PDF-файла. Эта часть достаточно проста, но сохранить читабельность данных LLM сложно.
Немного о PDF-файлах:
Это PDF-версия слайд-шоу. (слайд-шоу невозможно получить), объем 5–35 страниц, форматирование текста повсюду, а важные данные часто находятся в таблицах. Размеры шрифтов в PDF-файле сильно различаются. Изображения также присутствуют по всему PDF-файлу с возможным текстом на изображениях (текст на изображении не имеет значения, но текст на изображении может иметь важное значение).
Я готов попробовать другой язык, если это возможно. есть библиотека, которая может быть полезна.
API с соответствующими расходами вполне подходят.
Время создания PDF-файла должно составлять менее 10 минут, в идеале — менее 2. минут.
Спасибо за любую помощь, даже небольшая навигационная цепочка может помочь.
Вот список нескольких вещей, которые у меня есть. попробовал
PyMuPdf (fitz) — текст не работал с таблицами таким образом, чтобы его можно было читать с помощью LLM.
еще одна альтернатива pymupdf — текст не работал работать с таблицами таким образом, чтобы их можно было читать с помощью LLM.
Разбиение PDF-файла на более мелкие изображения (1–4 страницы на изображение) и отправка его в gpt4o и sonnet 3.5 по одному изображению за раз — текст в некоторых PDF-файлах было слишком мало, чтобы быть точным. (для тех, кому интересно, gpt4o был ближе)
Pytesseract – очень неточно
Подробнее здесь: https://stackoverflow.com/questions/786 ... cated-pdfs