Я делаю проект RAG. Одним из шагов является извлечение текста из файлов PDF. Я обнаружил, что это работает хорошо, если качество входного PDF-файла хорошее, но когда качество входного PDF-файла плохое, моя RAG не может ответить на некоторые вопросы. Как я могу улучшить свой RAG, если мне приходится иметь дело с PDF-файлами низкого качества?
Я использовал PyMuPDF для извлечения текста непосредственно из PDF-файлов.
Я использовал Chroma в качестве векторной базы данных. .
В качестве модели внедрения я использовал BAAI/bge-m3.
Подробнее здесь: https://stackoverflow.com/questions/787 ... -pdf-files