Я извлекаю текст на арабском языке из PDF-файлов и изображений с помощью Surya OCR. В целом он работает хорошо, но если PDF-файл имеет плохое качество шрифта или сложные стили, извлеченный текст содержит много ошибок.
Я пробовал использовать Ollama с такими моделями, как Mistral и Aya, для постобработки и исправления извлеченного текста, но это не улучшает результаты. Те же ошибки остаются.
Мои вопросы:
- Как я могу повысить точность извлечения текста на арабском языке, если исходный PDF-файл имеет шрифты низкого качества?
- Есть ли эффективный способ постобработки результатов OCR (для арабского языка) с помощью LLM или другого инструмента?
- Следует ли предварительно обрабатывать PDF (например, конвертировать шрифты, улучшить качество изображения) перед применением оптического распознавания символов? Если да, какие инструменты или методы вы бы порекомендовали?