Улучшение результатов оптического распознавания арабского языка от Surya (обработка плохих шрифтов/постобработка с помощPython

Программы на Python
Anonymous
Улучшение результатов оптического распознавания арабского языка от Surya (обработка плохих шрифтов/постобработка с помощ

Сообщение Anonymous »


Я извлекаю текст на арабском языке из PDF-файлов и изображений с помощью Surya OCR. В целом он работает хорошо, но если PDF-файл имеет плохое качество шрифта или сложные стили, извлеченный текст содержит много ошибок.
Я пробовал использовать Ollama с такими моделями, как Mistral и Aya, для постобработки и исправления извлеченного текста, но это не улучшает результаты. Те же ошибки остаются.
Мои вопросы:
  • Как я могу повысить точность извлечения текста на арабском языке, если исходный PDF-файл имеет шрифты низкого качества?
  • Есть ли эффективный способ постобработки результатов OCR (для арабского языка) с помощью LLM или другого инструмента?
  • Следует ли предварительно обрабатывать PDF (например, конвертировать шрифты, улучшить качество изображения) перед применением оптического распознавания символов? Если да, какие инструменты или методы вы бы порекомендовали?
Любые предложения или рекомендации по обработке арабского OCR в сложных случаях будут очень полезны.

Вернуться в «Python»