PyTesseract не обнаруживает символы UTF-8Python

Программы на Python
Anonymous
PyTesseract не обнаруживает символы UTF-8

Сообщение Anonymous »

Недавно я пытался преобразовать изображения символов UTF-8 в текст с помощью OCR. Однако я обнаружил, что pytesseract не может идентифицировать символы на изображении.
Вот пример изображения:
Символ Ома
Вот пример изображения:
Символ Ома
p>
Для этого изображения pytesseract возвращает, что, по его мнению, это символ «Q).
Вот код, который я использую

Код: Выделить всё

    glyph_image = glyph_image.convert("RGB")

custom_config = r'--oem 3 --psm 10'
text = pytesseract.image_to_string(glyph_image, config=custom_config, lang="eng")

print("Recognized text:", text)
except ValueError as e:
print(e)

Я заметил, что и для бета-символа (как показано здесь)
Бета-символ
Возвращаемый текст — B.
Это проблема с тем, что pytesseract не анализирует символы UTF-8? Если да, то есть ли способ заставить его анализировать символы UTF-8 или, возможно, изображения отформатированы неправильно??


Подробнее здесь: https://stackoverflow.com/questions/785 ... characters

Вернуться в «Python»