Python pytesseract: я не хочу, чтобы поля читались как специальные символы или буквыPython

Программы на Python
Anonymous
Python pytesseract: я не хочу, чтобы поля читались как специальные символы или буквы

Сообщение Anonymous »

Это изображение
Это образец изображения, которое я преобразую в текст.
И вот результат:
"|
| .

показатели (Предложения:
С.1.4.1. Действующее Свидетельство о регистрации и < Strong>LJ Poy |
Экзамен на получение профессиональной лицензии для
учителей (LET);
Степень магистра в области образования или в любом из:
__ смежные поля и
S.1.4.3 соответствуют другим требованиям _—!
S.2 Учитываются другие уточнения, например следующие: |__|
"
Эти жирные буквы/символы. нежелательны, я думаю, это из-за коробок.
Может ли кто-нибудь помочь мне это исправить?
Вот мой код
from PIL import Image
from progress.bar import Bar
import pytesseract # type: ignore
import uuid
import fnmatch
import os
import cv2
import numpy as np

directory = "D:/Python/Projects/Pdf_OCR/pdf_file"

files = Path(directory).glob("*.png")

rand_filename = str(uuid.uuid4())
create_text_file = open(f"{rand_filename}.txt", "x")

total_imgs = fnmatch.filter(os.listdir(directory), "*png")
bar = Bar("Processing", max=len(total_imgs))

pytesseract.pytesseract.tesseract_cmd = r"C:\Program Files\Tesseract-OCR\tesseract.exe"

open_text_file = open(f"{rand_filename}.txt", "w")

for file in files:
img = Image.open(file)

custom_config = r"-l eng --psm 6 --oem 3"
open_text_file.write(pytesseract.image_to_string(img, config=custom_config))
bar.next()

open_text_file.close
bar.finish()


Подробнее здесь: https://stackoverflow.com/questions/787 ... ter-or-let

Вернуться в «Python»