Это изображение
Это образец изображения, которое я преобразую в текст.
И вот результат:
"|
| .
показатели (Предложения:
С.1.4.1. Действующее Свидетельство о регистрации и < Strong>LJ Poy |
Экзамен на получение профессиональной лицензии для
учителей (LET);
Степень магистра в области образования или в любом из:
__ смежные поля и —
S.1.4.3 соответствуют другим требованиям _—!
S.2 Учитываются другие уточнения, например следующие: |__|
"
Эти жирные буквы/символы. нежелательны, я думаю, это из-за коробок.
Может ли кто-нибудь помочь мне это исправить?
Вот мой код
from PIL import Image
from progress.bar import Bar
import pytesseract # type: ignore
import uuid
import fnmatch
import os
import cv2
import numpy as np
directory = "D:/Python/Projects/Pdf_OCR/pdf_file"
files = Path(directory).glob("*.png")
rand_filename = str(uuid.uuid4())
create_text_file = open(f"{rand_filename}.txt", "x")
total_imgs = fnmatch.filter(os.listdir(directory), "*png")
bar = Bar("Processing", max=len(total_imgs))
pytesseract.pytesseract.tesseract_cmd = r"C:\Program Files\Tesseract-OCR\tesseract.exe"
open_text_file = open(f"{rand_filename}.txt", "w")
for file in files:
img = Image.open(file)
custom_config = r"-l eng --psm 6 --oem 3"
open_text_file.write(pytesseract.image_to_string(img, config=custom_config))
bar.next()
open_text_file.close
bar.finish()
Подробнее здесь: https://stackoverflow.com/questions/787 ... ter-or-let