Я не знаком с анализом PDF, но я разрабатываю программу, которая обрабатывает PDF -файлы с ITEXT 8 . Моя система использует услугу электронного протокола для вставки информации о протоколе в верхней части каждого документа. В целом эти данные протокола обнаруживаются в определенном потоке от страницы, что позволяет легко идентифицировать и извлекать. Кроме того, метод pdftextextractor.getTextFrompate () Успешно получает данные протокола без каких -либо проблем. Я не могу найти информацию о протоколе в любом из потоков страницы. Информация о протоколе). < /li>
Третий поток длиной 2 байта и содержит верхний "q". способ, о котором я не знаю?

Этот поток содержит это: < /p>
Код: Выделить всё
q
q
0 0 0 rg
q
BT
/FNT0 9 Tf
100.1711 818.7475 Td
Tj
ET
Q
Q
q
1 w
1 0 0 RG
[] 0 d
0 J
0 j
10 M
10 811.895 575 20 re
S
Q
Q
Кто -нибудь столкнулся с аналогичной проблемой или может предложить, почему данные протокола могут быть доступны с помощью pdftextextractor.gettextfromation () , но не с помощью пользовательской стратегии с использованием pdfcanvasprocessor ? /> ps: я не могу поделиться PDF с этой проблемой из -за проблем с конфиденциальностью. < /p>
Подробнее здесь:
https://stackoverflow.com/questions/796 ... in-c-sharp