Как я могу правильно извлечь текст из файла PDF, чтобы сохранить его в индексе упругого поиска?C#

Место общения программистов C#
Anonymous
Как я могу правильно извлечь текст из файла PDF, чтобы сохранить его в индексе упругого поиска?

Сообщение Anonymous »

Я работаю над проектом C#/Blazor, который извлекает текст из PDF-файлов и хранит его в индексе Elasticsearch для полнотекстового поиска. Например, точки пуль и заголовки извлекаются по линии по линии без какой-либо четкой структуры. < /P>
Есть ли способ сохранить логическую компоновку при извлечении текста из этих pdfs? индивидуально. Это делает текст трудным для поиска и чтения после индексированного.

Код: Выделить всё

try
{
using var reader = new PdfReader(file.Path);
using var pdf = new PdfDocument(reader);

for (var i = 1; i  

Подробнее здесь: [url]https://stackoverflow.com/questions/79678583/how-can-i-properly-extract-text-from-a-pdf-file-to-store-it-in-a-elastic-search[/url]

Вернуться в «C#»