Как настроить Apache Tika в среде Kube, чтобы получить максимальную пропускную способность при анализе огромного количесJAVA

Программисты JAVA общаются здесь
Anonymous
Как настроить Apache Tika в среде Kube, чтобы получить максимальную пропускную способность при анализе огромного количес

Сообщение Anonymous »

Я пытаюсь сделать Тика Парсировать десятки миллионов офисных документов. PDFS, DOCS, Excels, XMLS и т. Д. Мне нужно быть в состоянии проанализировать эти файлы в разумное количество времени, но в то же время точность также довольно важна. Я надеюсь, что у меня будет меньше 10% проанализированных документов. (И под провалом я имею в виду неудачу из -за стабильности тики, например, время ожидания во время анализа. Я не имею в виду неудачный из -за самого документа). < /P>
Мой вопрос - как настроить сервер тика в контейнерной среде, чтобы максимизировать пропускную способность? />> Темы. -taskpulsemillis 500 -TaskTimeOutMillis 120000 -JXMX512M -ENABLEUNSECUREFEATURES -ENABLEFILEURL


Поток теперь будет постоянно снимать файлы в файл в файл, и будет отправлять его на сервер, который будет непрерывно, если файл не будет оставаться в File -File -File -File, и будет отправлять его на сервер TIK. parse. < /li>
< /ul>
Каждый из этих файлов хранится локально в капсуле в буфере, поэтому используется локальная оптимизация файлов: < /p>
Веб -служба Tika, которую он использует, является: < /p>

Endpoint: `/rmeta/text`
Method: `PUT`
Headers:
- writeLimit = 32000000
- maxEmbeddedResources = 0
- fileUrl = file:///path/to/file
< /code>
Файлы не превышают 100 МБ, максимальное количество байтов Tika Text будет (writelimit) 32 МБ. Я связывался с кучкой различных попыток настройки. Итак, поэтому я использую Tika Server. < /P>
Я не ненавижу результаты производительности этого ... но я чувствую, что мне лучше обратиться и убедиться, что кто -то не проверяет мои здравомыслия и похож на «woah, это ужасное выступление, вы должны получить XYZ, как я!» Если да, то в каких настройках вы в конечном итоге устроились? Я использую общий пул соединений. Будет ли какая -либо выгода, скажем, с использованием уникальных httpclients.createdefault () для каждого потока вместо того, чтобы обмениваться пулом соединений между потоками?

Подробнее здесь: https://stackoverflow.com/questions/649 ... throughput

Вернуться в «JAVA»