Направление Scrapy на локальный кеш вместо выполнения обычного процесса обходаPython

Программы на Python
Anonymous
Направление Scrapy на локальный кеш вместо выполнения обычного процесса обхода

Сообщение Anonymous »

Я использую конвейеры для кэширования документов, полученных при сканировании Scrapy, в базу данных, чтобы можно было повторно проанализировать их, если я изменю логику анализа элементов, без необходимости повторного обращения к серверу.

Как лучше всего обрабатывать Scrapy из кеша вместо обычного сканирования?

Мне нравится поддержка Scrapy селекторов CSS и XPath, в противном случае я бы просто обращался к базе данных отдельно с помощью анализатора lxml.

Какое-то время я вообще не кэшировал документ и использовал Scrapy обычным способом - анализ элементы на лету - но я обнаружил, что изменение логики элемента требует повторного сканирования, требующего больших затрат времени и ресурсов. Вместо этого я теперь кэширую тело документа вместе с анализом элемента и хочу, чтобы Scrapy перебирал эти документы из базы данных вместо сканирования целевого URL-адреса.

Как мне изменить Scrapy, чтобы у меня была возможность передавать ему набор документов, а затем анализировать их по отдельности, как если бы он только что извлек их из Интернета?

Подробнее здесь: https://stackoverflow.com/questions/324 ... ing-proces

Вернуться в «Python»