- Загрузить страницу и связанные с ней ресурсы (изображения, несколько страниц, связанных со статьей, и т. д.). ) в файл WARC.
- измените все ссылки, чтобы они указывали на теперь локальные файлы.
Есть ли хорошие библиотеки для этого? Похоже, Scrapy предназначен для очистки веб-сайтов, а не отдельных страниц, и я не уверен, как создавать файлы WARC. Вызов wget — выполнимое решение, если нет чего-то более родного для Python. Heritrix - это полное излишество, а не решение на Python. wpull был бы идеален, если бы у него была хорошо документированная библиотека Python, но, похоже, это скорее приложение.
Есть еще идеи?
Подробнее здесь: https://stackoverflow.com/questions/411 ... -in-python