Я новичок в веб-скрапинге, и мне нужно быстро научиться этому для работы.
У меня возникли проблемы с очисткой веб-страницы клиента, поскольку контент, который мне нужно получить, уникально вложен в каждую запись на главной странице (более 300 раз), некоторые поля на дочерних страницах не находятся в тегах, и немного беспорядка.
Какая логика лучше всего подойдет для получения следующей информации. (Кроме того, если кто-нибудь знает какие-либо новые бесплатные инструменты очистки, которые стоит изучить, это было бы здорово.
Я могу получить все записи на родительской странице. Я просто не знаю, как перейти через каждую запись, чтобы получить доступ к информации ее дочерней страницы и получить ее перед переходом к следующей строке на родительской странице.
Подробнее здесь: https://stackoverflow.com/questions/847 ... sted-pages