Получение списка веб-сайтов из CSVPython

Программы на Python
Anonymous
Получение списка веб-сайтов из CSV

Сообщение Anonymous »

Я пытаюсь получить список страниц, сохраненных в CSV-файле, с одного и того же веб-сайта. Ссылки сохраняются в столбце 2 CSV-файла, а заголовок — в столбце 1. Данные, которые я хочу загрузить, содержатся внутри div, который выглядит примерно так:

Код: Выделить всё

Pitches[list]          [*]



Caravan Holiday Homes Privately Owned65
[*]



Caravan Holiday Homes Letting130
[*]



Cottage Letting1
[*]



Total Pods4
[*]



Total Touring Pitches191
[/list]
На данный момент мне удалось очистить одну страницу для всех элементов div, соответствующих div class="col col-1-1". Я также определил, что веб-сайт не использует Javascript, поэтому BeautifulSoup должен работать нормально. Однако у меня возникают проблемы с:
  • Пробежкой по списку ссылок из CSV, так как пока ничего не работает

    Код: Выделить всё

    with open('links.csv', newline='') as f:
    reader = csv.reader(f)
    links = list(reader)
    
    Это позволяет мне правильно импортировать CSV. Однако я не знаю, как закодировать парсер, чтобы он проходил по ссылкам в столбце 2 и документировал нужную информацию.
  • Изолирование правильный div

    Код: Выделить всё

    URL = "https://www.ukparks.com/park/steeplebayhp/"
    page = requests.get(URL)
    
    soup = bs4.BeautifulSoup(page.content, "html.parser")
    athing = soup.find_all(class_="col col-1-1")
    
    print(soup.get_text())
    
    На данный момент мне удалось сузить выбор, но я не знаю, как правильно отфильтровать правильный вариант.

    Настройка парсера таким образом, чтобы он учитывал div, содержащий различную комбинацию элементов, и правильное документирование их всех, например: одна страница может иметь тип 0, в этот момент он не будет отображаться в списке.


Подробнее здесь: https://stackoverflow.com/questions/787 ... from-a-csv

Вернуться в «Python»