Кто-нибудь знает, как я могу парсить веб-сайты? Прочтите список URL-адресов в IE из файла .txt, а затем запишите каждый результат URL-адреса в файл .txt, используя имя из файла .txt. Таким образом, будут файлы URL и имен, из которых код считывает и записывает тело с соответствующей строкой из файла .txt. Самое близкое, что я нашел, это приведенный ниже код; однако при этом все это сохраняется в один файл .txt с фиксированным именем, а не переменной; и он читает URL-адреса из списка. Я предполагаю, что цикл будет лучшим способом, однако я не видел никакого кода или какой-либо помощи для задач такого типа.
import requests
from bs4 import BeautifulSoup
from collections import Counter
urls = ["http://en.wikipedia.org/wiki/Wolfgang_A ... /wiki/Golf"]
with open('thisisanew.txt', 'w', encoding='utf-8') as outfile:
for url in urls:
website = requests.get(url)
soup = BeautifulSoup(website.content)
text = [''.join(s.findAll(text=True))for s in soup.findAll('p')]
for item in text:
print(item ,file=outfile,)
Подробнее здесь: https://stackoverflow.com/questions/414 ... text-files