Python, HTML-код не загружается полностью перед попыткой его изученияHtml

Программисты Html
Anonymous
Python, HTML-код не загружается полностью перед попыткой его изучения

Сообщение Anonymous »

Код: Выделить всё

    url = booklink[0].replace('/index.html', '/page' + str(pages) + '.html')
req = Request(url,headers={'User-Agent': 'Mozilla/5.0'})
page = urlopen(req).read()
htm = BeautifulSoup(page, 'html.parser')
html = htm.prettify()
Я пытаюсь загрузить HTML-код с веб-страницы, а затем извлечь из него что-то. Большую часть времени он работает нормально. В других случаях, когда я захожу в re.findall, он возвращается и указывает, что ничего не нашел, даже на той же странице. Похоже, я имею дело со случаем, когда веб-страница загружается не полностью, прежде чем программа пытается проверить HTML-код.
Я уже пробовал такие вещи, как:
/>

Код: Выделить всё

response = requests.get(url, stream=True)
soup = BeautifulSoup(response.raw.read(), 'html.parser')
и

Код: Выделить всё

with urllib.request.urlopen(url) as response:
source_code = response.read().decode('utf-8')
с гораздо худшей производительностью, включая загрузку первого элемента, а затем постоянное повторение вместо того, чтобы захватить следующий элемент и поместить его в текстовый файл.
Как мне заставить программу убедиться, что вся веб-страница загружена, прежде чем она попытается ее очистить.>

Подробнее здесь: https://stackoverflow.com/questions/798 ... examine-it

Вернуться в «Html»