Я пытаюсь разработать простой веб-скребок. Я хочу извлечь обычный текст без разметки HTML. Мой код работает с простым (статическим) HTML, но не тогда, когда контент генерируется с помощью JavaScript, встроенного в страницу.
В частности, когда я использую urllib2.urlopen(request) для чтения содержимого страницы не отображается ничего, что могло бы быть добавлено кодом JavaScript, поскольку этот код не выполняется нигде. Обычно он запускается через веб-браузер, но это не является частью моей программы.
Как я могу получить доступ к этому динамическому содержимому из моего кода Python?
См. также Можно ли использовать Scrapy для очистки динамического контента с веб-сайтов, использующих AJAX? ответы, специфичные для Scrapy.
См. также Как прокрутить веб-страницу с помощью веб-драйвера selenium в Python? для обработки определенного типа динамического контента через Selenium.
Подробнее здесь: https://stackoverflow.com/questions/804 ... -in-python