Я использую библиотеку запросов Python для получения HTML-код из URL-адреса. (Впоследствии эти данные будут дополнительно проанализированы в соответствии с конкретными тегами и т. д. с использованием BeautifulSoup.)
Я могу сделать это и распечатать полученные HTML-данные на экран, используя приведенный ниже скрипт Python.
Я могу сделать это и распечатать полученные HTML-данные на экране.
п>
Код: Выделить всё
import requests
URL = "https://www.example.com"
page = requests.get(URL)
print(page.text)
Что мне действительно хотелось бы сделать , (вместо получения данных для всей страницы) заключается в непосредственном получении данных HTML из одной строки. (Содержимое этой строки затем будет проанализировано с помощью BeautifulSoup). Я бы хотел сделать это
а) посмотреть, возможно ли это.
б) сэкономить память и время обработки, поскольку веб-страницы часто состоят из множества строк, а некоторые строки очень длинные!Я надеялся, что существует простой аргумент метода GET, который будет ссылаться на номер строки HTML-кода, отображаемый в веб-браузере при просмотре исходного кода страницы. Если да, то я мог бы просто указать, какой номер строки я хочу получить.
Однако, глядя на документацию по методу GET, я не вижу такой возможности.
Если этот путь не удастся, моя следующая идея будет схематичной. Я думал об использовании моего сценария Python для циклического перебора номеров строк в коде HMTL, пока не будет достигнута нужная строка. Однако для меня это лишает объект возможности, так как я стараюсь не получать сначала всю страницу.
Прежде чем приступить к этому действию, я был бы благодарен за любые указатели на другие вещи, которые я мог бы попробовать.
Подробнее здесь: https://stackoverflow.com/questions/784 ... or-similar