Извлечение самых внутренних вложенных ссылокPython

Программы на Python
Гость
Извлечение самых внутренних вложенных ссылок

Сообщение Гость »


Изображение

для данного примера html страница:






[*]

Topic 4











Мне нужно извлечь самые внутренние вложенные ссылки из такого дерева страниц. . Учитывая заголовок, внутри которого мне нужно получить все ссылки, как мне найти все самые внутренние вложенные ссылки? Я хочу написать для него скрипт Python, который динамически извлекает самые внутренние вложенные ссылки различных предоставленных html-страниц. Обратите внимание, что уровни вложенности могут быть разными.
таким образом для примера я должен получить:
Subtopic 1
Subtopic 2

Я пытался извлечь все ссылки в одну и ту же структуру вложенности, но это не сработало
# Step 1: Find the div with the given title
title = "Topic 3"
target_div = soup.find('span', class_='plugin_pagetree_children_span', text=title)

# Step 2: Extract the next div with class "plugin_pagetree_children_container"
if target_div:
container_div = target_div.find_next_sibling('div', class_='plugin_pagetree_children_container')

# Step 3: Extract all links within the container and print them
if container_div:
links = container_div.find_all('a')
for link in links:
print(link['href'])


Подробнее здесь: https://stackoverflow.com/questions/781 ... sted-links

Вернуться в «Python»