
для данного примера html страница:
[*]
Topic 4
Мне нужно извлечь самые внутренние вложенные ссылки из такого дерева страниц. . Учитывая заголовок, внутри которого мне нужно получить все ссылки, как мне найти все самые внутренние вложенные ссылки? Я хочу написать для него скрипт Python, который динамически извлекает самые внутренние вложенные ссылки различных предоставленных html-страниц. Обратите внимание, что уровни вложенности могут быть разными.
таким образом для примера я должен получить:
Subtopic 1
Subtopic 2
Я пытался извлечь все ссылки в одну и ту же структуру вложенности, но это не сработало
# Step 1: Find the div with the given title
title = "Topic 3"
target_div = soup.find('span', class_='plugin_pagetree_children_span', text=title)
# Step 2: Extract the next div with class "plugin_pagetree_children_container"
if target_div:
container_div = target_div.find_next_sibling('div', class_='plugin_pagetree_children_container')
# Step 3: Extract all links within the container and print them
if container_div:
links = container_div.find_all('a')
for link in links:
print(link['href'])
Подробнее здесь: https://stackoverflow.com/questions/781 ... sted-links