Извлечение текстового раздела из HTML (документы Эдгара 10-К)Python

Программы на Python
Anonymous
Извлечение текстового раздела из HTML (документы Эдгара 10-К)

Сообщение Anonymous »

Я пытаюсь извлечь определенный раздел из HTML-файлов. Точнее, я ищу раздел «ПУНКТ 1» в документах 10-K (бизнес-отчеты определенной компании в США). Например:
https://www.sec.gov/Archives/edgar/data ... .htm#a_002

Проблема: Однако я не могу найти раздел «ЭЛЕМЕНТ 1» и не знаю, как указать моему алгоритму выполнять поиск от этой точки «ЭЛЕМЕНТ 1» до другой точки (например, «ЭЛЕМЕНТ 1А») и извлечь текст в между.

Я очень благодарен за любую помощь.

Среди прочего я пробовал это (и подобные ), но мой др всегда пуст:

Код: Выделить всё

    try:
# bd = soup.body.findAll(text=re.compile('^ITEM 1$'))
# bd = soup.find_all(name="ITEM 1")
# bd = soup.find_all(["ITEM 1", "ITEM1", "Item 1", "Item1", "item 1", "item1"])

print(" Business Section (Item 1): ", bd.content)

except:
print("\n Section not found!")
Использование Python 3.7 и Beautifulsoup4

С уважением, Heka

Подробнее здесь: https://stackoverflow.com/questions/594 ... lings-html

Вернуться в «Python»