Разобрать данные из локального html-файла с помощью bs4? ⇐ Python

Программы на Python
Anonymous
Разобрать данные из локального html-файла с помощью bs4?

Сообщение Anonymous »

Я пытаюсь проанализировать локальный html-документ, используя следующий код -

Код: Выделить всё

import os, sys
from bs4 import BeautifulSoup

path = os.path.abspath(os.path.dirname(sys.argv[0]))
fnHTML = os.path.join(path, "inp.html")
page = open(fnHTML)
soup = BeautifulSoup (page.read(), 'lxml')

worker = soup.find("span")
wHeadLine = worker.text.strip()
wPara = worker.find_next("td").text.strip()
print(wHeadLine)
print(wPara)
Вывод выглядит следующим образом:

Код: Выделить всё

Find your faves—faster
We’ve made it easier than ever to see what’s on now and continue  watching your recordings, favorite teams and more.
Но текст в html выглядит вот так – см. картинку
[img]https: //i.sstatic.net/TMcn4gSJ.png[/img]

Почему в тексте не выводятся символы «—» и «Мы»?

Подробнее здесь: https://stackoverflow.com/questions/790 ... -using-bs4

Вернуться в «Python»