Ввод:
Код: Выделить всё
[b][/b]
[b][/b]Lorem ipsum dolor sit amet, consectetuer adipiscing elit. Aenean commodo ligula eget dolor. Aenean massa
Consectetuer adipiscing elit. [url=http://example.com/]Some Link[/url] Aenean commodo ligula eget dolor. Aenean massa
Aenean massa.Lorem ipsum dolor sit amet, consectetuer adipiscing elit. Aenean commodo ligula eget dolor. Aenean massa
Lorem ipsum dolor sit amet, consectetuer adipiscing elit. Aenean commodo ligula eget dolor. Aenean massa
Consectetuer adipiscing elit. Aenean commodo ligula eget dolor. Aenean massa
Aenean commodo
ligula нуждается в боли. Aenean Massa Consectetuer adipiscing elit.
Некоторые
Link Aenean commodo ligula eget боль. Энейская масса Энейская
масса. Энею
приятно нужна боль. Aenean Massa Lorem ipsum dolor let
amet, consectetuer adipiscing elit. Aenean commodo ligula eget dolor. Aenean commodo
ligula нуждается в боли. Aenean Massa
Я попробовал модуль html2text без особого успеха:
Код: Выделить всё
#!/usr/bin/env python
import urllib2
import html2text
from BeautifulSoup import BeautifulSoup
soup = BeautifulSoup(urllib2.urlopen('http://example.com/page.html').read())
txt = soup.find('div', {'class' : 'body'})
print(html2text.html2text(txt))
Подробнее здесь: https://stackoverflow.com/questions/146 ... ith-python