Мне нужно выполнить минимальную очистку текста.
Очистка заключается в удалении знаков препинания, неалфавитных символов и оставлении только английского текста.
В настоящее время я использую чистый текст, но могу использовать что угодно.
У меня есть несколько CSV-файлов с текстовым столбцом.
Я использовал Map_elements но он работает очень медленно.
Есть ли лучший (эффективный) способ сделать это?
def clean_text(s):
return clean(s, lower=True, lang='en', no_punct=True)
df.select(pl.col('text').map_elements(clean_text))
Подробнее здесь: https://stackoverflow.com/questions/714 ... ssing-text