Используйте функцию регулярного выражения на PolarsPython

Программы на Python
Anonymous
Используйте функцию регулярного выражения на Polars

Сообщение Anonymous »

Я очищаю столбец испанского текста с помощью следующей функции, использующей re и unicodedata:

Код: Выделить всё

def CleanText(texto: str) -> str:
texto = texto.lower()
texto = ''.join((c for c in unicodedata.normalize('NFD', texto) if unicodedata.category(c) != 'Mn'))
texto = re.sub(r'[^a-z0-9 \n\.,]', '', texto)
texto = re.sub(r'([.,])(?![\s])', r'\1 ', texto)
texto = re.sub(r'\s+', ' ', texto).strip()
texto = texto.replace('.', '')
texto = texto.replace(',', '')
return texto
А затем я применяю его к своему Dataframe, используя:

Код: Выделить всё

(
df
.with_columns(
pl.col("Comment").map_elements(CleanText,return_dtype=pl.String).alias("CleanedText")
)
)
Однако, поскольку поляры принимают ящик регулярных выражений, я думаю, что мог бы просто использовать поляры для очистки без необходимости создания вспомогательных функций.
Как я могу просто использовать полярное выражение, чтобы сделать то же самое?


Подробнее здесь: https://stackoverflow.com/questions/788 ... -on-polars

Вернуться в «Python»