У меня есть 50 000 слов типа:
- добавить
- чтобы добавить
- курица
- курица
- есть курицу
- чтобы поесть
- ...
И я хочу удалить строку, которая имеет большое нечеткое сходство с другими строками.
Тогда вывод должен быть таким:
- добавить
- чтобы съесть
- курица
- ...
Я не могу вычислить каждое нечеткое совпадение (50 000* *2 совпадения слишком высокие), и я ищу такой метод, как KD-Tree/Ball-Tree, но работаю с расстоянием строки (расстояние Левенштейна, нечеткое расстояние...)
Я предпочитаю использовать только Python, но я непредубежден! Спасибо большое
Подробнее здесь:
https://stackoverflow.com/questions/707 ... h-a-lot-of