Я пытаюсь создать программу, используя большой список строк названий компаний (часто беспорядочных: юридические суффиксы, &, опечатки, аббревиатуры) и имен групп, которые, вероятно, относятся к одним и тем же или тесно связанным объектам, т. е. **почти повторяющаяся/нечеткая кластеризация
Пример:** Paypal Holding | PayPal холдинги | Paypal Inc
Warner Bros. | Warnner Brothers
Примечание. Алгоритм должен обрабатывать сотни тысяч записей.