Нечеткое сопоставление миллионов записей ⇐ Python
-
Гость
Нечеткое сопоставление миллионов записей
Я пытаюсь выполнить нечеткое сопоставление между двумя столбцами, в котором col="co_zip22" будет перебирать все строки в col="co_zip23" и находить совпадение со счетом соответствия. Таким образом, по сути, co_zip — это уникальный ключ, который я создал, объединив название компании и столбец zip, и я пытаюсь выяснить, присутствует ли компания из 2022 года в нашем регистраторе 2023 года.
Я создал файл, состоящий из двух столбцов, содержащих co_zip22 и co_zip23, для нечеткого сопоставления. У нас нет уникальных идентификаторов, поэтому я могу создать строку с названием компании и почтовым индексом. Ниже приведен мой код, и он отлично работает для небольших записей, но продолжает работать для такого большого набора данных и работает уже 2 дня
сходство = [] для меня в df.co_zip22:#full соотношение = процесс.извлечение(я, df.co_zip23, предел=1) сходство.append(отношение[0][1]) df['сходство'] = pd.Series(сходство) df.head(3)
Я пытаюсь выполнить нечеткое сопоставление между двумя столбцами, в котором col="co_zip22" будет перебирать все строки в col="co_zip23" и находить совпадение со счетом соответствия. Таким образом, по сути, co_zip — это уникальный ключ, который я создал, объединив название компании и столбец zip, и я пытаюсь выяснить, присутствует ли компания из 2022 года в нашем регистраторе 2023 года.
Я создал файл, состоящий из двух столбцов, содержащих co_zip22 и co_zip23, для нечеткого сопоставления. У нас нет уникальных идентификаторов, поэтому я могу создать строку с названием компании и почтовым индексом. Ниже приведен мой код, и он отлично работает для небольших записей, но продолжает работать для такого большого набора данных и работает уже 2 дня
сходство = [] для меня в df.co_zip22:#full соотношение = процесс.извлечение(я, df.co_zip23, предел=1) сходство.append(отношение[0][1]) df['сходство'] = pd.Series(сходство) df.head(3)