У меня есть таблица данных Pandas DataFrame/Polars/Pyarrow со строковым ключевым столбцом. Вы можете предположить, что строки случайны. Я хочу разделить этот фрейм данных на N меньших фреймов данных на основе этого ключевого столбца.
Для целочисленного столбца я могу просто использовать df1 = df[df.key % N == 1], df2 = df[df.key % N == 2] и т. д.
Мое лучшее предположение о том, как вы собираетесь сделать это со строковым столбцом, - это применить хэш-функцию (например, суммирование значения ascii строки), чтобы преобразовать его в целочисленный столбец, а затем использовать модуль.
Пожалуйста, дайте мне знать, какой наиболее эффективный способ это можно сделать в Pandas, Polars или Pyarrow, в идеале с чистыми столбчатыми операциями в API. Выполнение df.apply, вероятно, будет слишком медленным для моего варианта использования.
Подробнее здесь: https://stackoverflow.com/questions/721 ... or-pyarrow