Мне интересно, как лучше всего повысить производительность этого набора данных. Несколько вещей, которые я рассмотрел и прочитал:
- Векторизировать сложно, потому что многие операции не так просты, как «вычесть значения этого столбца из значений другого столбца». значения».
- Я прочитал некоторую документацию Pandas, и несколько указанных опций относятся к Cython (может быть сложно преобразовать расстояние редактирования строки в Cython, тем более что я использую внешний Python) и Numba/JIT (но упоминается, что он лучше всего подходит только для числовых вычислений).
- Возможно, можно было бы контролировать количество потоков. 24 функции в большинстве случаев могут работать независимо друг от друга.
Подробнее здесь: https://stackoverflow.com/questions/751 ... dataframes