Чтение нескольких файлов параллельно в отдельный фрейм данных в PysparkPython

Программы на Python
Гость
Чтение нескольких файлов параллельно в отдельный фрейм данных в Pyspark

Сообщение Гость »

Я пытаюсь прочитать большие текстовые файлы в dataframe. Размер каждого файла составляет 10–15 ГБ,
поскольку ввод-вывод занимает много времени. Я хочу прочитать несколько файлов параллельно и получить их в отдельном фрейме данных.
Я попробовал код ниже

Код: Выделить всё

from multiprocessing.pool import ThreadPool
def read_file(file_path):
return spark.read.csv(file_path)

pool = ThreadPool(10)
df_list = pool.starmap(read_file,[[file1,file2,file3...]])

Но выдает ошибку Pickel.
Как я могу это сделать? Есть ли альтернатива моему требованию?
Я хочу прочитать несколько файл параллельно и получить их в отдельном кадре данных.

Подробнее здесь: https://stackoverflow.com/questions/787 ... in-pyspark

Вернуться в «Python»