поскольку ввод-вывод занимает много времени. Я хочу прочитать несколько файлов параллельно и получить их в отдельном фрейме данных.
Я попробовал код ниже
Код: Выделить всё
from multiprocessing.pool import ThreadPool
def read_file(file_path):
return spark.read.csv(file_path)
pool = ThreadPool(10)
df_list = pool.starmap(read_file,[[file1,file2,file3...]])
Как я могу это сделать? Есть ли альтернатива моему требованию?
Я хочу прочитать несколько файл параллельно и получить их в отдельном кадре данных.
Подробнее здесь: https://stackoverflow.com/questions/787 ... in-pyspark