Как я могу прочитать CSV-файл большого размера размером до 500 ГБ в Apache Spark и выполнить на нем агрегацию?Python

Программы на Python
Anonymous
Как я могу прочитать CSV-файл большого размера размером до 500 ГБ в Apache Spark и выполнить на нем агрегацию?

Сообщение Anonymous »

Как я могу прочитать большой файл CSV размером до 500 ГБ в Apache Spark и выполнить расчет и преобразование в одном из его столбцов. Мне дали большой файл для выполнения ETL и вычислений на нем. Я новичок в Python/Spark. Любая помощь будет оценена по достоинству.
Попробуйте прочитать файл и примененную формулу, но это займет слишком много времени.

Подробнее здесь: https://stackoverflow.com/questions/788 ... rm-aggrega

Вернуться в «Python»