Как я могу прочитать большой файл CSV размером до 500 ГБ в Apache Spark и выполнить расчет и преобразование в одном из его столбцов. Мне дали большой файл для выполнения ETL и вычислений на нем. Я новичок в Python/Spark. Любая помощь будет оценена по достоинству.
Попробуйте прочитать файл и примененную формулу, но это займет слишком много времени.
Подробнее здесь: https://stackoverflow.com/questions/788 ... rm-aggrega