Я использую установку Spark с одним узлом для преобразования большого количества файлов JSON (общий размер: 11 ГБ) в файл Parquet. В настоящее время я выделил 6 ГБ для драйвера и 4 ГБ для исполнителя, но возникают ошибки нехватки памяти.
Какое рекомендуемое выделение памяти для драйвера и исполнитель в этом сценарии?
Подробнее здесь: https://stackoverflow.com/questions/790 ... allocation