Тип файла –

Записывает в корзину S3 для JavaRDD
[img]https://i.sstatic .net/pHsDSkfg.png[/img]
Теперь метод write() для набора данных по умолчанию использует формат паркета, мы можем явно указать желаемый формат через format("введите свой формат"), который позволяет использовать txt,json,orc и т. д. Но ни один из форматов, похоже, не повторяет формат, сохраненный с помощью saveAsTextFile(). Я не хочу возиться с форматом и хотел бы найти способ сохранить тот же формат записи, что и RDD.
Это старый код, который использовался для написания JavaRDD ( здесь sc — объект JavaSparkContext)
JavaRDD inputProcessedRDD = sc.textFile(processedRecordsPath);
inputProcessedRDD.saveAsTextFile(writePath);
Это код, который записывает набор данных в текстовом формате
Dataset inputProcessedDataset = sparkSession.read().format("text").load(processedRecordsPath);
inputProcessedDataset.write().mode("overwrite").format("text").save(writePath);
Подробнее здесь: https://stackoverflow.com/questions/785 ... vs-dataset