Проблема с форматом операции записи для JavaRDD и DatasetJAVA

Программисты JAVA общаются здесь
Anonymous
Проблема с форматом операции записи для JavaRDD и Dataset

Сообщение Anonymous »

Я пытаюсь перейти с JavaRDD на Dataset, и для записи RDD в сегменты S3 мы используем метод saveAsTextFile(), здесь не упоминается формат, поэтому они сохраняются как файл «Документ» без расширения, как показано ниже. p>
Тип файла –
Изображение

Записывает в корзину S3 для JavaRDD
[img]https://i.sstatic .net/pHsDSkfg.png[/img]

Теперь метод write() для набора данных по умолчанию использует формат паркета, мы можем явно указать желаемый формат через format("введите свой формат"), который позволяет использовать txt,json,orc и т. д. Но ни один из форматов, похоже, не повторяет формат, сохраненный с помощью saveAsTextFile(). Я не хочу возиться с форматом и хотел бы найти способ сохранить тот же формат записи, что и RDD.
Это старый код, который использовался для написания JavaRDD ( здесь sc — объект JavaSparkContext)
JavaRDD inputProcessedRDD = sc.textFile(processedRecordsPath);
inputProcessedRDD.saveAsTextFile(writePath);

Это код, который записывает набор данных в текстовом формате
Dataset inputProcessedDataset = sparkSession.read().format("text").load(processedRecordsPath);

inputProcessedDataset.write().mode("overwrite").format("text").save(writePath);


Подробнее здесь: https://stackoverflow.com/questions/785 ... vs-dataset

Вернуться в «JAVA»