Используйте конфигурацию HADOOP SparkContext в рамках методов/закрытия RDD, таких как ForeachPartitionJAVA

Программисты JAVA общаются здесь
Anonymous
Используйте конфигурацию HADOOP SparkContext в рамках методов/закрытия RDD, таких как ForeachPartition

Сообщение Anonymous »

Я использую Spark, чтобы прочитать кучу файлов, разработать их, а затем сохранять их все в виде файла последовательности. Я хотел иметь 1 файл последовательности в разделе, поэтому я сделал это: < /p>

Код: Выделить всё

SparkConf sparkConf = new SparkConf().setAppName("writingHDFS")
.setMaster("local[2]")
.set("spark.streaming.stopGracefullyOnShutdown", "true");
final JavaSparkContext jsc = new JavaSparkContext(sparkConf);
jsc.hadoopConfiguration().addResource(hdfsConfPath + "hdfs-site.xml");
jsc.hadoopConfiguration().addResource(hdfsConfPath + "core-site.xml");
//JavaStreamingContext jssc = new JavaStreamingContext(sparkConf, new Duration(5*1000));

JavaPairRDD imageByteRDD = jsc.binaryFiles(sourcePath);
if(!imageByteRDD.isEmpty())
imageByteRDD.foreachPartition(new VoidFunction() {

@Override
public void call(Iterator arg0){
throws Exception {
[°°°SOME STUFF°°°]
SequenceFile.Writer writer = SequenceFile.createWriter(
jsc.hadoopConfiguration(),
//here lies the problem: how to pass the hadoopConfiguration I have put inside the Spark Context?
Previously, I created a Configuration for each partition, and it works, but I'm sure there is a much more "sparky way"
Кто -нибудь знает, как использовать объект конфигурации Hadoop внутри закрытия RDD?

Подробнее здесь: https://stackoverflow.com/questions/382 ... e-foreachp

Вернуться в «JAVA»