Код: Выделить всё
unzipped: DataFrame = spark.read.format("binaryFile")\
.option("pathGlobFilter", "*.pcap.tgz")\
.option("compression", "gzip")\
.load(folder)
Есть ли способ pyspark выполнить конвейер для новых файлов или мне нужно что-то еще какая-то обертка для "наблюдения" за папкой? Я хотел бы избежать опроса, но использовать что-то, основанное на событиях файловой системы.
Я хотел бы переместить обработанные файлы в папку «Готово».
Я знаю, что это так. это «потоковая обработка», но я не уверен, применимо ли это здесь. По крайней мере, есть несколько случаев использования, когда мне нужны доступные данные из предыдущих файлов.
Подробнее здесь: https://stackoverflow.com/questions/786 ... -new-files