Pyspark Как готова папка с бинарными файлами постоянно - на новых файлахPython

Программы на Python
Anonymous
Pyspark Как готова папка с бинарными файлами постоянно - на новых файлах

Сообщение Anonymous »

Я создал конвейер pyspark, который начинается с чтения двоичных файлов:

Код: Выделить всё

unzipped: DataFrame = spark.read.format("binaryFile")\
.option("pathGlobFilter", "*.pcap.tgz")\
.option("compression", "gzip")\
.load(folder)
После «разархивирования» я разархивирую их и извлекаю пакеты ip-udp с собственным форматом пакета.
Есть ли способ pyspark выполнить конвейер для новых файлов или мне нужно что-то еще какая-то обертка для "наблюдения" за папкой? Я хотел бы избежать опроса, но использовать что-то, основанное на событиях файловой системы.
Я хотел бы переместить обработанные файлы в папку «Готово».
Я знаю, что это так. это «потоковая обработка», но я не уверен, применимо ли это здесь. По крайней мере, есть несколько случаев использования, когда мне нужны доступные данные из предыдущих файлов.

Подробнее здесь: https://stackoverflow.com/questions/786 ... -new-files

Вернуться в «Python»