Чтобы дать вам больше контекста, у меня есть несколько папок с несколькими csv файлы
папка:
- файл0
- файл1
- file2
- и т. д..
Сейчас у меня есть только это, но он создает 1 файл паркета для 1 CSV, и это не то, что я ожидаю
Я ничего не нашел в Интернете... Единственное, что я видел:
< ul>
[*]читает с набором данных pyarrow, но я не могу, потому что мне нужны read_options, parse_options и Convert_options при чтении CSV
[*]и я использую open_input_stream, а не open_input_file, но я не знаю, что он делает...
А для экспорта в несколько файлов паркета я что-то не нашел...
Код: Выделить всё
from pyarrow import csv
from pyarrow import parquet
from pyarrow import fs
hdfs = fs.HadoopFileSystem("default")
with hdfs.open_input_file("path") as f:
csv_file = csv.read_csv(f)
parquet.write_table(csv_file, "newpath")
Подробнее здесь: https://stackoverflow.com/questions/784 ... th-pyarrow