Чтение нескольких CSV-файлов с помощью PyarrowPython

Программы на Python
Anonymous
Чтение нескольких CSV-файлов с помощью Pyarrow

Сообщение Anonymous »

Я хочу прочитать несколько CSV-файлов с помощью PyArrow из Hadoop и не знаю, как это сделать.
Чтобы дать вам больше контекста, у меня есть несколько папок с несколькими csv файлы
папка:
  • файл0
  • файл1
  • file2
  • и т. д..
И я хочу прочитать их все по порядку чтобы я мог затем создавать файлы паркета размером менее 150 МБ (например). Например, если все эти файлы создали файл паркета размером 300 МБ, я хочу разделить этот файл на 2 файла по 150 МБ.
Сейчас у меня есть только это, но он создает 1 файл паркета для 1 CSV, и это не то, что я ожидаю
Я ничего не нашел в Интернете... Единственное, что я видел:
< ul>
[*]читает с набором данных pyarrow, но я не могу, потому что мне нужны read_options, parse_options и Convert_options при чтении CSV
[*]и я использую open_input_stream, а не open_input_file, но я не знаю, что он делает...

А для экспорта в несколько файлов паркета я что-то не нашел...

Код: Выделить всё

from pyarrow import csv
from pyarrow import parquet
from pyarrow import fs

hdfs = fs.HadoopFileSystem("default")
with hdfs.open_input_file("path") as f:
csv_file = csv.read_csv(f)

parquet.write_table(csv_file, "newpath")
Заранее большое спасибо!!!

Подробнее здесь: https://stackoverflow.com/questions/784 ... th-pyarrow

Вернуться в «Python»