Pandas не может читать файлы паркета, созданные в PySparkPython

Программы на Python
Anonymous
Pandas не может читать файлы паркета, созданные в PySpark

Сообщение Anonymous »

Я пишу файл паркета из Spark DataFrame следующим образом:

Код: Выделить всё

df.write.parquet("path/myfile.parquet", mode = "overwrite", compression="gzip")
При этом создается папка с несколькими файлами.

Когда я пытаюсь прочитать это в пандах, я получаю следующие ошибки, в зависимости от того, какой парсер я использую:

Код: Выделить всё

import pandas as pd
df = pd.read_parquet("path/myfile.parquet", engine="pyarrow")
PyArrow:


Файл "pyarrow\ error.pxi», строка 83 в pyarrow.lib.check_status

ArrowIOError: Неверный файл паркета. Поврежденный нижний колонтитул.


fastparquet:


Файл «C:\Program Files\Anaconda3\lib\site-packages\fastparquet\util.py», строка 38, в default_open
return open(f, mode)

PermissionError: [Errno 13] Разрешение отклонено: 'path/myfile.parquet'


Я использую следующие версии:
  • Spark 2.4.0
  • Pandas 0.23.4
    pyarrow 0.10.0
  • fastparquet 0.2.1
Я пробовал gzip, а также мгновенное сжатие. Оба не работают. Я, конечно, позаботился о том, чтобы файл находился в месте, где Python имеет разрешения на чтение/запись.

Было бы уже полезно, если бы кто-нибудь смог воспроизвести эту ошибку.

Подробнее здесь: https://stackoverflow.com/questions/542 ... in-pyspark

Вернуться в «Python»