Как сериализовать и читать метаданные в Dask DataframePython

Программы на Python
Anonymous
Как сериализовать и читать метаданные в Dask Dataframe

Сообщение Anonymous »

Я пытаюсь предварительно вычислить подразделения и категории dask для определенных столбцов в dask dataframe, затем сохранить данные как новый dataframe и повторно использовать их в дальнейшем .
Проблема, с которой я столкнулся, заключается в том, что когда я читаю фрейм данных, в нем отсутствуют подразделения и категории.
Это фрагмент:< /p>

Код: Выделить всё

import dask.dataframe as dd

df = dd.read_parquet('filename')
cat_columns= ['state', ...]
df= df.categorize(columns= cat_columns)
df = df.set_index('rn', drop=True, sorted=True, npartitions=None, divisions=None, sort=False)
df = df.persist(scheduler='single-threaded')
df.to_parquet('filename2',write_metadata_file=True, write_index=True, compute=True)

Код: Выделить всё

df2= dd.read_parquet('filename2')

df2.divisions
#above results in all None

df2.state.cat.categories
#above results :  AttributeNotImplementedError: `df.column.cat.categories` with unknown categories is not supported.
Мой вопрос: что я здесь делаю не так: сохраняет ли я кадр данных, загружаю или и то, и другое?


Подробнее здесь: https://stackoverflow.com/questions/790 ... -dataframe

Вернуться в «Python»