Проблема, с которой я столкнулся, заключается в том, что когда я читаю фрейм данных, в нем отсутствуют подразделения и категории.
Это фрагмент:< /p>
Код: Выделить всё
import dask.dataframe as dd
df = dd.read_parquet('filename')
cat_columns= ['state', ...]
df= df.categorize(columns= cat_columns)
df = df.set_index('rn', drop=True, sorted=True, npartitions=None, divisions=None, sort=False)
df = df.persist(scheduler='single-threaded')
df.to_parquet('filename2',write_metadata_file=True, write_index=True, compute=True)
Код: Выделить всё
df2= dd.read_parquet('filename2')
df2.divisions
#above results in all None
df2.state.cat.categories
#above results : AttributeNotImplementedError: `df.column.cat.categories` with unknown categories is not supported.
Подробнее здесь: https://stackoverflow.com/questions/790 ... -dataframe