Я работаю над CSV-файлом, который включает столбец с датами, но dtype этого столбца на самом деле является просто объектом, поэтому я изменил его на datetime. Эта часть прошла без дефектов, данные не были изменены, кроме типа данных. Но когда я превращаю этот фрейм данных в файл паркета, он превращает каждую строку в одну и ту же дату, и это даже не в предыдущем формате даты.
Формат даты в csv: «%Y- %m-%d», как 29 января 2011 г. Это последние несколько шагов после работы с фреймом данных:
df_merged_CA["date"] = pd.to_datetime(df_merged_CA["date"], format = "%Y-%m-%d")
df_merged_CA.to_parquet("merged1.parquet", compression = "gzip", engine = "pyarrow")
Я проверил, имеет ли дата правильную форму после преобразования в дату и время, и она все еще была в форме 2011-01-29. После этого я проверил файл паркета, чтобы убедиться, что дата имеет правильную форму, однако я вижу, что каждая дата превращается в такие даты 43060-07-05.03:00:00.000 . Я увидел, что проблема может возникнуть из-за часового пояса, поэтому я изменил преобразование даты и времени на это, но ничего не изменилось.
df_merged_CA["date"] = pd.to_datetime(df_merged_CA["date"],
format = "%Y-%m-%d").dt.tz_localize('UTC').dt.tz_convert('Europe/Berlin')
Подробнее здесь: https://stackoverflow.com/questions/769 ... rquet-file