Потоковая передача данных в файлы Apache Parquet?Python

Программы на Python
Anonymous
Потоковая передача данных в файлы Apache Parquet?

Сообщение Anonymous »

У меня есть два потока данных ограниченной продолжительности (обычно 1–60 секунд), и я хочу сохранить их в сжатом файле данных для последующего извлечения. Сейчас я использую HDF5, но слышал о Parquet и хочу попробовать.
Поток 1:
Данные поступают в виде серии записей, примерно 2500 записей в секунду. Каждая запись представляет собой кортеж (метка времени, тег, данные) следующих размеров:
  • метка времени: 64-битное значение
    < li>тег: 8-битное значение
  • данные: октеты переменной длины (обычно около 100 байт на запись, иногда больше, иногда меньше)

    Поток 2:
    Данные поступают в виде серии записей, примерно 100 000 записей в секунду. Каждая запись представляет собой кортеж (метка времени, индекс, значение) следующих размеров:
  • метка времени: 64 бита
  • индекс: 16-битное значение
  • данные: 32-битное значение
Могу ли я сделать это с помощью Apache Parquet? Я совершенно новичок в этом + не могу найти нужную документацию; Я нашел документацию по чтению/записи целых таблиц, но в моем случае мне нужно постепенно записывать в таблицы пакеты по некоторому количеству строк (в зависимости от того, какой размер буфера я хочу использовать).
Я интересуюсь как Java, так и Python, и могу изучать оба языка, но я более свободно владею Python.
Я нашел эту страницу для pyarrow: https://arrow .apache.org/docs/python/parquet.html --- там говорится о группах строк и ParquetWriter и read_row_group(), но я не могу сказать, поддерживает ли это мой вариант использования.
Есть предложения?

Подробнее здесь: https://stackoverflow.com/questions/644 ... quet-files

Вернуться в «Python»