Эффективное хранение данных, которые еще не являются чисто столбчатыми, в формате ArrowPython

Программы на Python
Anonymous
Эффективное хранение данных, которые еще не являются чисто столбчатыми, в формате Arrow

Сообщение Anonymous »

Ранее я задавал вопрос, похожий на этот (в том смысле, что для иллюстрации проблемы используется тот же пример): эффективное хранение данных, которые еще не совсем столбчаты, в базе данных DuckDB.
Однако DuckDB не является Apache Arrow. В частности, невозможно вставлять данные в таблицу или массив Apache Arrow с помощью SQL-запросов, если только они не делают это косвенно.
Массивы стрелок создаются напрямую, так же, как и массивы Numpy. Мое предположение , исходя из того, что я понимаю из документации, вероятно, я хочу каким-то образом использовать тензоры стрелок. Я далеко не уверен, поэтому этот вопрос.
У меня есть некоторые частично столбчатые данные, подобные этим:

Код: Выделить всё

"hello", "2024 JAN", "2024 FEB"
"a", 0, 1
Если бы он был чисто столбчатым, он выглядел бы так:

Код: Выделить всё

"hello", "year", "month", "value"
"a", 2024, "JAN", 0
"a", 2024, "FEB", 1
Предположим, данные представлены в виде массива numpy, например:

Код: Выделить всё

import numpy as np

import numpy as np

data = np.array(
[["hello", "2024 JAN", "2024 FEB"], ["a", "0", "1"]], dtype="

Подробнее здесь: [url]https://stackoverflow.com/questions/78685004/efficiently-storing-data-that-is-not-yet-purely-columnar-into-the-arrow-format[/url]

Вернуться в «Python»