Изменить структуру таблицы с помощью PySparkPython

Программы на Python
Anonymous
Изменить структуру таблицы с помощью PySpark

Сообщение Anonymous »

После переноса этих таблиц в домик у озера мне трудно изменить составную структуру:
таблица до
В фактическую таблицу с моими значениями:
таблица после
Очевидно, каждая строка объединяется в ячейку.
пример: cell1 ["$) 1 октября 2021 г.","34 969–60 431","64 042","66 432","68 824","71 212","73 607","75 500"]
должно быть $) 1 октября 2021 г. | с 34 969 до 60 431 | 64,042 |66,432 68,824 |71,212 |73,607 |75,500
и ячейка 2 должна перейти во вторую строку и т. д.
код, который я использую после загрузка table_before в df:
Получить имена столбцов из df_1
df_1_columns = df_1.columns
Получить первую строку df_1 (при условии, что эта строка содержит данные, которые будут использоваться для строк)
row_data = df_1.collect()[0] # Получить первую строку
Инициализировать пустой список для хранения новых строк
new_rows = []
Пройти по каждой ячейке в строке< /h1>
для ячейки в row_data:
if isinstance(cell, str): # Убедитесь, что ячейка является строкой
# Предполагается, что ячейка содержит список значений, разделенных запятыми
list_data = cell.split(',') # Разделить строку запятыми
# Создать новый объект Row из элементов списка
new_row = Row(*list_data)
new_rows.append(new_row)
Преобразуйте новые строки в DataFrame
new_df = spark.createDataFrame(new_rows)
Переименуйте столбцы new_df, используя столбцы df_1
new_df_renamed = new_df.toDF(*df_1_columns)
Покажите преобразованный DataFrame
new_df_renamed.show(truncate=False)`
но я получаю следующую ошибку: ValueError: невозможно вывести схему из пустого набора данных
Также это это не строка, а массив(строка)
пробовал несколько вещей и пока не нашел правильного решения.

Подробнее здесь: https://stackoverflow.com/questions/789 ... th-pyspark

Вернуться в «Python»