Ошибка Pyspark DataframeType a: DoubleType не может принять объект «a» типа <класс «str»>

Ошибка Pyspark DataframeType a: DoubleType не может принять объект «a» типа <класс «str»> ⇐ Python

1 сообщение • Страница 1 из 1

Anonymous

Ошибка Pyspark DataframeType a: DoubleType не может принять объект «a» типа <класс «str»>

Цитата

Сообщение Anonymous » 06 янв 2026, 01:04

У меня есть эта функция
customSchema = StructType([ \
StructField("a", Doubletype(), True), \
StructField("b", Doubletype(), True),
StructField("c", Doubletype(), True),
StructField("d", Doubletype(), True)])

n_1= sc.textFile("/path/*.txt")\
.mapPartitions(lambda partition: csv.reader([line.replace('\0','') for line in partition],delimiter=';', quotechar='"')).filter(lambda line: len(line) > 1 )\
.toDF(customSchema)

который создаст Dataframe, проблема в том, что .mapPartitions будет использовать в качестве типа по умолчанию , и мне нужно привести его к DoubleType, прежде чем преобразовать его в Dataframe. Есть идеи?
Пример данных
[['0,01', '344,01', '0,00', '0,00']]

или просто работайте с
n_1= sc.textFile("/path/*.txt")\
.mapPartitions(lambda partition: csv.reader([line.replace('\0','') for line in partition],delimiter=';', quotechar='"')).filter(lambda line: len(line) > 1 )\

Подробнее здесь: https://stackoverflow.com/questions/628 ... n-type-cla

1767650660

Anonymous

У меня есть эта функция
customSchema = StructType([ \
StructField("a", Doubletype(), True), \
StructField("b", Doubletype(), True),
StructField("c", Doubletype(), True),
StructField("d", Doubletype(), True)])

n_1= sc.textFile("/path/*.txt")\
.mapPartitions(lambda partition: csv.reader([line.replace('\0','') for line in partition],delimiter=';', quotechar='"')).filter(lambda line: len(line) > 1 )\
.toDF(customSchema)


который создаст Dataframe, проблема в том, что .mapPartitions будет использовать в качестве типа по умолчанию , и мне нужно привести его к DoubleType, прежде чем преобразовать его в Dataframe. Есть идеи?
[b]Пример данных[/b]
[['0,01', '344,01', '0,00', '0,00']]

или просто работайте с
n_1= sc.textFile("/path/*.txt")\
.mapPartitions(lambda partition: csv.reader([line.replace('\0','') for line in partition],delimiter=';', quotechar='"')).filter(lambda line: len(line) > 1 )\

 

Подробнее здесь: [url]https://stackoverflow.com/questions/62819095/pyspark-dataframetype-error-a-doubletype-can-not-accept-object-a-in-type-cla[/url]