Разница между двумя синтаксисами соединения (pyspark) ⇐ Python
-
Anonymous
Разница между двумя синтаксисами соединения (pyspark)
У меня вопрос о разнице двух синтаксисов соединения в PySpark
Например, у меня есть эти два фрейма данных
DF1
Идентификатор ИМЯ 1 ОЛИВЕР 2 МАЙКЛ 3 ДЖАСТИН
DF2
Идентификатор адрес 1 БРАЗИЛИЯ 1 ФРАНЦИЯ 2 ПОРТУГАЛИЯ 2 АРГЕНТИНА 3 МЕКСИКА
Обычно я использую:
df1.join(df2, (col('df1.ID') == col('df2.ID')), 'left')
Но иногда я вижу, что люди используют:
df1.join(df2, 'ID', 'left')
Итак, мой вопрос: в чем разница между этими двумя кодами?
Я пытаюсь понять разницу между первым и вторым синтаксисом соединения.
У меня вопрос о разнице двух синтаксисов соединения в PySpark
Например, у меня есть эти два фрейма данных
DF1
Идентификатор ИМЯ 1 ОЛИВЕР 2 МАЙКЛ 3 ДЖАСТИН
DF2
Идентификатор адрес 1 БРАЗИЛИЯ 1 ФРАНЦИЯ 2 ПОРТУГАЛИЯ 2 АРГЕНТИНА 3 МЕКСИКА
Обычно я использую:
df1.join(df2, (col('df1.ID') == col('df2.ID')), 'left')
Но иногда я вижу, что люди используют:
df1.join(df2, 'ID', 'left')
Итак, мой вопрос: в чем разница между этими двумя кодами?
Я пытаюсь понять разницу между первым и вторым синтаксисом соединения.