Как найти дубликаты группы строк внутри DataFrame? Или, другими словами, как я могу найти индексы определенного дублированного DataFrame внутри большего DataFrame?
Большой DataFrame:
индекс
0
1
0
0
1
1
2
3
2
4
4
3
0
1
4
2
3
< tr>
5
2
3
6
0
1
Конкретный дублированный DataFrame (или группа строк):
индекс
0< /th>
1
< td>0
0
1
1
2
3
Индексы, которые я ищу:
индекс
< tbody>
0
1
3
4
(Обратите внимание, что индексы дублированного DataFrame не имеют значения, только значения).
import pandas as pd
# larger DataFrame
lrg_df = pd.DataFrame([[0, 1], [2, 3], [4, 4], [0, 1], [2, 3], [2, 3], [0, 1]])
# group of rows (i.e., duplicated DataFrame)
dup_df = pd.DataFrame([[0, 1], [2, 3]])
# get indices of lrg_df that contain dup_df
indcs = lrg_df[lrg_df == dup_df].index # Doesn't work of course
Подробнее здесь: https://stackoverflow.com/questions/789 ... -dataframe