Я нашел способ прочитать большой файл CSV с параметром chunksize
Код: Выделить всё
%%time
import time
filename = "../code/csv/file.csv"
lines_number = sum(1 for line in open(filename))
lines_in_chunk = 100# I don't know what size is better
counter = 0
completed = 0
reader = pd.read_csv(filename, chunksize=lines_in_chunk)
но проблема в конкатенации
Код: Выделить всё
%%time
df = pd.concat(reader,ignore_index=True)
Использование оперативной памяти также продолжает расти
есть ли способ быстрее и эффективнее объединить этот файл чтения?
Подробнее здесь: https://stackoverflow.com/questions/571 ... t-too-slow