У меня есть большой набор данных, сохраненный в виде файла .npy. Объем данных превышает объем доступной оперативной памяти, поэтому загрузка всего набора данных одновременно невозможна. Я хотел бы использовать Dataset и DataLoader PyTorch для создания небольших пакетов и перебора их. Мой конвейер работает, когда я использую одного работника (num_workers=0), но не работает, когда я устанавливаю num_workers > 0.
Я нашел в Интернете несколько предложений, одно из которых заключалось в добавлении np. load(file, mmap_mode='r') внутри метода getitem в наборе данных PyTorch.
Я попробовал это решение, но оно все равно не сработало. Мне интересно, сможет ли кто-нибудь помочь мне решить эту проблему.
Подробнее здесь: https://stackoverflow.com/questions/790 ... emmap-file