Я обыскал почти весь Интернет, и почему-то ни один из подходов не сработал в моем случае.
У меня есть два больших файла CSV (каждый с более чем миллионом строк и размером около 300-400 МБ). Они прекрасно загружаются во фреймы данных с помощью функции read_csv без необходимости использования параметра chunksize.
Я даже выполнял некоторые незначительные операции с этими данными, например создание новых столбцов. , фильтрация и т. д.
Однако, когда я пытаюсь объединить эти два кадра, я получаю MemoryError. Я даже пытался использовать SQLite для слияния, но тщетно. Операция длится вечность.
У меня компьютер с Windows 7 и 8 ГБ оперативной памяти. Версия Python — 2.7.
Спасибо.
Изменить: я тоже пробовал методы фрагментирования. Когда я это делаю, я не получаю сообщение об ошибке MemoryError, но использование оперативной памяти резко возрастает, и моя система выходит из строя.
Подробнее здесь: https://stackoverflow.com/questions/473 ... ata-frames