У меня есть файл JSON со ссылками примерно на 320 тысяч PDF-файлов. Мне нужно получить все эти файлы. Благодаря моей работе у нас есть большой объем хранилища в NextCloud, а также доступ к Google Colab pro+.
Я подключил Google Colab к NextCloud с помощью этого руководства: https://rizkyrajitha.hashnode .dev/connect-nextcloud-with-google-colab
Я запускаю код через Google Colab, чтобы сэкономить свой дерьмовый Mac. Я просматриваю файл JSON, загружаю файлы и без проблем сохраняю их в папке NextCloud. Первые около 15 тыс. файлов выполняются быстро, но затем замедляются и в конце концов почти полностью останавливаются. Это большой объем данных, поэтому запускайте его локально.
Может ли кто-нибудь придумать лучшее решение для получения и хранения этого большого объема данных достаточно удобным способом или оптимизировать мою текущую идею? ?
Подробнее здесь: https://stackoverflow.com/questions/784 ... -json-file