Код вывода большой модели разработан на основе PyTorch. Код работает на восьми графических процессорах. Во время работы во время профилирования создается пул процессов. Размер процесса в пуле процессов составляет половину количества логических ядер ЦП. Я обнаружил, что мой код застревает в коде, создающем пул процессов, и вся машина зависает. Сервер имеет 92 логических ядра ЦП и 1 ТБ памяти. Вывод верхней команды показывает, что ресурсов ЦП и памяти достаточно.
Версия Python — 3.8
Код: Выделить всё
pool = multiprocessing.Pool(processes=os.cpu_count() // 2)
Подробнее здесь:
https://stackoverflow.com/questions/782 ... ng-large-m