В настоящее время я обучаю модель GRU американскому языку жестов (ASL) с использованием набора данных Kaggle,
при настройке параметров я достиг максимальной точности 44,7% при обучении и 28,2% при тестировании,
то есть после использования извлечения ключевых точек из видео, их нормализации и использования пула внимания перед передачей в классификатор
Я попробовал изменить скрытый размер, выпадение значения, количество слоев, но не смог преодолеть эти значения.
Я, честно говоря, не знаю, что еще я могу сделать, любые предложения приветствуются.
Ссылка на код: https://github.com/HmedNejjar/Sign-Language
Использованный мной набор данных: https://www.kaggle.com/datasets/risangb ... -processed
Использование: Python 3.12
PyTorch 2.6.0+cu124
MediaPipe 0.10.13
numpy 2.4.2