при настройке параметров я достиг максимальной точности 44,7% при обучении и 28,2% при тестировании,
то есть после использования извлечения ключевых точек из видео, их нормализации и использования пула внимания перед передачей в классификатор
Я попробовал изменить скрытый размер, выпадение значения, количество слоев, но не смог преодолеть эти значения.
Я, честно говоря, не знаю, что еще я могу сделать, любые предложения приветствуются.
Ссылка на код: https://github.com/HmedNejjar/Sign-Language
Использованный мной набор данных: https://www.kaggle.com/datasets/risangb ... -processed
Использование: Python 3.12
PyTorch 2.6.0+cu124
MediaPipe 0.10.13
numpy 2.4.2
OpenCV 4.13.0
Файлы для загрузки:
Ориентиры: Ручной ориентир Поза ориентира
Запустить в терминале
Код: Выделить всё
Invoke-WebRequest -Uri 'Landmarker link' -OutFile "'landmarker'.task"Порядок запуска программ:
- precompute.py
- train.py
- main.py