Вопрос:
Я разрабатываю простую игру с картой, игроком и врагами. Цель игры состоит в том, чтобы игрок набирал очки на карте, избегая при этом попадания в руки врагов. Я реализовал Модель и Агент для изучения игры с помощью обучения с подкреплением. Однако я столкнулся с проблемами, связанными со снижением производительности агента с течением времени.
Подробности:
В настоящее время входной уровень агента получает:
Текущее направление (0 или 1)
Действительные направления (0 или 1)
Текущее положение агента (значения пикселей)
Позиции врагов (значения пикселей)
Позиции очков, которые нужно собрать (значения пикселей)
Проблема:
Я заметил, что производительность агента ухудшается с увеличением количества сыгранных игр. . Я подозреваю, что это может быть связано с тем, как я кодирую входные данные, особенно с точными значениями пикселей для позиций. Я подумываю о нормализации этих входных данных до значений от 0 до 1, но не уверен, как эффективно представить позиционную информацию таким образом, чтобы улучшить обучение.
Вопросы:Должны ли все входные данные входного слоя быть нормализованы до значений от 0 до 1?
Как я могу эффективно закодировать текущее положение игрока и врагов?
Каковы некоторые рекомендации для этого? представление данных о направлении и положении в моделях обучения с подкреплением?
Поиск в Google, YouTube и т. д. — обычное дело
Подробнее здесь: https://stackoverflow.com/questions/787 ... imple-game