Я планирую обучить модель YOLOv11 с данными, аннотированными в Roboflow, используя 6 классов:
- счастливый, грустный, злой, нейтральный, пугливый, сонный
Я думаю, что моя стратегия сбора изображений может быть слабым местом, поэтому мне нужен совет конкретно по поводу как следует захватывать обучающие изображения.
Текущий подход:
- В основном лица фронтально
- Чистый фон
- Хорошее освещение
- Лицо заполняет ~60–80 % кадра
- Некоторые вариации (ракурсы, освещение, разные люди)
- 50 изображений в очках / 50 без
- Следует ли сохранять изображения чистыми или включать больше реального шума (фоновый беспорядок, разные расстояния, и т.д.)?
- Какое разнообразие полезно?
- Боковые углы?
- Слабый свет/тени?
- Окклюзии (волосы, руки и т. д.)?
- Не слишком ли мало 100 изображений на класс, даже с использованием дополнений в Roboflow?
- Каких распространенных ошибок в наборах данных об эмоциях мне следует избегать?
(особенно сбивают с толку классы, такие как сонный или нейтральный)
Это университетский проект, поэтому я не стремлюсь к идеальной точности — просто модель, которая достаточно хорошо работает в режиме реального времени.