Небольшой набор данных (около 600 изображений) для обнаружения эмоций на лице с помощью YOLOv11 + Roboflow — как собратьPython

Программы на Python
Anonymous
Небольшой набор данных (около 600 изображений) для обнаружения эмоций на лице с помощью YOLOv11 + Roboflow — как собрать

Сообщение Anonymous »

Я создаю небольшой проект компьютерного зрения (MoodAI Player), в котором веб-камера распознает эмоции лица и запускает музыку + реакцию светодиодов на Raspberry Pi.
Я планирую обучить модель YOLOv11 с данными, аннотированными в Roboflow, используя 6 классов:
  • счастливый, грустный, злой, нейтральный, пугливый, сонный
Размер набора данных: ~600 изображений (по 100 на класс)
❓ Основная проблема (сбор данных)
Я думаю, что моя стратегия сбора изображений может быть слабым местом, поэтому мне нужен совет конкретно по поводу как следует захватывать обучающие изображения.
Текущий подход:
  • В основном лица фронтально
  • Чистый фон
  • Хорошее освещение
  • Лицо заполняет ~60–80 % кадра
  • Некоторые вариации (ракурсы, освещение, разные люди)
  • 50 изображений в очках / 50 без
🤔 Вопросы
  • Следует ли сохранять изображения чистыми или включать больше реального шума (фоновый беспорядок, разные расстояния, и т.д.)?
  • Какое разнообразие полезно?
    • Боковые углы?
    • Слабый свет/тени?
    • Окклюзии (волосы, руки и т. д.)?
  • Не слишком ли мало 100 изображений на класс, даже с использованием дополнений в Roboflow?
  • Каких распространенных ошибок в наборах данных об эмоциях мне следует избегать?

    (особенно сбивают с толку классы, такие как сонный или нейтральный)
🎯 Цель
Это университетский проект, поэтому я не стремлюсь к идеальной точности — просто модель, которая достаточно хорошо работает в режиме реального времени.

Вернуться в «Python»