В настоящее время я ищу проект или код, который может определять, когда человек говорит перед веб-камерой (или видео, предпочтительно веб-камерой), не полагаясь на звуковые сигналы. Для моих нужд простого обнаружения открытого рта недостаточно.
Я уже пробовал несколько проектов GitHub, но ни один из них не приблизился к корректной работе. Может ли кто-нибудь предложить проект или подход, который оказался успешным в решении аналогичных задач?
Заранее спасибо!
Подробнее здесь: https://stackoverflow.com/questions/786 ... g-visually