Learning to recognize human actions: from hand-crafted to deep-learning based visual representations
Albert Clapés i Sintes · 2019
El reconocimiento de acciones es un reto de gran relevancia para la vision por computador. Los investigadores que se hallan trabajando en el campo aspiran a dotar a los ordenadores de la habilidad de percibir visualmente las acciones humanas - esto es observar, interpretar y comprender a partir de datos visuales los eventos que involucran humanos y que trascurren en el entorno fisico. Las apllcaclones de esta tecnologia son numerosas: interaccion hombre -maquina, e-salud, monltorlzacion/vldeovigllancia, u obtencion de vfdeocontenldo basado en contenido, entre otros. Los metodos de diseno manual han dominado el campo hasta los primeros exitos del aprendizaje profundo en el reconocimiento de acciones. Aunque estos ultimos obtuvieran peores resultados que los manualmente disenados, han mejorado lenta pero constantemente hasta convertirse hoy en estado del arte. No obstante, los metodos de diseno manual pueden resultar particularmente adecuados en ciertos escenarios, asi como cuando los datos de entrenamiento son escasos o, simplemente, para aportar un conocimiento adicional que las redes profundas no son capaces de aprender facilmente . Es por eso que a menudo encontramos ambos paradigmas combinados, consiguiendo una mejora de los resultados de los metodos en general. Esta tesis ha concurrido en el tiempo con este cambio de paradigma y, por tanto, lo refleja en sus dos partes claramente diferenciadas. En la primera parte, analizamos las posibles mejoras sobre los metodos ya existentes de diseno manual para el reconocimiento de acciones, y lo hacemos desde diferentes perspectivas. Haciendo uso de las trayectorias densas como fundamento de nuestro trabajo: primero, exploramos el uso de datos de entrada de diversas modalidades visuales y diferentes vistas para enriquecer los descriptores de las trayectorias. Segundo, nos centramos en la parte de clasificacion del reconocimiento de acciones, proponiendo un ensamblado de clasificadores que actuen sobre distintos conjuntos de caracteristicas y fusionando las salidas de estos con una estrategia basada en la Teorfa de Dempster -Shaf er. Y tercero, proponemos un nuevo metodo de diseno manual de extraccion de caracteristicas que construye una descripcion Intermedia para modelar de manera mas efectiva las dinamicas espaclotemporales de largo plazo presentes en los videos. La segunda parte de la tesis, empieza con un estudio exhaustivo de los metodos actuales de aprendizaje profundo para el reconocimiento de acciones. Analizamos las metodologias y presentamos una taxonomia que resume sus aspectos mas Importantes. Mas concretamente, analizamos y discutimos como las propuestas tratan la Informacion temporal de los datos. Por ultimo, pero no menos Importante, proponemos una nueva red de neuronas recurrente con conexiones residuales que integra de forma Implicita nuestras contribuciones previas en un marco teorico potente y experimentalmente prometedor.