Incremental learning of events in video using reliable information

Marcos D. Zuniga · OpenGrey (Institut de l'Information Scientifique et Technique) · 2008

L objectif de cette thèse est de proposer une approche générale de compréhension de vidéo pour l apprentissage et la reconnaissance d événements, dans des applications du monde réel. L approche est composée de quatre t aches : En premier lieu, pour chaque frame de la vidéo, une tâche de segmentation consiste à détecter les régions mobiles, lesquelles sont représentées par des boîtes englobantes qui les délimitent. En second lieu, une nouvelle méthode de classification 3D associe à chaque région mobile un label de la classe d objet (par exemple, personne, voiture) et un parallélépipède 3D décrit par sa largeur, sa hauteur, sa longueur, sa position, son orientation, et des mesures de fiabilité associées à ces attributs. En troisième lieu, une nouvelle approche de suivi d objets multiples utilise ces descriptions d objet pour générer des hypothèses de suivi par rapport aux objets évoluant dans la scène. Des mesures de fiabilité associées aux attributs des objets suivis sont utilisées pour faire une sélection appropriée d information pertinente. En dernier lieu, une nouvelle approche d apprentissage incrémental d événements agrège en ligne les attributs et l information de fiabilité des objets suivis afin d apprendre des concepts qui décrivent les événements se déroulant dans la scène. Des mesures de fiabilité sont utilisées pour focaliser le processus d apprentissage sur l information la plus pertinente. Simultanément, l approche d apprentissage d événements reconnaît des événements associés aux objets suivis dans la scène. L approche de suivi d objets a été validée en utilisant des benchmarks de videosurveillance libres d accès. L approche complète de compréhension de vidéo a été évaluée en utilisant des vidéos obtenues d une application réelle de maintien de personnes âgées à domicile. L approche a été capable d apprendre avec succès des événements associés aux trajectoires (e.g. le changement dans la position 3D et la vitesse), la posture (e.g. se lever, s accroupir), et l interaction entre objets (e.g. une personne s approchant d une table), parmi d autres événements, avec un effort minimal de configuration.

Read the paper · More papers on PaperTik