Robust Visual Features for Long-Term Monitoring

Assia Benbihi · 2020

Points d’intérêts invariants pour la surveillance d’environnements extérieurs à long terme L’inspection visuelle consiste à observer une scène et mesurer ses changements. Parmi ses nombreuses applications figurent la conduite autonome, l’inspection industrielle ou encore la réalité augmentée. La principale difficulté pour une machine consiste à reconnaitre une scène malgré qu’elle puisse changer d’apparence. C’est sur cette problématique que se concentre cette thèse et plus particulièrement sur la reconnaissance à long terme de scènes bucoliques, comme la rive d’un lac au fil des saisons. Le but est ensuite de quantifier les variations de cette scène. L’approche adoptée se divise en deux étapes : la reconnaissance de la scène puis la mise en correspondance de zones locales de celle-ci. La reconnaissance visuelle se base sur des représentations du contenu de l’image telles que deux images d’une même scène ont des descriptions similaires, et ce même lorsque l’apparence visuelle de la scène a changé. Une des contributions majeures de cette thèse est la définition de deux descripteurs d’image reposant sur la géométrie et la sémantique de la scène. Etant donnée que ces deux informations sont globalement invariantes au temps, les descripteurs le sont également. Comparés à l’état de l’art, ces descripteurs sont parmi les plus performants pour la reconnaissance de scènes bucoliques et généralisent même aux scènes urbaines.Pour mettre en correspondance des zones locales d’une image, ce sont leursdescriptions locales qui doivent être invariantes. L’approche adoptée dans cette thèse est d’identifier les zones locales de l’image qui restent invariantes en exploitant la structure de l’espace image de réseaux de neurones déjà entrainés sur une tâche visuelle quelconque. Les représentations locales qui en résultent sont tout aussi pertinentes pour la mise en correspondance d’image que celles issues d’un apprentissage profond spécifique.Enfin, cette thèse introduit deux méthodes d’apprentissage visant à réduire le volume de données nécessaires à l’entrainement de réseaux de neurones pour la segmentation sémantique. En plus de pouvoir s’intégrer à la description d’image, les information sémantiques permettent de rendre d’autres applications visuelles plus robustes aux changement d’apparence. Ceci est illustré par un exemple appliqué au cas de l’odométrie visuelle directe.

Read the paper · More papers on PaperTik