A Generic Middle Layer for Image Understanding

Kasim Terzić · 2011

Although humans can understand complex scenes with apparent ease, the problem remains difficult for artificial scene interpretation systems. A central problem facing such systems is reliable detection of objects present in a scene from raw image data. This thesis presents a probabilistic middle-layer architecture which can make use of high-level scene context to improve the detection and recognition of scene objects. The main features of the proposed middle layer are a novel contextual classification scheme, an intermediate-level representation of the scene in terms of object views, and accurate modelling of detection certainty. The architecture is generic and can be applied to any low-level algorithm which delivers class probabilities and any high-level reasoning system which implements the needed interface. The performance is evaluated on images from the facade domain using a wide range of low-level detectors and several high-level interpretation systems. Das Verstehen von komplexen Szenen ist eine leichte Aufgabe fur Menschen, bleibt aber nach wie vor schwierig fur kunstliche Szeneninterpretationssysteme. Dabei ist die zuverlassige Erkennung von Szenenobjekten in Bilddaten ein zentrales Problem. Diese Arbeit stellt eine probabilistische Architektur vor, die wissensbasierten Szenenkontext benutzen kann, um die Detektion und Erkennung von Szenenobjekten zu verbessern. Sie funktioniert dabei als Schnitstelle zwischen der Bildverarbeitungsalgorithmen und hoheren Szenenmodellen. Die Hauptmerkmale der vorgestellten Architektur sind ein neuer kontextbasierter Klassifikationsmechanismus, eine Zwischenreprasentation der Szene basierend auf Object Views und genaue Modellierung der Detektionsungenauigkeit. Die Architektur ist generisch aufgebaut und kann durch generische Schnittstellen mit verschiedenen probabilistischen Bildverarbeitungsalgorithmen kombiniert werden, sowie mit verschiedenen Systemen fur hohere Bilddeutung. Die Evaluierung der Architektur in der Kombination mit verschiedenen Bildverarbeitungs- und Bilddeutungsmodulen wurde auf Bilddaten aus der Fassadendomane durchgefuhrt.

Read the paper · More papers on PaperTik