Visual Object Class Recognition using Local Descriptions

Alexandra Teynor · FreiDok plus (Universitätsbibliothek Freiburg) · 2009

Die vorliegende Arbeit beschäftigt sich mit der Erkennung von Elementen visueller Objektklassen in digitalen Bildern, eine Aufgabe, die sich beispielsweise bei der Verwaltung großer Bild- und Videodatenbanken stellt. Bilder, die bestimmte Objekte enthalten, sollen leicht (wieder-) gefunden werden. Ziel ist es, Verfahren zu entwickeln, die nur auf den Bilddaten selbst beruhen. Das grundlegende Prinzip der in dieser Arbeit vorgestellten Methoden ist dabei die Verwendung von lokalen, visuellen Merkmalen, die aus den Bildern extrahiert werden. Die Arbeit besitzt zwei Schwerpunkte: der erste Teil beschäftigt sich mit der Identifikation und der Repräsentation von Objektteilen. Der zweite Teil beleuchtet Methoden, wie die Objektteile miteinander in (örtliche) Verbindung gesetzt werden können, um damit verschiedene Objektklassen zu modellieren. Im Folgenden werden die beiden Schwerpunkte kurz beschrieben. Identifikation von Teilen Um Orte für die lokale Merkmalsextraktion zu bestimmen, werden Punkte mit gewünschten Eigenschaften identifiziert. Welchen Kriterien diese Punkte entsprechen müssen, hängt von der Anwendung ab. Die Analyse einer Vielzahl von Detektoren zeigte, dass eine zu frühe Beschränkung der Art der detektierten Strukturen die Klassifikationsleistung negativ beeinflusst. Der von uns in dieser Arbeit verwendete Loupias-Detektor besitzt diesbezüglich sehr gute Eigenschafen. Er beruht auf einer Waveletanalyse des Signals, liefert in seiner Originalversion jedoch keine Größeninformation. Daher wurde dieser Detektor mit Hilfe eines Skalenselektionsverfahrens erweitert. Mit diesem neuen Detektor konnten bei Tests hervorragende Ergebnisse erzielt werden. An den detektierten Stellen im Bild werden verschiedene Merkmale berechnet, welche die lokale Struktur beschreiben. Diese Merkmale werden zur Konstruktion von Teilewörterbüchern verwendet, deren Einträge als Bausteine zur Erstellung von Objektklassenmodellen dienen. In dieser Arbeit konnte gezeigt werden, dass komplizierte, zeitintensive Verfahren, welche die genaue Anordnung der Lernstichproben in Merkmalsräumen berücksichtigen, zur Bestimmung der Prototypteile nicht nötig sind. Vielmehr reicht ein einfaches, sequenzielles Verfahren (MBSAS-clustering) aus, um geeignete Teilewörterbücher zu erzeugen. Die Berechnungszeit solcher Wörterbücher konnte von mehreren Tagen auf wenige Stunden reduziert werden. In herkömmlichen Teilewörterbüchern werden nur visuell ähnliche Strukturen zu Prototypteilen zusammengefasst. Bestimmte, semantisch äquivalente Teile eines Objekts können jedoch sehr unterschiedliche visuelle Ausprägungen haben. In dieser Arbeit wurde ein Verfahren entwickelt, visuell unterschiedliche, aber semantisch ähnliche Teile zu assoziieren. Dies geschieht mit Hilfe eines semantischen Ähnlichkeitsmaßes, das auf örtlichen Auftretensverteilungen beruht. Assoziation von Teilen zur Objektmodellierung Im zweiten Teil der Arbeit werden verschiedene Verfahren vorgestellt, einzelne Prototypen aus den Teilewörterbüchern zueinander in Verbindung zu setzten. Die Auswertung der relativen Position von Paaren lokaler Teile führt zu sogenannten cluster co-occurrence Matrizen. Diese Matrizen wurden als Merkmale zur Klassifikation von Röntgenaufnahmen eingesetzt. Damit konnten im "ImageCLEF medical image annotation" Wettbewerb in den Jahren 2006 und 2007 ausgezeichnete Ergebnisse erzielt werden. Mit Hilfe lokaler Teile kann neben der Klassifikation auch die exakte Position eines Objektes im Bild ermittelt werden. Im Rahmen dieser Arbeit wurde eine Methode entwickelt, die nicht nur die Lage und Größe eines Objekts, sondern auch dessen Orientierung erkennt. Diese beruht auf einem Hough-Mehrheitsverfahren und beachtet die Orientierung der einzelnen Detektionen im Bild. Bei Verfahren zur Bestimmung der wahrscheinlichen Lageparameter eines Objekts liegt die Annahme zugrunde, dass ein Objekt der Klasse im Bild vorhanden ist. Ob dies tatsächlich der Fall ist, wird nicht überprüft. Daher wird in dieser Arbeit vorgeschlagen, die Positionsparameterbestimmung mit der Erzeugung von lokalen Teilehistogrammen zu kombinieren, um damit eine Klassifikation von Bildern zu ermöglichen. Von Regionen mit einer hohen Auftretenswahrscheinlichkeit für das Objekt werden lokale Histogramme berechnet. Um die Klassifikationssicherheit von herkömmlichen regionenbasierten Histogrammen zu steigern, wurden SCP (spatially coherent parts) Histogramme entwickelt. Diese bestehen nur aus den Teilen, die für eine bestimmte Parameterkombination eines Objektes gestimmt haben. Dadurch entstehen Vorteile bei teilweise verdeckten Objekten sowie Objekten, durch die der Hintergrund durchscheint. Ein Test der neuen Verfahren auf einer schwierigen Fahrraddatenbank hat deren klare Überlegenheit gegenüber globalen Histogrammansätzen gezeigt.

Read the paper · More papers on PaperTik