Detection and evaluation methods for local image and video features
Julian Stöttinger · reposiTUm (TU Wien) · 2010
Lokale Features, also räumlich begrenzte Beschreibungen von visuellem Inhalt, sind in der Computer Vision das Werkzeug der Wahl zum Erkennen von Bildern und Videos. Diese Doktorarbeit beschäftigt sich mit dem Auffinden der besten Positionen und der richtigen Skalierung von lokalen Features. Der wissenschaftlicher Beitrag der Arbeit besteht zum einen im Entdecken von neuen Wegen, die Lage von Features zu bestimmen, zum anderen im Erkunden von neuen Evaluierungsmethoden derselbigen. Dies beinhaltet sowohl rein räumliche Features (``2D'' oder Bildfeatures) als auch räumlich-zeitliche Features (``3D'' oder Videofeatures). Die Arbeit zeigt, dass das Auffinden von robusten und wiedererkennbaren Features auf die Erkennungsrate von aktuellen Klassifikationssystemen einen großen Einfluss hat. Deswegen ist es entscheidend, die richtigen Features für bestimmte Aufgaben zu nutzen. Im Bereich der Bildfeatures beschäftigt sich die Arbeit mit der Frage, ob es möglich ist, die Anzahl der Features zu reduzieren und gleichzeitig die Erkennungsrate zu erhalten. Da die Featureextrakion den ersten Schritt eines Klassifizierungssystems darstellt, reduziert ein Minimum der Features jeden nachfolgenden Berechnungsschritt und verkürzt so die Berechnungszeit entscheidend. In Bereichen, wo Rechenzeit sehr knapp bemessen ist, könnte dies neue Anwendungen ermöglichen, zum Beispiel in mobilen -- und Echtzeit Systemen. Forschungsschwerpunkt ist das Nutzen von Farbinvarianzen und --salienzen beim Auffinden von skalierungsunabhängigen Bildfeatures. Diese neuartigen Bildfeatures erweisen sich als äußerst stabil gegen Veränderung durch Beleuchtung und Schatten und erlauben so eine robustere Beschreibung des Bildinhaltes. Mit dieser Methode können Bilder in großen Datenbanken mit weniger Features leichter gefunden werden. In einem internationalen Wettbewerb von aktuellen Bildfeatures erreichten die vorgestellten farbbasierten Bildfeatures die beste Erkennungsrate in vier von 20 Klassen, während gleichwertige Methoden ein Vielfaches der Anzahl der Features benutzten. Weiters untersucht die Arbeit den Gradient Vector Flow zum Finden von Bildfeatures. Da diese Methode Bildstrukturen im größeren Umfang als bestehende Methoden untersucht, erlaubt sie eine äußerst stabile, skalierungsunabhängige Featureextraktion von hoher Dichte. In den letzten Jahren wurde das Auffinden von stabilen Videofeatures ein begehrtes Forschungsgebiet der Computer Vision. Die erfolgreichsten Bildfeatures wurden um die zeitliche Dimension erweitert, und Klassifizierungssysteme erlauben an Hand dieser Features das Erkennen von Handlungen in Videos. Im Unterschied zu Bildfeatures wurden Videofeatures noch nicht in einer stringenten und systematischen Art und Weise auf ihre Robustheit untersucht. Diese Arbeit schließt diese Lücke und stellt eine neuartige Datenbank zur Verfügung. Diese Datenbank von 1710 Videos erlaubt Forschern neue Videofeatures unter acht verschiedenen, wohl definierten, iterativen Veränderungen der Videos zu testen. Evaluierung erfolgt auf einem effizienten 3D Repeatablity Test für Videofeatures pro Veränderung der Videos. Um die Robustheit von lokalen Beschreibungen in Videos zu messen, wurde ein neuartiges Verfahren entwickelt, das die Evaluierung der Videobeschreibung abhängig von den Veränderungen in den Videos erlaubt.