Statistical Local Appearance Models for Object Recognition

David Guillamet Monfulleda · TDX (Tesis Doctorals en Xarxa) · 2004

Durant els ultims anys, hi ha hagut un interes creixent en les tecniques de reconeixement d'objectes basades en imatges, on cadascuna de les quals es correspon a una aparenca particular de l'objecte. Aquestes tecniques que unicament utilitzen informacio de les imatges son anomenades tecniques basades en l'aparenca i l'interes sorgit per aquestes tecniques es degut al seu exit a l'hora de reconeixer objectes. Els primers metodes basats en l'aparenca es recolzaven unicament en models globals. Tot i que els metodes globals han estat utilitzats satisfactoriament en un conjunt molt ampli d'aplicacions basades en la visio per computador (per exemple, reconeixement de cares, posicionament de robots, etc), encara hi ha alguns problemes que no es poden tractar facilment. Les oclusions parcials, canvis excessius en la il·luminacio, fons complexes, canvis en l'escala i diferents punts de vista i orientacions dels objectes encara son un gran problema si s'han de tractar des d'un punt de vista global. En aquest punt es quan els metodes basats en l'aparenca local van sorgir amb l'objectiu primordial de reduir l'efecte d'alguns d'aquests problemes i proporcionar una representacio molt mes rica per ser utilitzada en entorns encara mes complexes. Usualment, els metodes basats en l'aparenca local utilitzen descriptors d'alta dimensionalitat a l'hora de descriure regions locals dels objectes. Llavors, el problema de la malediccio de la dimensionalitat (curse of dimensionality) pot sorgir i la classificacio dels objectes pot empitjorar. En aquest sentit, un exemple tipic per alleujar la malediccio de la dimensionalitat es la utilitzacio de tecniques basades en la reduccio de la dimensionalitat. D'entre les possibles tecniques per reduir la dimensionalitat, es poden utilitzar les transformacions lineals de dades. Basicament, ens podem beneficiar de les transformacions lineals de dades si la projeccio millora o mante la mateixa informacio de l'espai d'alta dimensio original i produeix classificadors fiables. Llavors, el principal objectiu es la modelitzacio de patrons d'estructures presents als espais d'altes dimensions en espais de baixes dimensions. La primera part d'aquesta tesi utilitza primordialment histogrames color, un descriptor local que ens proveeix d'una bona font d'informacio relacionada amb les variacions fotometriques de les regions locals dels objectes. Llavors, aquests descriptors d'alta dimensionalitat es projecten en espais de baixes dimensions tot utilitzant diverses tecniques. L'analisi de components principals (PCA), la factoritzacio de matrius amb valors no-negatius (NMF) i la versio ponderada del NMF son 3 transformacions lineals que s'han introduit en aquesta tesi per reduir la dimensionalitat de les dades i proporcionar espais de baixa dimensionalitat que siguin fiables i mantinguin les estructures de l'espai original. Una vegada s'han explicat, les 3 tecniques lineals son ampliament comparades segons els nivells de classificacio tot utilitzant una gran diversitat de bases de dades. Tambe es presenta un primer intent per unir aquestes tecniques en un unic marc de treball i els resultats son molt interessants i prometedors. Un altre objectiu d'aquesta tesi es determinar quan i quina transformacio lineal s'ha d'utilitzar tot tenint en compte les dades amb que estem treballant. Finalment, s'introdueix l'analisi de components independents (ICA) per modelitzar funcions de densitat de probabilitats tant a espais originals d'alta dimensionalitat com la seva extensio en subespais creats amb el PCA. L'analisi de components independents es una tecnica lineal d'extraccio de caracteristiques que busca minimitzar les dependencies d'alt ordre. Quan les seves assumpcions es compleixen, es poden obtenir caracteristiques estadisticament independents a partir de les mesures originals. En aquest sentit, el ICA s'adapta al problema de reconeixement estadistic de patrons de dades d'alta dimensionalitat. Aixo s'aconsegueix utilitzant representacions condicionals a la classe i un esquema de decisio de Bayes adaptat especificament. Degut a l'assumpcio d'independencia aquest esquema resulta en una modificacio del classificador ingenu de Bayes. El principal inconvenient de les transformacions lineals de dades esmentades anteriorment es que no consideren cap tipus de relacio espacial entre les caracteristiques locals. Consequentment, es presenta un metode per reconeixer objectes tridimensionals a partir d'imatges d'escenes complexes, tot utilitzant un unic model apres d'una imatge de l'objecte. Aquest metode es basa directament en les caracteristiques visuals locals extretes de punts rellevants dels objectes i te en compte les relacions espacials entre elles. Aquest nou esquema redueix l'ambiguitat de les representacions anteriors. De fet, es presenta una nova metodologia general per obtenir estimacions fiables de distribucions conjuntes de vectors de caracteristiques locals de multiples punts rellevants dels objectes. Per fer-ho, definim el concepte de k-tuples per poder representar l'aparenca local de l'objecte a k punts diferents i al mateix moment les dependencies estadistiques entre ells. En aquest sentit, el nostre metode s'adapta a entorns complexes i reals demostrant una gran habilitat per detectar objectes en aquests escenaris amb resultats molt prometedors. During the last few years, there has been a growing interest in object recognition techniques directly based on images, each corresponding to a particular appearance of the object. These techniques which use only information of images are called appearance based models and the interest in such techniques is due to its success in recognizing objects. Earlier appearance-based approaches were focused on the use of holistic approaches. In spite of the fact that global representations have been successfully used in a broad set of computer vision applications (i.e. face recognition, robot positioning, etc), there are still some problems that can not be easily solved. Partial object occlusions, severe lighting changes, complex backgrounds, object scale changes and different viewpoints or orientations of objects are still a problem if they should be faced under a holistic perspective. Then, local appearance approaches emerged as they reduce the effect of some of these problems and provide a richer representation to be used in more complex environments. Usually, local appearance methods use high dimensional descriptors to describe local regions of objects. Then, the curse of dimensionality problem appears and object classification degrades. A typical example to alleviate the curse of dimensionality problem is to use techniques based on dimensionality reduction. Among possible reduction techniques, one could use linear data transformations. We can benefit from linear data transformations if the projection improves or mantains the same information of the high dimensional space and produces reliable classifiers. Then, the main goal is to model low dimensional pattern structures present in high dimensional data. The first part of this thesis is mainly focused on the use of color histograms, a local descriptor which provides a good source of information directly related to the photometric variations of local image regions. Then, these high dimensional descriptors are projected to low dimensional spaces using several techniques. Principal Component Analysis (PCA), Non-negative Matrix Factorization (NMF) and a weighted version of NMF, the Weighted Non-negative Matrix Factorization (WNMF) are 3 linear transformations of data which have been introduced in this thesis to reduce dimensionality and provide reliable low dimensional spaces. Once introduced, these three linear techniques are widely compared in terms of performances using several databases. Also, a first attempt to merge these techniques in an unified framework is shown and results seem to be very promising. Another goal of this thesis is to determine when and which linear transformation might be used depending on the data we are dealing with. To this end, we introduce Independent Component Analysis (ICA) to model probability density functions in the original high dimensional spaces as well as its extension to model subspaces obtained using PCA. ICA is a linear feature extraction technique that aims to minimize higher-order dependencies in the extracted features. When its assumptions are met, statistically independent features can be obtained from the original measurements. We adapt ICA to the particular problem of statistical pattern recognition of high dimensional data. This is done by means of class-conditional representations and a specifically adapted Bayesian decision scheme. Due to the independence assumption this scheme results in a modification of the naive Bayes classifier. The main disadvantage of the previous linear data transformations is that they do not take into account the relationship among local features. Consequently, we present a method of recognizing three-dimensional objects in intensity images of cluttered scenes, using a model learned from one single image of the object. This method is directly based on local visual features extracted from relevant keypoints of objects and takes into account the relationship between them. Then, this new scheme reduces the ambiguity of previous representations. In fact, we describe a general methodology for obtaining a reliable estimation of the joint distribution of local feature vectors at multiple salient points (keypoints). We define the concept of k-tuple in order to represent the local appearance of the object at k different points as well as the statistical dependencies among them. Our method is adapted to real, complex and cluttered environments and we present some results of object detection in these scenarios with promising results.

Read the paper · More papers on PaperTik