Understanding Image Sequences: the Role of Ontologies in Cognitive Vision

Carles Fernandez Tena · TDX (Tesis Doctorals en Xarxa) · 2010

La gran importancia i omnipresencia de la informacio digital ha posicionat el video com a vehicle preferent per a transmetre informacio, i ha donat lloc a un espectacular creixement en la generacio de multimedia a les xarxes socials i de material de video vigilancia. Aquesta situacio exigeix tot un seguit de necessitats tecnologiques que han motivat moltes iniciatives de recerca per la millora en la comprensio automatica del contingut en sequencies de video. Com a resposta, la recerca en sistemes de visio cognitiva estudia sistemes capacos de reconeixer esdeveniments complexos i adaptar-se a diferents tipus d'entorn, tot i fent servir coneixement de diversa naturalesa.En aquesta tesi ens proposem reconeixer i descriure el contingut de diferents situacions observades en sequencies de video de diferents dominis, i comunicar la informacio resultant a usuaris externs per mitja d'interficies d'interaccio home-maquina avancades. Aquest problema s'aborda mitjancant el disseny dels moduls d'alt nivell d'un sistema de visio cognitiva que empra models ontologics. Concretament, ens proposem: (i) fer que el sistema s'adapti a diferents escenaris dins del domini urba, i aprengui automaticament les caracteristiques semantiques de les regions que hi apareixen (carretera, vorera, pas de vianants, zones d'espera, parquings); (ii) que raoni sobre informacio incerta, incompleta o imprecisa, tant de tipus visual (cameres) com de tipus linguistic (usuaris); (iii) que generi interpretacions sensates d'esdeveniments complexes a partir de l'analisi de dades espai-temps mes basiques; (iv) que disposi d'interficies de comunicacio natural que puguin solventar les necessitats dels usuaris; i finalment, (v) trobar mecanismes que ens facilitin el disseny, manteniment i extensio dels models implicats, i formes de combinar sinergicament totes les tasques descrites en un unic sistema funcional. Per tal d'avaluar de forma intel·ligent continguts de video es necessari adoptar tecniques avancades de manipulacio de la informacio. La nostra aproximacio opta per seguir els principis dels sistemes de visio cognitiva. Per a fer-ho, utilitzem processos d'aprenentatge basats en inferencia sobre models grafics de Markov per a l'identificacio de regions semantiques en diferents escenaris; conceptualitzacio d'informacio provinent de sistemes de seguiment per tal d'obtenir conceptes atomics en logica difusa, raonadors que extreuen inferencies de combinacions d'aquests conceptes, i arbres de grafs de situacio (SGTs) per a interpretar automaticament el contingut de videos; processos de parsing basats en representacio del discurs i semantica cognitiva per a implementar moduls de comunicacio linguistica, tant per a la generacio de frases a partir de predicats com de la comprensio de frases d'usuari per part del sistema; i tecniques de sintesi o augmentacio d'escenes per a simulacio i representacio d'entorns virtuals o augmentats. Adicionalment, demostrem que l'us d'ontologies per a organitzar, centralitzar, connectar i reutilitzar coneixement es un factor clau a l'hora de materialitzar els nostres objectius.Els avantatges del sistema descrit es demostren amb un conjunt d'aplicacions que beneficien principalment el camp de la video vigilancia, com ara: generacio automatica de descripcions en diverses llengues sobre el contingut de sequencies de video; filtrat i resum d'aquests texts d'acord amb els seus continguts; interficies de dialeg amb l'usuari que li permetin fer consultes i navegar pels continguts dels videos; aprenentatge automatic de les regions semantiques presents a un escenari; i eines per a avaluar el funcionament de diferents components i models del sistema, fent servir tecniques de simulacio de comportaments i realitat augmentada.

Read the paper · More papers on PaperTik