Towards Large-Scale Multi-Modal Image Search
Petra Budíková · 2013
V soucasne době zaživa nase spolecnost obrovský narust množstvi digitalnich informaci. Diky snadne dostupnosti technologii pro pořizovani a ukladani digitalnich dat pokracuje rychlý růst nejen množstvi, ale i složitosti těchto dat. Tato situace nabizi mnoho možnosti pro ziskavani informaci, ktere dřive nebyly dostupne, v souvislosti s tim ale vznika take množstvi nových a narocných ukolů souvisejicich se zpracovanim digitalnich dat. Kvůli velke vnitřni složitosti mnoha modernich digitalnich datových typů, jako jsou napřiklad multimedia, již na praci s takovými daty casto nestaci tradicni databazove technologie, ktere jsou založeny na principu přesneho vyhledavani. V poslednich dvou desetiletich proto ziskava na významu alternativni přistup založený na vyhledavani podle podobnosti obsahu dat. Tento přistup je inspirovan přirozeným lidským vnimanim a ucenim, ukazuje se vsak, že je velmi složite podobnostni princip prakticky uchopit a implementovat. Výzkum v oblasti podobnostniho vyhledavani se intenzivně rozviji na mnoha urovnich, ktere zahrnuji psychologicke studie vnimani podobnosti, analýzu multimedialnich dat i rozvoj technologii pro indexovani dat a vyhledavani v nich. Důležitou vlastnosti podobnostniho vyhledavani je take skutecnost, že lidske vyhodnocovani podobnosti je vždy subjektivni, zavisi na kontextu a promita se do něj mnoho pohledů na daný objekt. Vsechny tyto skutecnosti je potřeba zohlednit take v navrhu nastrojů pro podobnostni vyhledavani. Proto se v posledni době mnoho výzkumných týmů zaměřuje na tzv. multi-modalni vyhledavani, ktere se snaži porovnavat datove objekty na zakladě několika různorodých charakteristik (modalit). Tim je možno zvýsit přesnost vyhledavani, zaroveň je vsak třeba usilovat o řeseni umožňujici rychle zpracovani dotazu. V teto praci se zabývame multi-modalnim vyhledavanim nad obrazkovými daty a možnostmi využiti teto technologie v aplikacich, ktere zpracovavaji velke objemy dat. Zaměřujeme se zejmena na rozvoj metod, jejichž zakladem je podobnostni vyhledavani, a vyhodnocovani jejich vhodnosti pro dva realne scenaře nasazeni – obecne webove vyhledavani v obrazcich a automaticke generovani anotaci. V obou těchto situacich je jednim ze zakladnich požadavků zpracovani dotazů v realnem case – rychlost vyhledavani je tedy zcela zasadni. Kromě nových metod pro vyhledavani předkladame navrh obecneho dotazovaciho jazyka pro podobnostni vyhledavani v multimediich. Dale se věnujeme rozsahlemu srovnani různých přistupů k multi-modalnimu vyhledavani v obrazcich a experimentalnimu vyhodnoceni jejich přesnosti a rychlosti. Pro usnadněni podobných vyhodnoceni byla vytvořena nova evaluacni platforma, ktera poskytuje velkou kolekci obrazků a nastroje umožňujici vyhodnocovat uspěsnost metod a vzajemně je srovnavat. V zavěru prace je představen softwarový produkt MUFIN Annotation Tool, který umožňuje automaticky generovat anotace obrazků.