Data Stream Mining and Concept Drift: Novel Approaches and Applications
Petr Kosina · 2011
Zaměrem prace je studovat nove techniky z oblasti ziskavani informaci z proudů dat, dale možnosti jejich aplikace a jejich přizpůsobeni se novým situacim. Prace se věnuje zejmena dvěma tematům. Prvnim je system využivajici metauceni z dat, ktere se urcitým způsobem měni a obsahuji opakujici se koncepty neboli casti dat, ktere mohou být popsany modelem nauceným na datech vyskytnuvsich se již dřive. System je schopen vybrat vhodný klasifikator pro přichozi data na zakladě zaznamů, ktere jestě nebyly oznackovany. A pravě metauceni spolu s využitim kontextových informaci jsou jedněmi z možnosti, jak využit takove zaznamy k rychlejsi adaptaci na změnu. Dalsi přednosti systemu je použiti již naucených klasifikatorů, protože už z pocatku jsou jejich predikce důvěryhodnějsi. Nasim zaměrem je se dale věnovat tomuto systemu, rozvijet ho a testovat na realných datech. Mezi planovana rozsiřeni patři uprava a použiti různých klasifikacnich metod a taktež metod pro klasifikaci, ktera využiva data pouze z jedne třidy. Druhým tematem je vytvořeni nove klasifikacni metody odvozujici pravidla z proudů dat. Tato technnika zobecňuje rozhodovaci stromy a jeji výhodou je předevsim modularita, protože každe pravidlo je nezavisle na ostatnich a může být interpretovano samostatně. Tato vlastnost je velmi slibna pro použiti u již zminěných dat obsahujicich změnu (drift), protože je možne přizpůsobit pouze podmnožinu pravidel narozdil od nutnosti změny celeho stromu.