Compositional modelling of first-person actions as verb-noun streams using lstm based late fusion strategies
Zeynep Gökçe · 2019
Birinci-sahis videolarinin analizi, insan hareketlerini iceren bircok probleme cozum sunmaktadir. Bu videolar, el-nesne etkilesimlerine sahip cok sayida detayli eylem kategorisi icerir. Bu tezde, birinci-sahis videolarindaki insan hareketlerini tanimlamak amaciyla cesitli fuzyon stratejileriyle fiil ve nesne akislarinin birlesimsel modellenmesi onerilmistir. Fiil akisinda, video tabanli ozellikleri coklu olceklerde modellemek icin 3 Boyutlu Konvolusyonlu Sinir Agi modeli, C3D, kullandik. Nesne akisinda ise el ile etkilesimde bulunan nesneleri modellemek icin nesne algilama modeli, YOLO, kullandik. Bu iki akisi birlestirmek icin iki farkli fuzyon stratejisi onerilmistir. Ilkinde, insan hareketleri herhangi bir ogrenme gerceklestirmeden basit bir carpimla elde edilmektedir. Ikincisinde ise LSTM tabanli modeller kullanilmistir. EGTEA Gaze+ veri seti uzerinde iki farkli fuzyon metodolojilerinden elde ettigimiz deneysel sonuclar, birlesik modellerimizin taban modeli olan C3D hareket modelinden daha basarili oldugunu gostermistir.