Deep Learning Models for Human Activity Recognition

George Albert Florea, Filip Weilid · 2019

AMI Meeting Corpus (AMI) -databasen anvands for att undersoka igenkannande av gruppaktivitet. AMI Meeting Corpus (AMI) -databasen ger forskare fjarrstyrda moten och naturliga moten i en kontorsmiljo; motescenario i ett fyra personers stort kontorsrum. For attuppnagruppaktivitetsigenkanninganvandesbildsekvenserfranvideosoch2-dimensionella audiospektrogram fran AMI-databasen. Bildsekvenserna ar RGB-fargade bilder och ljudspektrogram har en fargkanal. Bildsekvenserna producerades i batcher sa att temporala funktioner kunde utvarderas tillsammans med ljudspektrogrammen. Det har visats att inkludering av temporala funktioner bade under modelltraning och sedan forutsaga beteende hos en aktivitet okar valideringsnoggrannheten jamfort med modeller som endast anvander rumsfunktioner[1]. Deep learning arkitekturer har implementerats for att kanna igen olika manskliga aktiviteter i AMI-kontorsmiljon med hjalp av extraherade data fran the AMI-databas. Neurala natverks modellerna byggdes med hjalp av KerasAPI tillsammans med TensorFlow biblioteket. Det finns olika typer av neurala natverksarkitekturer. Arkitekturerna som undersoktes i detta projektet var Residual Neural Network, Visual GeometryGroup 16, Inception V3 och RCNN (LSTM). ImageNet-vikter har anvants for att initialisera vikterna for Neurala natverk basmodeller. ImageNet-vikterna tillhandahalls av Keras API och ar optimerade for varje basmodell [2]. Basmodellerna anvander ImageNet-vikter nar de extraherar funktioner fran inmatningsdata. Funktionsextraktionen med hjalp av ImageNet-vikter eller slumpmassiga vikter tillsammans med basmodellerna visade lovande resultat. Bade Deep Learning anvandningen av tata skikt och LSTM spatio-temporala sekvens predikering implementerades framgangsrikt.

Read the paper · More papers on PaperTik