Human pose estimation in complex environments
Vasileios Belagiannis · mediaTUM – the media and publications repository of the Technical University Munich (Technical University Munich) · 2015
Estimating human body poses from images is a demanding task that has attracted great interest from the computer vision community.Determining automatically the body pose promotes many applications such as human tracking, motion capture, activity recognition, surveillance and surgical workflow analysis.This work addresses the problem of human pose estimation from different perspectives.At first, we tackle the problem of single human pose estimation from a single view.Then, we move to multi-view camera systems, where we work on both single and multiple human pose estimation.In this thesis, we propose novel discriminative and generative methods to address all these problems of human pose estimation.The primary contributions of this work are threefold.At the beginning, we propose two discriminative methods for 2D human pose estimation from a single view.The first contribution exploits Random Forests (RF), while the second builds on Deep Learning.In both cases, we formulate the problem of body pose estimation as a regression task, where the body pose is defined by a set of body joints.To build a regressor that predicts the 2D body poses, we learn a model either using a Regression Forest or Convolutional Neural Network (ConvNet).For the convolutional neural network (ConvNet), we propose a regression model that achieves robustness to outliers by minimizing Tukey's biweight function, an M-estimator robust to outliers, as the loss function of the network.In addition to the robust loss, we introduce a coarse-to-fine model, which processes input images of progressively higher resolutions for improving the accuracy of the regressed values.Our third contribution is a generative model for multi-view human pose estimation.In particular, we address the problem of 3D pose estimation of multiple humans from multiple views.This is a more challenging problem than single human pose estimation due to the much larger search space of body poses, different type of occlusions as well as across view ambiguities when not knowing the identity of the individuals in advance.To address these problems, we first create a reduced search space by triangulation of corresponding body parts obtained from 2D detectors in pairs of camera views.In order to resolve ambiguities of wrong and mixed body parts hypotheses of multiple humans after triangulation, we introduce a 3D pictorial structures (3DPS) model.Our model builds on multi-view unary potentials, while a prior model is integrated into pairwise and ternary potential functions.The model is generic and applicable to both single and multiple human pose estimation.Finally, we apply the 3D pictorial structures (3DPS) model on estimating the body pose of multiple individuals from multiple cameras in the operating room (OR).Therefore, this work considers several aspects of the human pose estimation problem, starting from single view scenarios and completing with human pose estimation multiple views in complex environments.iii Zusammenfassung Das Bestimmen der menschlichen Körperhaltung aus Fotos ist eine anspruchsvolle Aufgabe die von Guppen des Fachgebiets Computer Vision große Aufmerksamkeit bekommt.Das automatische Schätzen der Körperkonfiguration nützt vielen Anwendungen wie beispielsweise das Nachverfolgen von Menschen in Videos, Bewegungs-Erfassung (motion capture), Handlungserkennung, Überwachungsaufgaben und der Analyse chirurgischer Abläufe.Diese Dissertation befasst sich mit der Problemstellung des Bestimmens der menschlichen Körperhaltung aus einem oder mehreren Blickwinkeln.Zu Beginn wird die Aufgabe der Haltung einer einzelnen Person aus einem einzelnen Bild abzuschätzen betrachtet.Anschließend werden Mehrkamerasystemen benutzt um sowohl eine wie auch mehrere Körperkonfigurationen gleichzeitig abschätzen zu können.Hierfür stellt diese Arbeit neue diskriminative sowie generative Methoden vor.Der Hauptbeitrag dieser Dissertation gliedert sich in drei Teile.Anfangs werden zwei diskriminative Methoden zur 2D Körperhaltungserkennung aus einem einzigen Bild vorgestellt.Der erste Beitrag verwendet Random Forests -ein Klassifikationsverfahren aus unkorrelierten Entscheidungsbäumen -wo hingegen der zweite Ansatz Deep Learning Verfahren benutzt.In beiden Fällen wird das Problem der Köperhaltungsbestimmung als Regressionsaufgabe definiert.Dazu wird die menschliche Pose über die Menge der Gelenkpositionen parametrisiert.Das Modell des Regressors der aus Bildern 2D Körperposen vorhersagt wird mittels eines Regression Forests (bzw.eines Convolutional Neural Networks -ConvNet) gelernt.Für das ConvNet schlagen wir ein Regressionmodell vor, das mittels Tukeys Biwight-Schätzer (ein robuster M-Schätzer) als Fehlermaß robuster gegen Ausreißer gemacht wird.Zusätzlich zum robusten Fehlermaß führen wir ein grob-zu-fein Modell ein, das, um die Genauigkeit der Regressionsergebnisse zu verbessern, Eingabebilder in zunehmender Auflösung verarbeitet.Der dritte Beitrag ist ein generativer Ansatz die Körperhaltung aus mehreren Perspektiven zu bestimmen.Insbesondere betrachten wir hier das Problem der Erkennung der 3D Körperpose mehrerer Menschen mit Hilfe mehrerer Blickwinkel.Dieses Problem zeichnet sich durch deutlich erhöhte Komplexität aus, da der Suchraum über Haltungskonfigurationen, verschiedenste -auch gegenseitige -Verdeckungen und blickwinkelübergreifende Mehrdeutigkeiten da die Identitäten der Personen in den einzelnen Perspektiven im Voraus nicht bekannt ist, deutlich größer ist.Zum Umgang mit diesen Problemen wird ein verringerter Suchraum konstruiert, für den korrespondierende Körperteile, bestimmt durch 2D Detektoren, in Blickwinkelpaaren trianguliert werden.Um Mehrdeutigkeiten Aufgrund falscher oder falsch zugeordneter Körperteile auflösen zu können führen wir ein 3D prictorial structures (3DPS) Modell ein.Dieses Modell verwendet unäre Potentiale aus den Blickwinkeln zusätzlich zu a-priori paarweisen sowie tertiären Potentialen.Damit ist das Modell sowohl generisch als auch anwendbar für einzelne sowie mehrere Personen im Bild.Abschließend wird das 3DPS Modell benutzt um die Körperhaltung mehrerer Personen aus mehreren Perspektiven im Operationssaal bestimmen zu können.So beinhaltet diese Arbeit verschiedenste Aspekte des Körperhaltungsbestimmungsproblems -von Szenarios mit einer v Person und einem Blickwinkel bis hin zu mehreren Personen in komplexen Umgebungen und vielen Blickwinkeln.vi