Statistical issues in machine learning: towards reliable split selection and variable importance measures.
Carolin Strobl · 2008
Die Anwendung von Methoden des Rekursiven Partitionierens aus dem Maschinellen Lernen ist in vielen Forschungsgebieten, wie z.B. in der Genetik und Bioinformatik, weit verbreitet. Der Vortrag setzt sich aus statistischer Sicht mit den zwei Hauptproblemen des Rekursiven Partitionierens, Instabilitat und verzerrter Variablenselektion, auseinander. Im Hinblick auf das erste Thema, die Instabilitat, wird das gesamte Methodenspektrum von herkommlichen Klassifikationebaumen uber robustifizierte Klassifikationsbaume und Ensemble Methoden wie TWIX, Bagging und Random Forests abgedeckt. Ensemble Methoden erweisen sich als deutlich stabiler als einzelne Klassifikationebaume, verlieren aber auch grosstenteils ihre Interpretierbarkeit. Deshalb wird ein adaptives Bruchpunkt-Selektionskriterium vorgeschlagen, mit dem ein TWIX Ensemble auf einen einzelnen Klassifikationsbaum reduziert wird, falls die Partition stabil genug ist. Im Hinblick auf das zweite Thema, die verzerrte Variablenselektion, werden die statistischen Ursachen fur dieses Artefakt in einzelnen Baumen und eine neue Form von Verzerrung, die in Ensemble Methoden auftritt die auf Bootrap-Stichproben beruhen, untersucht. Aufgrund der Ergebnisse fur einzelne Baume und weiteren Untersuchungsergebnissen zu den Auswirkungen von Bootrap-Stichprobenverfahren auf Assoziationsmasse wird gezeigt dass, neben der Verwendung von unverzerrten Selektionskriterien, Teilstichprobenverfahren anstelle von Bootstrap-Stichprobenverfahren in Ensemble Methoden verwendet werden sollten, um die Variable Importance Werte von Pradiktorvariablen unterschiedlicher Art zuverlassig vergleichen zu konnen. Die statistischen Eigenschaften und die Nullhypothese eines Test fur die Variable Importance von Random Forest werden kritisch untersucht. Abschliessend wird eine neue, bedingte Variable Importance vorgeschlagen, die im Fall von korrelierten Pradiktorvariablen einen fairen Vergleich erlaubt und die interessierende Nullhypothese besser widerspiegelt.