Machine learning under concept drift for industrial data using Python

Johannes Allgaier · 2019

Kunstliche Intelligenz und Machine Learning sind Begriffe, welche in den letzten Jahren nicht zuletzt aufgrund rasant wachsender Rechnerleistungen immer mehr in den Fokus von Industrie und Forschung geruckt sind. Dabei ist fur die Industrie vor allem der Informationsgewinn aus Daten von Interesse. Die Validitat der Analyse aus historischen Daten ist jedoch in einer sich immer schneller wandelnden Welt fraglich. Die Vorhersagen von Maschinen aus nicht aktuellen Daten konnen obsolet sein, weil sich deren Kontext geandert hat. Diese Arbeit befasst sich daher mit dem maschinellen Lernen unter Concept Drift. Die Analyse wird mit zwei realen Datensatzen aus der Industrie, unter Simulation eines verteilten Systems, durchgefuhrt. Es werden dazu verschiedene Regressoren (Polynomregression, Decision Trees, Random Forests und Neuronale Netze) implementiert und die Vorhersagegenauigkeit untereinander verglichen. Bei den Regressoren werden die Einstellungsparameter sowie die Vorhersage- und Trainingszeit variiert. Das Ergebnis zeigt, dass die polynomialen Regressoren den Random Forests, Regression Trees und neuronalen Netzen in der Vorhersagegenauigkeit und Agilitat unterlegen sind. Die Vorhersagegenauigkeit nimmt fur alle Regressoren ab, wenn die Vorhersagedauer erhoht wird. Random Forests sind gegenuber Regression Trees weniger ausreiserempfindlich. Es lasst sich aus den Ergebnissen nicht erschlieyen, dass ein Forest genauere Vorhersagen macht als ein Regression Tree, obwohl der Forest als Ensemble agiert. Machine Learning erfahrt in den vergangenen Jahren zurecht vermehrt Beachtung in der Forschung und Industrie. Random Forests sind ein effizientes Instrument zur Erfassung von Daten mit unbekannter Verteilung und zur Schatzung von unbekannten Parametern und somit eine echte Alternative zu klassischen Regressionen und neuronalen Netzen.

Read the paper · More papers on PaperTik