Semi-Parametric Distributional Regression in Forestry and Ecology

Hannes Riebl · 2023

Die neueren Entwicklungen im Bereich der Machine-Learning-Software, etwa das automatische Differenzieren und die JIT-Kompilierung (JIT = Just in Time), haben die Forschung im maschinellen Lernen erheblich verändert. Sie haben die Modellentwicklung beschleunigt und zum Entstehen von KI-Werkzeugen wie dem Chatbot ChatGPT und dem Bildgenerator DALL-E beigetragen. Im Kontext der probabilistischen Programmierung werden ähnliche Methoden eingesetzt, um effiziente gradienten-basierte Inferenzalgorithmen zu implementieren, die auf eine Vielzahl von Bayesianischen Modellen anwendbar sind, z. B. Hamiltonian Monte Carlo (HMC) und der No-U-Turn Sampler (NUTS). Diese kumulative Dissertation umfasst drei Forschungsartikel, die Methoden des maschinellen Lernens und der probabilistischen Programmierung mit semi-parametrischen Regressionsmodellen aus der angewandten Statistik kombinieren. So wird die Entwicklung neuer Modelle mit semi-parametrischen Prädiktoren und den entsprechenden Inferenzalgorithmen möglich. Außerdem werden verschiedene Anwendungen in der Forstwissenschaft und der Ökologie vorgestellt. Im ersten Artikel präsentieren wir das probabilistische Programmier-Framework Liesel, mit dem wir eine Software-Basis für effiziente und zuverlässige Forschung in der angewandten Statistik schaffen wollen, die geeignet ist für die Implementierung komplexer Modelle und Inferenzalgorithmen. Der Schwerpunkt der Software liegt auf semi-parametrischen Prädiktoren mit linearen, nicht-linearen, zufälligen und räumlichen Effekten von Kovariablen. Ein typischer Workflow mit Liesel wäre: (1) Konfiguration eines Modellgraphen, z. B. mithilfe des R-Interface von Liesel, (2) Anpassung des Modellgraphen zur Umsetzung neuer Forschungsideen, und (3) vollständige Bayes-Inferenz mit der mitgelieferten MCMC-Bibliothek (MCMC = Markov Chain Monte Carlo), entweder mit einem Standardalgorithmus oder einer benutzerdefinierten Variante. Sampler wie HMC und NUTS werden unterstützt und können mit herkömmlichen Methoden kombiniert werden, z. B. mit IWLS-Proposals (IWLS = Iterative Weighted Least Squares) und Gibbs-Updates. Liesel ist in Python geschrieben und nutzt die Machine-Learning-Bibliothek JAX als Backend. Im zweiten und dritten Artikel werden Erweiterungen und Anwendungen der semi-parametrischen Verteilungsregression in der Forstwissenschaft und der Ökologie diskutiert. Die neuen Modelle ergeben sich aus der Einführung bestimmter Response-Strukturen in einen Regressionskontext, z. B. in Form von Gauß-Prozessen (GPs) mit parametrischen Mittelwert- und Kovarianzfunktionen. Das GP-Modell wenden wir auf Messungen von hochauflösenden Dendrometern an. Diese Geräte erfassen neben dem irreversiblen Wachstum von Baumstämmen auch die reversiblen Schwankungen aufgrund des Wassergehalts. Mit unserem Modell können die Daten in eine permanente und eine temporäre Komponente zerlegt werden, wobei sich Unterschiede zwischen Bäumen und Jahren durch Kovariablen erklären lassen. Im letzten Artikel schlagen wir das Multi-Species-Count-Modell (MSCM) vor, mit dem Zusammenhänge zwischen Umweltbedingungen und verschiedenen Indizes für Artenvielfalt geschätzt werden können. Wir nutzen das Modell mit semi-parametrischen Prädiktoren, um die Effekte von Rotbuche, Fichte und Douglasie auf die Artenvielfalt verschiedener Taxa zu bestimmen, basierend auf Daten, die im Graduiertenkolleg (GRK) 2300 erhoben wurden, und unter Berücksichtigung der räumlichen Korrelation.

Read the paper · More papers on PaperTik