Deep learning for toxicity prediction

Jennifer Hemmerich · 2020

Maschinelles Lernen ist seit vielen Jahren ein wesentlicher Bestandteil der in silico Toxikologie. Trotz einer Vielzahl von Forschungsanstrengungen steht nur eine sehr begrenzte Anzahl von Modellen zur Vorhersage komplexer apikaler Toxizitatsendpunkte wie Organtoxizitaten zur Verfugung. Der Merck-Kaggle-Wettbewerb und die Tox21-Challenge haben die Eignung von Deep Learning fur Bioaktivitats- und Toxizitatsvorhersagen hervorgehoben. Deep Learning konnte daher neue Wege in der in silico Toxikologie eroffnen. Toxikologische Datensatze sind jedoch haufig klein und unausgewogen. Wahrend kleine Datensatze moglicherweise nicht genugend Daten enthalten, damit Deep Learning dem traditionellen maschinellen Lernen uberlegen ist, konnen unbalancierte Datensatze dazu fuhren, dass Modelle die unterreprasentierten Klassen ignorieren. Um Deep Learning in der in silico Toxikologie zu nutzen, ist es daher wichtig, neue Datensatze zu generieren und Ungleichgewichte in diesen zu beseitigen. Diese Arbeit zielt zum einen darauf ab, durch grundliche Datenanalyse Einblicke in Datensatze zu gewinnen und zum anderen das Konformations-Oversampling (COVER) als neue Methode zum Ausgleich von Datensatzen mithilfe von 3D-Konformationen einzufuhren. Um neue Datensatze zu generieren, wurde ein Workflow zur Standardisierung chemischer Strukturen erstellt, welcher das Zusammenfuhren von Datensatzen aus verschiedenen Quellen erleichtert und es dem Benutzer ermoglicht, Duplikate uber generierte InChIKeys zu erkennen. In unserer ersten Studie wurde dieser Workflow verwendet, um eine experimentelle Studie zu unterstutzen, in der die Arzneimittelaufnahme durch SLC-Transporter untersucht wurde. Durch Vergleich der Screening- Bibliotheken mit dem von DrugBank dargestellten chemischen Wirkstoffraum haben wir gezeigt, dass die getesteten Verbindungen fur diesen Raum reprasentativ sind und keine Tendenz zu bestimmten physikochemischen Eigenschaften aufweisen. Somit war die SLC-bezogene Arzneimittelaufnahme unabhangig von den physikochemischen Eigenschaften und ist daher hochstwahrscheinlich die Regel und nicht die Ausnahme. In unserer zweiten Studie haben wir mithilfe unseres Workflows einen Datensatz fur die mitochondriale Toxizitat zusammengestellt. Durch Datenanalyse identifizierten wir wichtige physikochemische Eigenschaften fur die mitochondriale Toxizitat. Anschliesend haben wir verschiedene Arten von Modellen fur maschinelles Lernen und Deep Learning unter Verwendung unseres Datensatzes trainiert. Mithilfe bekannter und neu generierter Structural Alerts erhielten wir Einblicke in mogliche Toxizitatsmechanismen fur positiv vorhergesagte Molekule. Die letzten beiden Studien verlagern den Fokus von der Generierung neuer Datensatze auf das Training neuronaler Netze mit unbalancierten Daten. In der ersten Studie haben wir das Konformations-Oversampling (COVER) eingefuhrt, bei dem 3D-Konformationen verwendet werden, um einen Datensatz zu balancieren. Wir konnten zeigen, dass die 3D-Information von Molekulen geeignet ist, um Datensatze durch Oversampling auszugleichen. Die Anwendung von COVER auf den Tox21-Datensatz erhohte die Vorhersagekraft der Modelle erheblich und war vergleichbar mit einem Oversampling durch SMOTE. In unserer letzten Studie untersuchten wir die Anwendung von COVER vom 3D-Deskriptor basierten Lernen zum bildbasierten Lernen. Beide Studien zeigten, dass COVER erfolgreich auf verschiedene Eingabedaten fur neuronale Netze angewendet werden kann. Zusammenfassend unterstreicht diese Arbeit zum einen die Bedeutung der Datenanalyse, indem sie eine experimentelle Studie unterstutzt und zum anderen den Einblick in Vorhersagen des maschinellen Lernens erweitert. Daruber hinaus konnten wir zeigen, dass COVER eine geeignete Methode ist, um ein Oversampling von Datensatzen mithilfe von 3D-Konformationen durchzufuhren.

Read the paper · More papers on PaperTik