Mining of Interaction Geometries in Collections of Protein Structures
Therese Inhester · 2018
Die vorliegende Arbeit beschreibt die Entwicklung von neuen Methoden zur Suche nach Interaktionsgeometrien in Proteinstruktursammlungen. Die Bindung zwischen einem Protein und einem kleinen Molekul oder zwischen zwei Proteinen ist ein fundamentaler Prozess in lebenden Zellen. Ein vollstandiges Verstandnis daruber warum zwei Molekule binden und dessen Manipulation ist ein wichtiger Aspekt im Bereich des strukturbasierten Wirkstoffentwurfs. Die Basis von molekularer Bindung sind nicht kovalente Interaktionen zwischen Atomen. Methoden, die in der Lage sind die wachsende Menge an Daten nach geometrischen Praferenzen dieser Interaktion zu durchsuchen konnen helfen die treibenden Krafte hinter diesen Bindungen besser zu verstehen. Existierende Methoden in diesem Feld bieten jedoch nicht genung Flexibilitat und Prazision bezogen auf die moglichen Suchanfragen und in die analysierten Daten. In dieser Arbeit wurden zwei Methoden entwickelt die das beschriebene Problem von verschiedenen Standpunkten betrachten. Die erste Methode (Pelikan) ermoglicht die Suche nach spezifischen Interaktionsmustern an der Schnittstelle zwischen Protein und Ligand. Damit konnen sogenannte Bioisostere und Chemoisistere entdeckt werden, die insbesondere dann von Nutzen sind, wenn spezifische Substrukturen in Liganden ausgetauscht oder mogliche Nebenenffekte eines Liganden vorhergesagt werden sollen. Die zweite Methode (NAOMI nova) berechnet geometrische Verteilungen von interagierenden Atomen im Umfeld von molekularen Substrukturen aus Proteinstruktursammlungen. Aus diesen Verteilungen konnen bevorzugte Interaktionsrichtungen abgeleitet werden, die beim Optimieren von Liganden und der Affinitatsvorhersage von Nutzen sind. Beide Methoden benutzten eine server-lose Datenbank um die benotigten Daten effizient zu speichern. Hierfur wurden schnelle und flexible Suchverfahren entwickelt, die uber existierende Methoden hinausgehen. Im Fall von Pelikan werden flexible und prazise 3D Anfragen auf atomarem Level unterstutzt. Die Methode in NAOMI nova arbeitet mit benutzerspezifizierten molekularen Substrukturen und unterstutzt verschiedene Attribute von Substrukturen und interagierenden Atomen in den Anfragen. Zusatzlich konnen die fur die Suche genuzten Daten angepasst werden. Die Korrektheit, das Leistungsspektrum und die Anwendbarkeit beider Methoden werden in dieser Arbeit demonstriert. Daruber hinaus wurden grafische Oberflachen entwickelt, welche eine intuituve Benutzung durch Forscher aus dem Bereich der Lebenswissenschaften ermoglicht. The thesis at hand presents the development of new methods for the mining of interaction geometries in collections of protein structures. The binding between a protein and a small molecule or between two proteins is a fundamental event in all processes in living cells. Its complete understanding and manipulation is key in the field of structure-based drug design. The basis of molecular recognition are non-covalent interactions between atoms. Tools which can be used to mine the ever-growing data for specific spatial preferences of these interactions can help understanding the nature of molecular recognition. However, existing tools suffer from low variability and low precision of the used data and of the possible queries. In this thesis, two methods have been developed which tackle the problem from two different perspectives. The first method, Pelikan, allows a user to search for specific interaction patterns in the interface between proteins and ligands. Using this methodology, bioisosters and chemoisosters can be found. This is particular useful if specific substructures in a ligand are to be replaced or a potential side-effect of a ligand is to be determined. The second method, NAOMI nova, calculates and presents distributions of interacting atoms in the vicinity of molecular substructures in collections of protein structures. From these distributions, preferred interaction directions can be deduced which is of major importance in the process of ligand optimization and affinity prediction during a drug design project. For both methods, a serverless database system is used to efficiently store the relevant data. Fast and flexible retrieval systems have been developed for these database systems which go beyond existing methods. The retrieval system of Pelikan supports flexible as well as precise 3D queries on an atomic level. The NAOMI nova method handles user-defined molecular substructures and supports queries using different attributes of substructures and interacting atoms. In addition, the data used for the search processes is highly flexible and can be easily adapted. The correctness and the performance of the retrieval systems are demonstrated in this work and their applicability is shown in different examples. In addition, graphical user interfaces have been developed as part of this work which allow immediate and intuitive usage of the methods by life-science researchers.