On the prediction of mRNA subcellular localization with machine learning
Zichao Yan · 2019
Les cellules sont les unités de base de la vie, et pourtant, elles sont régies par de nombreux processus subcellulaires délicats et, dans une certaine mesure, fragiles, qui sont essentiels à leur survie. Une simple mutation génétique pourrait éventuellement obstruer des processus de régulation importants ou perturber le fonctionnement du produit qu’elle encode, ce qui pourrait éventuellement entraîner la disparition de l’ensemble du système. Par conséquent, il est important de mieux comprendre les nombreux processus de contrôle de la cellule et les facteurs de régulation qui leur sont associés, un exemple frappant étant le mécanisme lié à la localisation sous-cellulaire de l'ARN sur lequel nous nous concentrerons presque exclusivement dans cette étude à partir de une perspective de calcul.Le mécanisme de localisation sous-cellulaire de l'ARN est l'une des facettes les plus importantes, mais sous-estimée, du processus plus général de régulation des gènes, qui facilite l'organisation cellulaire et la régulation de l'expression des gènes, via le transport des transcrits d'ARN vers leurs emplacements désignés, où leur fonction, leur structure ou des protéines traduites sont nécessaires. Il est généralement admis que le mécanisme du trafic d'ARN est régulé par des facteurs de régulation trans, tels que les protéines de liaison à l'ARN, et les éléments agissant en cis, des extraits courts du transcrit qui contiennent les sites de liaison à la RBP, qui nous appelons zipcode car ils sont censés contenir des informations sur son adresse de livraison.La publication d'un nouvel ensemble de données de localisation subcellulaire des ARN nous a permis de créer le premier outil de calcul utilisant des techniques d’apprentissage approfondi de pointe, afin de prédire le résultat de la localisation de l’ARN codant pour une protéine à partir d’une simple séquence de transcription, puis d’identifier le éléments de zipcode de ceux-ci. Notre méthode proposée a obtenu une bonne précision par rapport aux méthodes de base basées sur les caractéristiques de k-mers, malgré la difficulté intrinsèque résultant des interactions complexes et stochastiques lors d'événements de gestion de trafic, ainsi que des limitations imposées par l'ensemble de données disponibles