Soutenance de thèse de Noémien MAILLARD

Evaluation de réseaux de neurones artificiels pour la prédiction inter-espèces d’annotations de la régulation chromatinienne


Titre anglais : Evaluation of artificial neural networks for the cross-species prediction of chromatin regulation annotations
Ecole Doctorale : SEVAB - Sciences Ecologiques, Vétérinaires, Agronomiques et Bioingenieries
Spécialité : Infectiologie, Physiopathologie, Toxicologie, Génétique et Nutrition
Etablissement : Université de Toulouse
Unité de recherche : UMR 1388 - GenPhySE- Unité Génétique, Physiologie et Systèmes d'Elevage
Direction de thèse : Raphael MOURAD- Julie DEMARS


Cette soutenance aura lieu jeudi 24 septembre 2026 à 13h30
Adresse de la soutenance : 24, chemin de Borde-Rouge - Auzeville Tolosane Bâtiment PABS-B 31326 Castanet Tolosan France - salle Lynn Margulis

devant le jury composé de :
Raphael MOURAD   Maître de conférences   Université de Toulouse   Directeur de thèse
Benoît BALLESTER   Chargé de recherche   INSERM PACA et Corse   Rapporteur
Charles-Henri LECELLIER   Directeur de recherche   CNRS Occitanie Est   Rapporteur
Marie-Laure MARTIN   Directrice de recherche   INRAE Ile-de-France - Versailles-Saclay   Rapporteur
Christèle ROBERT-GRANIÉ   Directrice de recherche   INRAE Occitanie-Toulouse   Examinateur
Thomas FARAUT   Chargé de recherche   INRAE Occitanie-Toulouse   Examinateur


Résumé de la thèse en français :  

Les consortia d’annotation des génomes humain et murin, tels qu’ENCODE, se sont développés depuis les années 2000 pour étudier la régulation des gènes et de la chromatine chez ces organismes. Cela a aussi permis de produire une quantité importante de données libres d’accès en uniformisant chaque étape, de la collecte à l’analyse bioinformatique. En parallèle, les réseaux de neurones artificiels ont connu une ascension fulgurante dans tous les domaines au cours des 10-15 dernières années. En génomique, le premier réseau entraîné à prédire des annotations de la chromatine à partir de la séquence d’ADN, DeepBind, a été publié en 2015, et montrait déjà des performances meilleures que les méthodes de référence. Depuis, d’autres réseaux ont été entraînés, incluant DeepSEA et Enformer. Les performances grandissantes de ces méthodes proviennent des améliorations méthodologiques, mais aussi de la quantité de données rendues accessibles par les consortia d’annotation.
Le consortium FAANG, l’équivalent d’ENCODE pour les animaux d’élevage, n’a été initié qu’au cours des années 2010. Par conséquent, la quantité et la diversité d’expériences pour ces espèces est nettement moins importante. En revanche, l’étude des espèces d’élevage est un pan de recherche actif qui peut aider à mieux comprendre la régulation des gènes et de la chromatine.
Dans cette thèse, nous nous intéressons particulièrement à la régulation de la chromatine par des expériences décrivant la fixation de facteurs de transcription (ChIP-seq), des modifications post-traductionnelles des histones (ChIP-seq), et l’accessibilité de la chromatine (ATAC-seq et DNase-seq). Il a été montré dans la littérature que ces annotations biologiques sont partiellement conservées au cours de l’évolution. C’est pourquoi nous posons l’hypothèse que des réseaux de neurones artificiels entraînés avec des données humaines peuvent prédire ces annotations à partir des génomes de référence d’espèces d’élevage sans entraînement ni fine-tuning préalable avec des données de ces espèces. Les expériences ont été réalisées avec les réseaux de neurones DeepBind, DeepSEA, et Enformer, et nos résultats montrent qu’ils sont globalement capables de prédire ces annotations. Selon les expériences prédites, des différences de performances ont tout de même été mesurées, mais les principaux éléments de la régulation chromatinienne (promoteurs et enhancers) sont les mieux prédits. Nos résultats montrent que l’on peut profiter de l’abondance de données humaines pour étudier la régulation de la chromatine chez d’autres espèces, ouvrant la porte à des applications futures telles que la prédiction d’annotations chez des espèces moins étudiées, ou la priorisation de variants génétiques associés à des caractères complexes d’intérêt agronomique.

 
Résumé de la thèse en anglais:  

The human and murine annotation consortia, like ENCODE, have been initiated during the 2000’s to study the genes and chromatin regulation in those organisms. This led to the production of an important amount of data, freely available, while standardizing each step, from sample collection to bioinformatics analyses. In parallel, artificial neural networks have shown a lightning rise in every domain during the 10-15 last years. In genomics, the first neural network trained to predict chromatin annotations from raw DNA sequence, DeepBind, was published in 2015, and already showed better performances than the state of the art methods. Then several other networks have been trained, including DeepSEA and Enformer. The growing performances of those methods come from methodological improvement, but also from the availability of data from annotation consortia.
The FAANG consortium, an equivalent of ENCODE for livestock species, was initiated during the 2010’s. Hence, the amount and diversity of data available for those species are clearly poorer. However, the study of livestock species is an important research area, which may help to understand genes and chromatin regulation.
In this thesis, we are particularly interested in the chromatin regulation, through experiments of transcription factor binding (ChIP-seq), post-translational modification of histones (ChIP-seq), and chromatin accessibility (ATAC-seq and DNase-seq). It has been shown in the literature that those biological annotations are partially conserved in the course of evolution. That is why we have the hypothesis that human-trained artificial neural networks may be able to predict the same annotations from reference genomes of livestock species without previous training or fine-tuning with data from those species. The experiments have been realized with DeepBind, DeepSEA and Enformer, and our results show that they are globally able to predict the chromatin annotations. According to the predicted experiments, differences in the performances have been nonetheless measured, but the main chromatin regulatory elements (promoters and enhancers) are the best predicted. Our results show that we can take advantage of the amount of human available data to study chromatin regulation in other species, opening gates for future applications such as the prediction of annotations for less studied species, or genetic variant prioritization associated with complex traits of agronomical interest.

Mots clés en français :génétique, intelligence artificielle, bioinformatique, agronomie,
Mots clés en anglais :   genetics, artificial intelligence, bioinformatics, agronomy,