Javascript must be enabled to continue!
Guardians of ancient protein galaxies : introducing Orthrus/Anubis for ancient protein sequencing and authentication
View through CrossRef
Gardiens d'anciennes galaxies de protéines : introduction d'Orthrus/Anubis pour le séquençage et l'authentification de protéines anciennes
L'étude des protéines anciennes a éclairé un large éventail de questions de recherche, y compris les paléodiètes, les histoires évolutives, les dynamiques sociales et les voies de préservation des protéines sur le long terme. Malgré l'importance archéologique et chimique des protéines anciennes, d'importants défis analytiques persistent et entravent les progrès de la paléoprotéomique en tant que domaine en pleine croissance. Premièrement, il est difficile d'extraire des protéines anciennes sans perte ni destruction d'échantillons. Les protocoles de protéomique modernes peuvent ne pas être optimisés pour les matériaux archéologiques. Deuxièmement, la spectrométrie de masse en tandem (MS/MS) est la norme d'excellence pour l'attribution à haute résolution et spécifique aux taxons des substrats anciens. Cependant, en raison de leur nature et de leur état de conservation, ces substrats peuvent entraîner une faible efficacité d'ionisation et des schémas de fragmentation peu clairs. L'acquisition de spectres d'ions fragments (MS2) est tout aussi difficile, car les méthodes existantes peuvent conduire à une sous-représentation des protéines en faible abondance ou à des spectres MS2 multiplex difficiles à interpréter. Enfin, l'identification et l'authentification des protéines anciennes restent des défis bioinformatiques substantiels. Il n'est pas clair si la recherche dans les bases de données conventionnelles est adaptée pour identifier des substrats archéologiques avec des sources de protéines dynamiques et des protéines anciennes fragmentées et modifiées. Il n'existe pas non plus de méthode standardisée pour séparer les protéines anciennes putatives des contaminants modernes. Je tente de relever ces défis bioinformatiques en estimant la taille existante des spectres MS2 non identifiables (spectres sans histoires) et en introduisant deux nouvelles approches computationnelles : Orthrus et Anubis. Quinze millions de données MS2 publiquement disponibles ont été collectées, et il a été estimé que 94 % des ensembles de données anciennes restent non identifiés. Orthrus est une pipeline Python open source, prête pour le cloud et alimentée par l'IA. Elle exploite le séquençage de novo assisté par transformateur et la recherche dans des bases de données conçues en Rust avec un rescoring amélioré par apprentissage automatique. Orthrus a été comparé à PEAKS® 11, MetaNovo et MaxQuant, surpassant les outils existants en termes de résolution taxonomique et de couverture de séquence protéique. Anubis est une échelle d'authentification pour les protéines anciennes utilisant la classification par forêt aléatoire et des motifs de déamidation comparatifs à plusieurs niveaux. Des hotspots de déamidation spécifiques à la position, des groupements de déamidation d'asparagine/glutamine et des niveaux globaux de modification utilisant la trypsine comme référence sont utilisés pour fournir des métriques d'authentification complètes et fiables. Ensemble, ces travaux apportent des contributions originales à la paléoprotéomique. En établissant la proportion de spectres anciens non identifiés, en développant une approche d'identification hybride privilégiant le de novo, et en exploitant des motifs de déamidation à plusieurs niveaux pour l'authentification des protéines anciennes, ils posent les bases de solutions bioinformatiques améliorées par apprentissage automatique pour les défis associés aux protéines anciennes.
Title: Guardians of ancient protein galaxies : introducing Orthrus/Anubis for ancient protein sequencing and authentication
Description:
Gardiens d'anciennes galaxies de protéines : introduction d'Orthrus/Anubis pour le séquençage et l'authentification de protéines anciennes
L'étude des protéines anciennes a éclairé un large éventail de questions de recherche, y compris les paléodiètes, les histoires évolutives, les dynamiques sociales et les voies de préservation des protéines sur le long terme.
Malgré l'importance archéologique et chimique des protéines anciennes, d'importants défis analytiques persistent et entravent les progrès de la paléoprotéomique en tant que domaine en pleine croissance.
Premièrement, il est difficile d'extraire des protéines anciennes sans perte ni destruction d'échantillons.
Les protocoles de protéomique modernes peuvent ne pas être optimisés pour les matériaux archéologiques.
Deuxièmement, la spectrométrie de masse en tandem (MS/MS) est la norme d'excellence pour l'attribution à haute résolution et spécifique aux taxons des substrats anciens.
Cependant, en raison de leur nature et de leur état de conservation, ces substrats peuvent entraîner une faible efficacité d'ionisation et des schémas de fragmentation peu clairs.
L'acquisition de spectres d'ions fragments (MS2) est tout aussi difficile, car les méthodes existantes peuvent conduire à une sous-représentation des protéines en faible abondance ou à des spectres MS2 multiplex difficiles à interpréter.
Enfin, l'identification et l'authentification des protéines anciennes restent des défis bioinformatiques substantiels.
Il n'est pas clair si la recherche dans les bases de données conventionnelles est adaptée pour identifier des substrats archéologiques avec des sources de protéines dynamiques et des protéines anciennes fragmentées et modifiées.
Il n'existe pas non plus de méthode standardisée pour séparer les protéines anciennes putatives des contaminants modernes.
Je tente de relever ces défis bioinformatiques en estimant la taille existante des spectres MS2 non identifiables (spectres sans histoires) et en introduisant deux nouvelles approches computationnelles : Orthrus et Anubis.
Quinze millions de données MS2 publiquement disponibles ont été collectées, et il a été estimé que 94 % des ensembles de données anciennes restent non identifiés.
Orthrus est une pipeline Python open source, prête pour le cloud et alimentée par l'IA.
Elle exploite le séquençage de novo assisté par transformateur et la recherche dans des bases de données conçues en Rust avec un rescoring amélioré par apprentissage automatique.
Orthrus a été comparé à PEAKS® 11, MetaNovo et MaxQuant, surpassant les outils existants en termes de résolution taxonomique et de couverture de séquence protéique.
Anubis est une échelle d'authentification pour les protéines anciennes utilisant la classification par forêt aléatoire et des motifs de déamidation comparatifs à plusieurs niveaux.
Des hotspots de déamidation spécifiques à la position, des groupements de déamidation d'asparagine/glutamine et des niveaux globaux de modification utilisant la trypsine comme référence sont utilisés pour fournir des métriques d'authentification complètes et fiables.
Ensemble, ces travaux apportent des contributions originales à la paléoprotéomique.
En établissant la proportion de spectres anciens non identifiés, en développant une approche d'identification hybride privilégiant le de novo, et en exploitant des motifs de déamidation à plusieurs niveaux pour l'authentification des protéines anciennes, ils posent les bases de solutions bioinformatiques améliorées par apprentissage automatique pour les défis associés aux protéines anciennes.
Related Results
Caractérisation du candidat protoamas de galaxies PLCK G256.8-33.2 avec les données photométriques du VLT et de Spitzer
Caractérisation du candidat protoamas de galaxies PLCK G256.8-33.2 avec les données photométriques du VLT et de Spitzer
L’Univers, à l’origine homogène et isotrope d’après l’observation du Fond Diffus Cosmologique, s’est structuré au fil du temps. De petites surdensités de matière, principalement de...
The structure and evolution of galaxies via their bulges and disks in the nearby Universe
The structure and evolution of galaxies via their bulges and disks in the nearby Universe
La structure et l'évolution des galaxies par leurs bulbes et disques dans l'Univers proche
L’astronome Edwin Hubble classa les galaxies selon leurs formes, créant a...
Galaxy evolution in clusters and groups up to z~3
Galaxy evolution in clusters and groups up to z~3
L’évolution des galaxies dans les amas et les groupes jusqu’à z ~ 3
L'un des principaux défis de l'astrophysique extragalactique actuelle est de comprendre comment...
Gamma-ray bursts as probes of the high-redshift universe : studies on Lyman-alpha and Lyman continuum emission in the host galaxies of gamma-ray bursts
Gamma-ray bursts as probes of the high-redshift universe : studies on Lyman-alpha and Lyman continuum emission in the host galaxies of gamma-ray bursts
Les sursauts gamma comme sondes de l'univers à grand décalage spectral : études sur l'émission Lyman-alpha et Lyman continuum dans les galaxies hôtes de sursauts gamma
...
Les halos Lyman alpha des galaxies distantes vus par MUSE : étude du milieu circum-galactique
Les halos Lyman alpha des galaxies distantes vus par MUSE : étude du milieu circum-galactique
Le milieu circum-galactique (CGM pour "Circum-Galactic Medium" en anglais) constitue l'interface entre les galaxies et les grandes structures au sein desquelles elles évoluent. Le ...
Modélisation de l'émission Lyman-alpha dans les galaxies à grand décalage spectral et simulations cosmologiques
Modélisation de l'émission Lyman-alpha dans les galaxies à grand décalage spectral et simulations cosmologiques
Depuis une quinzaine d'années, de nombreuses galaxies sont détectées grâce à leur raie d'émission Lyman-alpha à des décalages spectraux supérieurs à 3. Ces objets, dits Émetteurs L...
Resolved properties of high redshift lensed galaxies
Resolved properties of high redshift lensed galaxies
Propriétés Résolues des Galaxies Fortement Lentillées
L'étude des propriétés résolues des galaxies lointaines peut apporter des connaissances fondamentales sur les ...
Matter in the largest structures of the Universe : from galaxies to filaments, observations and data analysis
Matter in the largest structures of the Universe : from galaxies to filaments, observations and data analysis
La matière dans les plus grandes structures de l’Univers : des galaxies aux filaments, observations et analyse de données
L'étude de l'évolution et de la compositio...

