Search engine for discovering works of Art, research articles, and books related to Art and Culture
ShareThis
Javascript must be enabled to continue!

Forêts aléatoires pour données longitudinales de grande dimension

View through CrossRef
Introduites par Leo Breiman en 2001, les forêts aléatoires sont une méthode d’apprentissage statistique largement utilisée dans de nombreux domaines de recherche scientifiques tant pour sa capacité à décrire des relations complexes entre des variables explicatives et une variable réponse que pour sa faculté à traiter des données de grande dimension. Dans de nombreuses applications en santé, on dispose de mesures répétées au cours du temps. On parle alors de données longitudinales. Les corrélations induites entre les mesures d’un même individu à différents temps doivent être prises en compte, ce qui n’est pas le cas dans la méthode classique des forêts aléatoires. L’objectif de cette thèse est d’adapter cette méthode à l’analyse des données longitudinales dans un contexte de grande dimension. Pour ce faire, deux approches sont proposées. La première s’appuie sur l’utilisation d’un modèle semi-paramétrique à effets mixtes qui permet de prendre en compte la structure de covariance intra-individuelle dans la construction de la forêt aléatoire. Cette méthode a été appliquée à un essai vaccinal contre le VIH et a permis de sélectionner 21 transcrits de gènes pour lesquels l’association avec la charge virale du VIH était en adéquation avec les résultats observés lors de l’infection primaire. La seconde se place dans le cadre plus général de la régression sur des espaces métriques. Dans ce contexte, les données répétées sont traitées comme des courbes. Nous introduisons alors le concept de forêts aléatoires de Fréchet qui permet d’apprendre des relations entre des variables de natures diverses, comme des courbes, des images ou des formes, dans des espaces métriques non ordonnés. Nous décrivons une nouvelle manière de découper les nœuds des arbres constituant la forêt de Fréchet puis nous détaillons la procédure de prédiction pour une variable de sortie à valeurs dans un espace non euclidien. Les notions classiques d’erreur OOB ainsi que d’importance des variables sont adaptées aux forêts aléatoires de Fréchet. Un théorème de consistance pour les régressogrammes de Fréchet utilisant des partitions données-dépendantes est énoncé puis appliqué aux arbres de Fréchet purement uniformément aléatoires. Une étude de simulations est ensuite menée pour étudier le comportement de cette nouvelle méthode dans le cadre de la régression sur courbes, images et scalaires. Enfin, la méthode des forêts aléatoires de Fréchet est appliquée à l’analyse de deux essais vaccinaux de grande dimension sur le VIH.
Agence Bibliographique de l'Enseignement Supérieur
Title: Forêts aléatoires pour données longitudinales de grande dimension
Description:
Introduites par Leo Breiman en 2001, les forêts aléatoires sont une méthode d’apprentissage statistique largement utilisée dans de nombreux domaines de recherche scientifiques tant pour sa capacité à décrire des relations complexes entre des variables explicatives et une variable réponse que pour sa faculté à traiter des données de grande dimension.
Dans de nombreuses applications en santé, on dispose de mesures répétées au cours du temps.
On parle alors de données longitudinales.
Les corrélations induites entre les mesures d’un même individu à différents temps doivent être prises en compte, ce qui n’est pas le cas dans la méthode classique des forêts aléatoires.
L’objectif de cette thèse est d’adapter cette méthode à l’analyse des données longitudinales dans un contexte de grande dimension.
Pour ce faire, deux approches sont proposées.
La première s’appuie sur l’utilisation d’un modèle semi-paramétrique à effets mixtes qui permet de prendre en compte la structure de covariance intra-individuelle dans la construction de la forêt aléatoire.
Cette méthode a été appliquée à un essai vaccinal contre le VIH et a permis de sélectionner 21 transcrits de gènes pour lesquels l’association avec la charge virale du VIH était en adéquation avec les résultats observés lors de l’infection primaire.
La seconde se place dans le cadre plus général de la régression sur des espaces métriques.
Dans ce contexte, les données répétées sont traitées comme des courbes.
Nous introduisons alors le concept de forêts aléatoires de Fréchet qui permet d’apprendre des relations entre des variables de natures diverses, comme des courbes, des images ou des formes, dans des espaces métriques non ordonnés.
Nous décrivons une nouvelle manière de découper les nœuds des arbres constituant la forêt de Fréchet puis nous détaillons la procédure de prédiction pour une variable de sortie à valeurs dans un espace non euclidien.
Les notions classiques d’erreur OOB ainsi que d’importance des variables sont adaptées aux forêts aléatoires de Fréchet.
Un théorème de consistance pour les régressogrammes de Fréchet utilisant des partitions données-dépendantes est énoncé puis appliqué aux arbres de Fréchet purement uniformément aléatoires.
Une étude de simulations est ensuite menée pour étudier le comportement de cette nouvelle méthode dans le cadre de la régression sur courbes, images et scalaires.
Enfin, la méthode des forêts aléatoires de Fréchet est appliquée à l’analyse de deux essais vaccinaux de grande dimension sur le VIH.

Related Results

Trust evaluation for stream data services based on data quality and service performance
Trust evaluation for stream data services based on data quality and service performance
Évaluation de la fiabilité des services de flux données en se basant sur la qualité de données et la performance du service Ces dernières années ont été marquées pa...
Random Matrix Theory for AI : From Theory to Practice
Random Matrix Theory for AI : From Theory to Practice
La théorie des matrices aléatoires pour l'IA : de la théorie à la pratique De nos jours, l'IA repose en grande partie sur l'utilisation de données de grande taille ...
Modeling departures from normality in meta-analysis
Modeling departures from normality in meta-analysis
Modélisation des écarts à la normalité dans la méta-analyse La méta-analyse à effets aléatoires suppose généralement une distribution normale des effets spécifiques...
Télédétection des forêts dégradées en Guinée à partir des données Sentinel-2
Télédétection des forêts dégradées en Guinée à partir des données Sentinel-2
La dégradation forestière englobe tout ce qui peut abîmer et fragiliser la forêt : coupes sélectives pour les bois rares, incendies, sécheresse, etc. La dégradation des forêts est ...
L'action collective locale et la gestion des forêts communautaires : cas des communautés rurales de Djoum au Sud Cameroun
L'action collective locale et la gestion des forêts communautaires : cas des communautés rurales de Djoum au Sud Cameroun
La recherche porte sur l’action collective locale et la gestion des forêts communautaires à Djoum au Sud Cameroun. Elle analyse l’approche gouvernementale d’octroi et de gestion co...
Incremental Alignment of Heterogeneous and Dynamic Data for Decision Support
Incremental Alignment of Heterogeneous and Dynamic Data for Decision Support
Alignement incrémental de données hétérogènes et dynamiques pour l'aide à la décision A l'ère du Big Data, où les données sont massives et leur complexité croissant...
Some problems in Random Matrix Theory and High-Dimensional Statistics
Some problems in Random Matrix Theory and High-Dimensional Statistics
Quelques problèmes de matrices aléatoires et de statistiques en grande dimension Cette thèse explore certains problèmes liés aux grandes matrices aléatoires et aux ...

Back to Top