Javascript must be enabled to continue!
Imputation multiple adaptée aux données non-aléatoirement manquantes (MNAR)
View through CrossRef
En présence de données manquantes issues d’un mécanisme aléatoire (MAR), l’une des méthodes les plus utilisées est l’Imputation Multiple par Équations Chaînées (MICE). MICE requiert la spécification d’un modèle d’imputation conditionnel pour chaque variable présentant des données manquantes. Suivant ces modèles, les données manquantes sont imputées de manière itérative. Cependant, en présence de données manquantes avec un mécanisme non aléatoire (MNAR), il est habituel de considérer que cette méthode conduit à des estimations possiblement biaisées. En effet, en présence d’un mécanisme MNAR, la validité des inférences dépend de notre capacité à modéliser de manière jointe la variable d’intérêt et son indicatrice de données manquantes, ce qui n’est généralement pas fait dans une approche MICE. Issue de l’économétrie, la méthode d’Heckman, aussi appelée méthode "sample selection" traite un échantillon présentant un biais de sélection en modélisant deux équations de manière jointe. Ces deux équations sont l’équation modélisant la sélection et l’équation modélisant la variable d’intérêt. La méthode d’Heckman a été appliquée avec succès pour tenir compte des données manquantes MNAR sur la variable d’intérêt. Néanmoins, cette approche ne permet pas de gérer le problème des données manquantes de manière globale, i.e. sur la variable d’intérêt et sur les variables explicatives d’un modèle de régression, ce qui limite son utilisation en épidémiologie clinique. Au cours de cette thèse, nous avons d’abord développé un modèle d’imputation pour des données MNAR utilisant la méthode d’Heckman et son estimateur en deux étapes, pour une variable d’intérêt continue. Par la suite, nous avons développé des modèles d’imputation utilisant l’estimateur du modèle d’Heckman par maximisation directe de la vraisemblance du modèle joint, pour des variables d’intérêt aussi bien continues que binaires. L’inclusion de ces modèles d’imputation dans un processus d’imputation par équations chaînées permet de traiter simultanément les données manquantes MAR sur des covariables. Notre approche a été validée par simulation et illustrée sur les données d’un essai clinique, mené sur des patients traités contre le virus de la grippe saisonnière.
Title: Imputation multiple adaptée aux données non-aléatoirement manquantes (MNAR)
Description:
En présence de données manquantes issues d’un mécanisme aléatoire (MAR), l’une des méthodes les plus utilisées est l’Imputation Multiple par Équations Chaînées (MICE).
MICE requiert la spécification d’un modèle d’imputation conditionnel pour chaque variable présentant des données manquantes.
Suivant ces modèles, les données manquantes sont imputées de manière itérative.
Cependant, en présence de données manquantes avec un mécanisme non aléatoire (MNAR), il est habituel de considérer que cette méthode conduit à des estimations possiblement biaisées.
En effet, en présence d’un mécanisme MNAR, la validité des inférences dépend de notre capacité à modéliser de manière jointe la variable d’intérêt et son indicatrice de données manquantes, ce qui n’est généralement pas fait dans une approche MICE.
Issue de l’économétrie, la méthode d’Heckman, aussi appelée méthode "sample selection" traite un échantillon présentant un biais de sélection en modélisant deux équations de manière jointe.
Ces deux équations sont l’équation modélisant la sélection et l’équation modélisant la variable d’intérêt.
La méthode d’Heckman a été appliquée avec succès pour tenir compte des données manquantes MNAR sur la variable d’intérêt.
Néanmoins, cette approche ne permet pas de gérer le problème des données manquantes de manière globale, i.
e.
sur la variable d’intérêt et sur les variables explicatives d’un modèle de régression, ce qui limite son utilisation en épidémiologie clinique.
Au cours de cette thèse, nous avons d’abord développé un modèle d’imputation pour des données MNAR utilisant la méthode d’Heckman et son estimateur en deux étapes, pour une variable d’intérêt continue.
Par la suite, nous avons développé des modèles d’imputation utilisant l’estimateur du modèle d’Heckman par maximisation directe de la vraisemblance du modèle joint, pour des variables d’intérêt aussi bien continues que binaires.
L’inclusion de ces modèles d’imputation dans un processus d’imputation par équations chaînées permet de traiter simultanément les données manquantes MAR sur des covariables.
Notre approche a été validée par simulation et illustrée sur les données d’un essai clinique, mené sur des patients traités contre le virus de la grippe saisonnière.
Related Results
Supervised learning with missing data : a non-asymptotic point of view
Supervised learning with missing data : a non-asymptotic point of view
Données manquantes en apprentissage supervisé
Les valeurs manquantes sont courantes dans la plupart des ensembles de données du monde réel, en raison de la combinai...
GSimp: A Gibbs sampler based left-censored missing value imputation approach for metabolomics studies
GSimp: A Gibbs sampler based left-censored missing value imputation approach for metabolomics studies
Abstract
Left-censored missing values commonly exist in targeted metabolomics datasets and can be considered as missing not at random (MNAR). Imp...
Advanced methods for missing values imputation based on similarity learning
Advanced methods for missing values imputation based on similarity learning
The real-world data analysis and processing using data mining techniques often are facing observations that contain missing values. The main challenge of mining datasets is the exi...
Trust evaluation for stream data services based on data quality and service performance
Trust evaluation for stream data services based on data quality and service performance
Évaluation de la fiabilité des services de flux données en se basant sur la qualité de données et la performance du service
Ces dernières années ont été marquées pa...
A multiple imputation approach for MNAR mechanisms compatible with Heckman's model
A multiple imputation approach for MNAR mechanisms compatible with Heckman's model
Standard implementations of multiple imputation (MI) approaches provide unbiased inferences based on an assumption of underlying missing at random (MAR) mechanisms. However, in the...
Data quality issues in mobile crowdsensing environments
Data quality issues in mobile crowdsensing environments
Qualité des données dans les environnements de capteurs mobiles
Les environnements de capteurs mobiles sont devenus le paradigme de référence pour exploiter les cap...
Prediction of mobility data with prior on the topography of an infrastructure of a road network
Prediction of mobility data with prior on the topography of an infrastructure of a road network
Complétion par construction de données de mobilité avec a priori sur la topographie et infrastructure du réseau routier
L'évolution de l'acquisition de données de m...
Synthèse géologique et hydrogéologique du Shale d'Utica et des unités sus-jacentes (Lorraine, Queenston et dépôts meubles), Basses-Terres du Saint-Laurent, Québec
Synthèse géologique et hydrogéologique du Shale d'Utica et des unités sus-jacentes (Lorraine, Queenston et dépôts meubles), Basses-Terres du Saint-Laurent, Québec
Le présent travail a été initié dans le cadre d'un mandat donné à l'INRS-ETE par la Commission géologique du Canada (CGC) et le Ministère du Développement durable, de l'Environneme...

