Javascript must be enabled to continue!
Modélisations pour la reconnaissance de la parole à données contraintes
View through CrossRef
Cette thèse s'inscrit dans le cadre du développement de systèmes de reconnaissance de la parole à données contraintes. Depuis une dizaine d'années, les réseaux de neurones profonds ont permis d'améliorer grandement la performance des systèmes de reconnaissance de la parole. Le succès de l'apprentissage profond va de pair avec l'utilisation de milliers d'heures de parole transcrite manuellement et avec l'augmentation du nombre de paramètres des modèles. Cependant, la constitution de corpus de parole annotée est le résultat d'un processus long et coûteux ce qui limite les quantités disponibles pour certaines conditions. Pour cette raison, nous nous intéressons au développement de systèmes avec très peu de données (quelques heures), en particulier pour traiter la parole conversationnelle. Les travaux actuels à l'état de l'art montrent qu'en dessous de quelques dizaines d'heures de données d'apprentissage de parole, les systèmes hybrides avec modélisation acoustique et linguistique séparées sont plus efficaces que les systèmes neuronaux de bout-en-bout. Nous privilégions donc ces approches en nous intéressant en particulier à la modélisation acoustique multilingue avec la mutualisation de données issues de sources différentes. Pour les modèles multilingues, nous analysons la répartition des données à adopter entre différentes sources selon la proximité des langues d'apprentissage et des langues cibles. De plus, nous évaluons l'utilisation directe des modèles acoustiques multilingues sans adaptation et une adaptation par transfert de connaissance vers une nouvelle langue sur quatre langues cibles (amharique, assamais, géorgien et kurmandji) du programme iARPA Babel. Ces langues présentent des caractéristiques linguistiques différentes et choisies pour couvrir plusieurs familles de langue. Un apprentissage adaptatif est aussi proposé par le biais de l'ajout d'une représentation vectorielle de la langue dans le modèle acoustique. Nous utilisons les différents modèles multilingues obtenus pour décoder la parole ou pour extraire dse paramètres acoustiques multilingues. Cette dernière approche est également évaluée sur le corpus sud-africain Soap Operas, comportant de l'alternance codique. Ensuite, nous comparons nos modèles hybrides et des modèles multilingues pré-entraînés par auto-supervision sur des corpus de très grande taille et provenant de domaines variés. Quelle que soit la méthode d'apprentissage et la langue de test, nous montrons que les systèmes hybrides multilingues restent compétitifs et robustes pour les données sous contraintes et qu'ils présentent l'avantage d'être industrialisables, car plus légers et plus facilement embarquables. Enfin, nous montrons l'apport de la modélisation acoustique multilingue sur une tâche de détection de mots-clés lorsque peu de données monolingues sont disponibles.
Title: Modélisations pour la reconnaissance de la parole à données contraintes
Description:
Cette thèse s'inscrit dans le cadre du développement de systèmes de reconnaissance de la parole à données contraintes.
Depuis une dizaine d'années, les réseaux de neurones profonds ont permis d'améliorer grandement la performance des systèmes de reconnaissance de la parole.
Le succès de l'apprentissage profond va de pair avec l'utilisation de milliers d'heures de parole transcrite manuellement et avec l'augmentation du nombre de paramètres des modèles.
Cependant, la constitution de corpus de parole annotée est le résultat d'un processus long et coûteux ce qui limite les quantités disponibles pour certaines conditions.
Pour cette raison, nous nous intéressons au développement de systèmes avec très peu de données (quelques heures), en particulier pour traiter la parole conversationnelle.
Les travaux actuels à l'état de l'art montrent qu'en dessous de quelques dizaines d'heures de données d'apprentissage de parole, les systèmes hybrides avec modélisation acoustique et linguistique séparées sont plus efficaces que les systèmes neuronaux de bout-en-bout.
Nous privilégions donc ces approches en nous intéressant en particulier à la modélisation acoustique multilingue avec la mutualisation de données issues de sources différentes.
Pour les modèles multilingues, nous analysons la répartition des données à adopter entre différentes sources selon la proximité des langues d'apprentissage et des langues cibles.
De plus, nous évaluons l'utilisation directe des modèles acoustiques multilingues sans adaptation et une adaptation par transfert de connaissance vers une nouvelle langue sur quatre langues cibles (amharique, assamais, géorgien et kurmandji) du programme iARPA Babel.
Ces langues présentent des caractéristiques linguistiques différentes et choisies pour couvrir plusieurs familles de langue.
Un apprentissage adaptatif est aussi proposé par le biais de l'ajout d'une représentation vectorielle de la langue dans le modèle acoustique.
Nous utilisons les différents modèles multilingues obtenus pour décoder la parole ou pour extraire dse paramètres acoustiques multilingues.
Cette dernière approche est également évaluée sur le corpus sud-africain Soap Operas, comportant de l'alternance codique.
Ensuite, nous comparons nos modèles hybrides et des modèles multilingues pré-entraînés par auto-supervision sur des corpus de très grande taille et provenant de domaines variés.
Quelle que soit la méthode d'apprentissage et la langue de test, nous montrons que les systèmes hybrides multilingues restent compétitifs et robustes pour les données sous contraintes et qu'ils présentent l'avantage d'être industrialisables, car plus légers et plus facilement embarquables.
Enfin, nous montrons l'apport de la modélisation acoustique multilingue sur une tâche de détection de mots-clés lorsque peu de données monolingues sont disponibles.
Related Results
Trust evaluation for stream data services based on data quality and service performance
Trust evaluation for stream data services based on data quality and service performance
Évaluation de la fiabilité des services de flux données en se basant sur la qualité de données et la performance du service
Ces dernières années ont été marquées pa...
L’Acte de Parole Directif dans la Bande-Dessinée (BD) Astérix Chez les Helvètes par René Goscinny et Albert Uderzo
L’Acte de Parole Directif dans la Bande-Dessinée (BD) Astérix Chez les Helvètes par René Goscinny et Albert Uderzo
Les actes pris par les humains quand se divise prononcent ce discours est appelé des actes de parole. L’actes de parole a divisé en trois types, ces sont l’acte de parole locutoire...
L’ACTE DE PAROLE DIRECTIF DANS LA BANDE-DESSINEE (BD) ASTERIX CHEZ LES HELVETES PAR RENE GOSCINNY ET ALBERT UDERZO. MEMOIRE
L’ACTE DE PAROLE DIRECTIF DANS LA BANDE-DESSINEE (BD) ASTERIX CHEZ LES HELVETES PAR RENE GOSCINNY ET ALBERT UDERZO. MEMOIRE
Les actes pris par les humains quand se divise prononcent ce discours est appelé des actes de parole. L’actes de parole a divisé en trois types, ces sont l’acte de parole locutoire...
Synthèse géologique et hydrogéologique du Shale d'Utica et des unités sus-jacentes (Lorraine, Queenston et dépôts meubles), Basses-Terres du Saint-Laurent, Québec
Synthèse géologique et hydrogéologique du Shale d'Utica et des unités sus-jacentes (Lorraine, Queenston et dépôts meubles), Basses-Terres du Saint-Laurent, Québec
Le présent travail a été initié dans le cadre d'un mandat donné à l'INRS-ETE par la Commission géologique du Canada (CGC) et le Ministère du Développement durable, de l'Environneme...
Évaluation de l’intelligibilité de la parole par apprentissage profond : vers plus d’interprétabilité en phonétique clinique
Évaluation de l’intelligibilité de la parole par apprentissage profond : vers plus d’interprétabilité en phonétique clinique
Assessment of Speech Intelligibility using Deep Learning : Towards Enhanced Interpretability in Clinical Phonetics
L’intelligibilité de la parole est une composante...
Incremental Alignment of Heterogeneous and Dynamic Data for Decision Support
Incremental Alignment of Heterogeneous and Dynamic Data for Decision Support
Alignement incrémental de données hétérogènes et dynamiques pour l'aide à la décision
A l'ère du Big Data, où les données sont massives et leur complexité croissant...
Physical database design in document stores
Physical database design in document stores
NoSQL is an umbrella term used to classify alternate storage systems to the traditional Relational Database Management Systems (RDBMSs). Among these, Document stores have gained po...
Prediction of mobility data with prior on the topography of an infrastructure of a road network
Prediction of mobility data with prior on the topography of an infrastructure of a road network
Complétion par construction de données de mobilité avec a priori sur la topographie et infrastructure du réseau routier
L'évolution de l'acquisition de données de m...

