Search engine for discovering works of Art, research articles, and books related to Art and Culture
ShareThis
Javascript must be enabled to continue!

Apprentissage profond bout-en-bout pour le rehaussement de la parole

View through CrossRef
Cette thèse s'insère dans le développement des systèmes de télécommunication mains-libres, en particulier avec des enceintes intelligentes en environnement domestique. L'utilisateur interagit avec un correspondant distant en étant généralement situé à quelques mètres de ce type de système. Les microphones sont susceptibles de capter des sons de l'environnement qui se mêlent à la voix de l'utilisateur, comme le bruit ambiant, l'écho acoustique et la réverbération. Ces types de distorsions peuvent gêner fortement l'écoute et la compréhension de la conversation par le correspondant distant, et il est donc nécessaire de les réduire. Des méthodes de filtrage existent pour réduire individuellement chacun de ces types de distorsion sonore, et leur réduction simultanée implique de combiner ces méthodes. Toutefois, celles-ci interagissent entre elles, et leurs interactions peuvent dégrader de la voix de l'utilisateur. Il est donc nécessaire d'optimiser conjointement ces méthodes. En premier lieu, nous présentons une approche de réduction de l'écho acoustique combinant un filtre d'annulation d'écho avec un post-filtre de suppression d'écho résiduel conçu de manière à s'adapter à différents modes de fonctionnement du filtre d'annulation. Pour cela, nous proposons d'estimer les coefficients du post-filtre en utilisant les spectres à court terme de plusieurs signaux observés, dont le signal estimé par le filtre d'annulation, en entrée d'un réseau de neurones. Nous montrons que cette approche améliore la performance et la robustesse du post-filtre en matière de réduction d'écho, tout en limitant la dégradation de la parole de l'utilisateur, sur plusieurs scénarios dans des conditions réelles. En second lieu, nous décrivons une approche conjointe de réduction multicanale de l'écho, de la réverbération et du bruit. Nous proposons de modéliser simultanément la parole cible et les signaux résiduels après annulation d'écho et déréverbération dans un cadre probabiliste et de représenter conjointement leurs spectres à court terme à l'aide d'un réseau de neurones récurrent. Nous intégrons cette modélisation dans un algorithme de montée par blocs de coordonnées pour mettre à jour les filtres d'annulation d'écho et de déréverbération, ainsi que le post-filtre de suppression des signaux résiduels. Nous évaluons notre approche sur des enregistrements réels dans différentes conditions. Nous montrons qu'elle améliore la qualité de la parole ainsi que la réduction de l'écho, de la réverbération et du bruit, par rapport à une approche optimisant séparément les méthodes de filtrage et une autre approche de réduction conjointe. En dernier lieu, nous formulons une version en ligne de notre approche adaptée aux situations où les conditions acoustiques varient dans le temps. Nous évaluons la qualité perceptuelle sur des exemples réels où l'utilisateur se déplace durant la conversation.
Agence Bibliographique de l'Enseignement Supérieur
Title: Apprentissage profond bout-en-bout pour le rehaussement de la parole
Description:
Cette thèse s'insère dans le développement des systèmes de télécommunication mains-libres, en particulier avec des enceintes intelligentes en environnement domestique.
L'utilisateur interagit avec un correspondant distant en étant généralement situé à quelques mètres de ce type de système.
Les microphones sont susceptibles de capter des sons de l'environnement qui se mêlent à la voix de l'utilisateur, comme le bruit ambiant, l'écho acoustique et la réverbération.
Ces types de distorsions peuvent gêner fortement l'écoute et la compréhension de la conversation par le correspondant distant, et il est donc nécessaire de les réduire.
Des méthodes de filtrage existent pour réduire individuellement chacun de ces types de distorsion sonore, et leur réduction simultanée implique de combiner ces méthodes.
Toutefois, celles-ci interagissent entre elles, et leurs interactions peuvent dégrader de la voix de l'utilisateur.
Il est donc nécessaire d'optimiser conjointement ces méthodes.
En premier lieu, nous présentons une approche de réduction de l'écho acoustique combinant un filtre d'annulation d'écho avec un post-filtre de suppression d'écho résiduel conçu de manière à s'adapter à différents modes de fonctionnement du filtre d'annulation.
Pour cela, nous proposons d'estimer les coefficients du post-filtre en utilisant les spectres à court terme de plusieurs signaux observés, dont le signal estimé par le filtre d'annulation, en entrée d'un réseau de neurones.
Nous montrons que cette approche améliore la performance et la robustesse du post-filtre en matière de réduction d'écho, tout en limitant la dégradation de la parole de l'utilisateur, sur plusieurs scénarios dans des conditions réelles.
En second lieu, nous décrivons une approche conjointe de réduction multicanale de l'écho, de la réverbération et du bruit.
Nous proposons de modéliser simultanément la parole cible et les signaux résiduels après annulation d'écho et déréverbération dans un cadre probabiliste et de représenter conjointement leurs spectres à court terme à l'aide d'un réseau de neurones récurrent.
Nous intégrons cette modélisation dans un algorithme de montée par blocs de coordonnées pour mettre à jour les filtres d'annulation d'écho et de déréverbération, ainsi que le post-filtre de suppression des signaux résiduels.
Nous évaluons notre approche sur des enregistrements réels dans différentes conditions.
Nous montrons qu'elle améliore la qualité de la parole ainsi que la réduction de l'écho, de la réverbération et du bruit, par rapport à une approche optimisant séparément les méthodes de filtrage et une autre approche de réduction conjointe.
En dernier lieu, nous formulons une version en ligne de notre approche adaptée aux situations où les conditions acoustiques varient dans le temps.
Nous évaluons la qualité perceptuelle sur des exemples réels où l'utilisateur se déplace durant la conversation.

Related Results

Unsupervised multilingual models of speech representation, an approach inspired by cognitive science
Unsupervised multilingual models of speech representation, an approach inspired by cognitive science
Apprentissage non supervisé de modèles multilingues de représentation de la parole, une approche inspirée des sciences cognitives La parole, qui est essentielle à l...
Metabolomic analysis of equine skeletal muscle during high-intensity interval exercise: a comparison of two different rest intervals
Metabolomic analysis of equine skeletal muscle during high-intensity interval exercise: a comparison of two different rest intervals
High-intensity exercise training is accepted as an effective strategy to induce training adaptations. However, physiological responses to this type of exercise are not fully elucid...
Implicit and explicit phase modeling in deep learning-based source separation
Implicit and explicit phase modeling in deep learning-based source separation
Modélisation implicite et explicite de la phase dans la séparation de sources par apprentissage profond Qu'elle soit traitée par des humains ou des machines, la par...
Apprentissage profond multimodal appliqué à l'usinage
Apprentissage profond multimodal appliqué à l'usinage
Les techniques axées sur les données ont offert à la technologie de fabrication intelligente des opportunités sans précédent pour assurer la transition vers une productivité basée ...
Deep Learning-based Methods for Radiotherapy Dose Optimization
Deep Learning-based Methods for Radiotherapy Dose Optimization
Apprentissage profond pour l'optimisation des doses en radiothérapie La radiothérapie est un pilier du traitement moderne du cancer. La simulation de la dose de rad...
Geometric deep learning for structural bioinformatics
Geometric deep learning for structural bioinformatics
Apprentissage profond géométrique pour la bioinformatique structurale L'apprentissage automatique a permis plusieurs percées dans la gestion des données tabulaires,...
Modélisations pour la reconnaissance de la parole à données contraintes
Modélisations pour la reconnaissance de la parole à données contraintes
Cette thèse s'inscrit dans le cadre du développement de systèmes de reconnaissance de la parole à données contraintes. Depuis une dizaine d'années, les réseaux de neurones profonds...

Back to Top