Search engine for discovering works of Art, research articles, and books related to Art and Culture
ShareThis
Javascript must be enabled to continue!

Contributions to Safe Reinforcement Learning and Degradation Tolerant Control Design

View through CrossRef
Contributions à l'apprentissage par renforcement de commande sûre de fonctionnement et synthèse de commande tolérante aux dégradations Les systèmes dynamiques critiques pour la sécurité sont essentiels dans divers secteurs, tels que l'aérospatiale, les systèmes autonomes et les robots en santé, où des défaillances peuvent avoir des conséquences catastrophiques. Un défi majeur est la prise en compte de la dégradation des composants et des actionneurs, compromettant la sécurité et la stabilité des systèmes. Il est donc crucial d'intégrer l'état de santé du système dans la conception de la commande pour assurer une tolérance à la dégradation fonctionnelle. Ces systèmes impliquent souvent des incertitudes et des connaissances incomplètes, nécessitant des approches d'apprentissage pour assimiler les données disponibles. L'apprentissage par renforcement (RL) est une approche puissante capable de synthétiser des lois de commande optimales pour des systèmes dynamiques partiellement ou totalement inconnus. Cependant, le développement de ces approches présente des défis : la phase d'exploration nécessaire à l'apprentissage peut entraîner le système dans des régions non sûres, accélérant la dégradation des composants ; en outre, des garanties de sécurité pendant la phase opérationnelle sont cruciales pour assurer la sécurité continue du système. Le paradigme de l'apprentissage par renforcement sûr (Safe RL) vise à développer des approches RL prioritaires aux garanties de sécurité, ainsi qu'à la stabilité et l'optimalité des systèmes. Cette thèse aborde ces défis en synthétisant de nouvelles stratégies d'apprentissage de commande adaptatives aux incertitudes et à la dégradation fonctionnelle. Les contributions principales incluent :• garantir l'optimalité, la sécurité et la stabilité de la loi de commande pendant les phases d'exploration et d'exploitation du RL. En intégrant les fonctions de barrière de commande (CBFs) et les fonctions de Lyapunov de commande (CLFs) dans le cadre du RL, l'exploration sécurisée et l'exploitation stable sont assurées pour les problèmes de régulation et de suivi de trajectoire. Les CBFs définissent des régions de fonctionnement sûres, tandis que les CLFs assurent la stabilité du système. Ces fonctions guident le processus d'apprentissage, garantissant le respect des contraintes de sécurité et de stabilité;• ralentir la vitesse de dégradation en intégrant les taux de dégradation dans la conception de la commande, utilisant initialement une approche de contrôle optimal en temps discret pour les systèmes linéaires. Cela garantit que les actions de contrôle minimisent la dégradation des composants, prolongeant leur durée de vie. Pour les systèmes non linéaires, des méthodes RL sont utilisées pour résoudre le problème en temps discret et continu, fournissant des solutions adaptables aux dynamiques complexes;• proposer un nouvel algorithme de RL cyclique pour garantir la stabilité du système en cas de dégradation des actionneurs. Cet algorithme met à jour dynamiquement la loi de commande apprise, assurant une adaptation adéquate à mesure que les composants se dégradent. La nature cyclique de l'algorithme permet une réévaluation et un ajustement des lois de commande, garantissant une performance optimale continue malgré la dégradation. Ces approches ont été mises en œuvre à travers des simulations, démontrant leur efficacité dans des applications académiques.
Agence Bibliographique de l'Enseignement Supérieur
Title: Contributions to Safe Reinforcement Learning and Degradation Tolerant Control Design
Description:
Contributions à l'apprentissage par renforcement de commande sûre de fonctionnement et synthèse de commande tolérante aux dégradations Les systèmes dynamiques critiques pour la sécurité sont essentiels dans divers secteurs, tels que l'aérospatiale, les systèmes autonomes et les robots en santé, où des défaillances peuvent avoir des conséquences catastrophiques.
Un défi majeur est la prise en compte de la dégradation des composants et des actionneurs, compromettant la sécurité et la stabilité des systèmes.
Il est donc crucial d'intégrer l'état de santé du système dans la conception de la commande pour assurer une tolérance à la dégradation fonctionnelle.
Ces systèmes impliquent souvent des incertitudes et des connaissances incomplètes, nécessitant des approches d'apprentissage pour assimiler les données disponibles.
L'apprentissage par renforcement (RL) est une approche puissante capable de synthétiser des lois de commande optimales pour des systèmes dynamiques partiellement ou totalement inconnus.
Cependant, le développement de ces approches présente des défis : la phase d'exploration nécessaire à l'apprentissage peut entraîner le système dans des régions non sûres, accélérant la dégradation des composants ; en outre, des garanties de sécurité pendant la phase opérationnelle sont cruciales pour assurer la sécurité continue du système.
Le paradigme de l'apprentissage par renforcement sûr (Safe RL) vise à développer des approches RL prioritaires aux garanties de sécurité, ainsi qu'à la stabilité et l'optimalité des systèmes.
Cette thèse aborde ces défis en synthétisant de nouvelles stratégies d'apprentissage de commande adaptatives aux incertitudes et à la dégradation fonctionnelle.
Les contributions principales incluent :• garantir l'optimalité, la sécurité et la stabilité de la loi de commande pendant les phases d'exploration et d'exploitation du RL.
En intégrant les fonctions de barrière de commande (CBFs) et les fonctions de Lyapunov de commande (CLFs) dans le cadre du RL, l'exploration sécurisée et l'exploitation stable sont assurées pour les problèmes de régulation et de suivi de trajectoire.
Les CBFs définissent des régions de fonctionnement sûres, tandis que les CLFs assurent la stabilité du système.
Ces fonctions guident le processus d'apprentissage, garantissant le respect des contraintes de sécurité et de stabilité;• ralentir la vitesse de dégradation en intégrant les taux de dégradation dans la conception de la commande, utilisant initialement une approche de contrôle optimal en temps discret pour les systèmes linéaires.
Cela garantit que les actions de contrôle minimisent la dégradation des composants, prolongeant leur durée de vie.
Pour les systèmes non linéaires, des méthodes RL sont utilisées pour résoudre le problème en temps discret et continu, fournissant des solutions adaptables aux dynamiques complexes;• proposer un nouvel algorithme de RL cyclique pour garantir la stabilité du système en cas de dégradation des actionneurs.
Cet algorithme met à jour dynamiquement la loi de commande apprise, assurant une adaptation adéquate à mesure que les composants se dégradent.
La nature cyclique de l'algorithme permet une réévaluation et un ajustement des lois de commande, garantissant une performance optimale continue malgré la dégradation.
Ces approches ont été mises en œuvre à travers des simulations, démontrant leur efficacité dans des applications académiques.

Related Results

Phylogenetic analysis of salt tolerant genes in local Thai rice and salt tolerant gene identification by F2 bulk-segregant analysis
Phylogenetic analysis of salt tolerant genes in local Thai rice and salt tolerant gene identification by F2 bulk-segregant analysis
Genetic diversity is important for developing salt-tolerant rice varieties. This research used the existing whole-exome sequences of eight Thai rice varieties, including the standa...
CREATING LEARNING MEDIA IN TEACHING ENGLISH AT SMP MUHAMMADIYAH 2 PAGELARAN ACADEMIC YEAR 2020/2021
CREATING LEARNING MEDIA IN TEACHING ENGLISH AT SMP MUHAMMADIYAH 2 PAGELARAN ACADEMIC YEAR 2020/2021
The pandemic Covid-19 currently demands teachers to be able to use technology in teaching and learning process. But in reality there are still many teachers who have not been able ...
STRENGTH OF BUTT WELDED BUTT JOINT OF REINFORCEMENT OF CLASS A500C
STRENGTH OF BUTT WELDED BUTT JOINT OF REINFORCEMENT OF CLASS A500C
The paper presents the results of experimental studies of the strength of cross-shaped welded joints of types К1-Кт and К3-Рр [1] of thermomechanically hardened reinforcement of cl...
Design
Design
Conventional definitions of design rarely capture its reach into our everyday lives. The Design Council, for example, estimates that more than 2.5 million people use design-related...
Progressive Optimal Fault-Tolerant Control Combining Active and Passive Control Manners
Progressive Optimal Fault-Tolerant Control Combining Active and Passive Control Manners
This study develops a progressive optimal fault-tolerant control method based on insufficient fault information. By combining passive and active fault-tolerant control manners duri...
Soil degradation – the result of anthropogenic factors
Soil degradation – the result of anthropogenic factors
Annotation Purpose. To develop a matrix for the classification of degradation processes, regarding the possibility of soil restoration according to their list, which will allow to ...
Nonlinear optimal control for robotic exoskeletons with electropneumatic actuators
Nonlinear optimal control for robotic exoskeletons with electropneumatic actuators
Purpose To provide high torques needed to move a robot’s links, electric actuators are followed by a transmission system with a high transmission rate. For instance, gear ratios of...

Back to Top