Javascript must be enabled to continue!
Discovering expressive and consistent alignments between large ontologies
View through CrossRef
Découvrir alignements expressifs et cohérents entre les grandes ontologies
Cette thèse aborde le défi de la génération automatique d'alignements expressifs entre ontologies, afin de mieux capturer les différents types d'hétérogénéités entre différentes ontologies. Alors que les approches traditionnelles d'alignement ne produisent que des correspondances simples, elles sont souvent incapables de représenter des correspondances du monde réel, par exemple lorsqu'une seule propriété dans une ontologie correspond à une combinaison de propriétés dans une autre (par exemple, "FullName" = concatenation ("FirstName", "LastName ")). La complexité de cette tâche réside non seulement dans l'identification de multiples entités à faire correspondre, mais aussi dans la sélection des constructeurs appropriés pour les combiner. La question de recherche centrale guidant ce travail est donc la suivante : les grands modèles de langage (LLMs) sont-ils capables d'un alignement complexe d'ontologies de manière efficace ? Pour répondre à cette question, trois contributions principales sont proposées. Premièrement, une étude approfondie de l'état de l'art des approches d'alignement d'ontologies a été réalisée, avec un nouveau cadre de classification pour l'alignement d'ontologies basé sur les embeddings, analysant 103 approches récentes selon les dimensions proposées qui classifient l'utilisation des embeddings. Cette étude révèle que la tâche d'alignement complexe reste largement sous-explorée (seulement 7 % des travaux l'abordent) malgré son importance pour l'interopérabilité sémantique. La contribution suivante concerne des améliorations de l'architecture d'un système d'alignemnt existant (CANARD) par l'intégration d'embeddings dans le calcul de la similarité entre entités. De plus, pour combler les lacunes de CANARD, une nouvelle approche est proposée pour la génération directe d'alignements complexes avec les LLMs, où le LLM génère directement l'alignement final à partir des ontologies d'entrée. Il s'agit d'une approche basée sur l'ingénierie de prompts qui permet aux LLMs de produire directement des alignements dans le format structuré EDOAL (Expressive and Declarative Ontology Alignment Language), pouvant être évalués automatiquement. La dernière contribution est une nouvelle métrique d'évaluation pour les alignements complexes, basée sur des alignements de référence. Reconnaissant l'insuffisance des métriques traditionnelles, une métrique sensible à la structure est introduite, utilisant la distance d'édition d'arbres pour comparer la structure logique des correspondances exprimées en EDOAL. Cette métrique respecte des propriétés clés, offrant une évaluation plus précise de la qualité des alignements complexes. Les résultats expérimentaux sur les benchmarks OAEI (Ontology Alignment Evaluation Initiative) montrent que les LLMs peuvent effectivement réaliser un alignement complexe, en particulier lorsqu'ils sont guidés par un apprentissage à partir de quelques exemples. Avec des modules créés manuellement lors de l'étape de réduction de l'espace de recherche et avec des LLMs dotés de capacités de raisonnement, l'approche proposée atteint des performances prometteuses. De plus, certaines expériences montrent que l'affinage (fine-tuning) de modèles plus petits peut apporter des améliorations significatives des performances sur des alignements simples lorsqu'ils sont entraînés sur des données synthétiques. La thèse conclut que les LLMs constituent une voie prometteuse pour l'appariement direct complexe d'ontologies.
Title: Discovering expressive and consistent alignments between large ontologies
Description:
Découvrir alignements expressifs et cohérents entre les grandes ontologies
Cette thèse aborde le défi de la génération automatique d'alignements expressifs entre ontologies, afin de mieux capturer les différents types d'hétérogénéités entre différentes ontologies.
Alors que les approches traditionnelles d'alignement ne produisent que des correspondances simples, elles sont souvent incapables de représenter des correspondances du monde réel, par exemple lorsqu'une seule propriété dans une ontologie correspond à une combinaison de propriétés dans une autre (par exemple, "FullName" = concatenation ("FirstName", "LastName ")).
La complexité de cette tâche réside non seulement dans l'identification de multiples entités à faire correspondre, mais aussi dans la sélection des constructeurs appropriés pour les combiner.
La question de recherche centrale guidant ce travail est donc la suivante : les grands modèles de langage (LLMs) sont-ils capables d'un alignement complexe d'ontologies de manière efficace ? Pour répondre à cette question, trois contributions principales sont proposées.
Premièrement, une étude approfondie de l'état de l'art des approches d'alignement d'ontologies a été réalisée, avec un nouveau cadre de classification pour l'alignement d'ontologies basé sur les embeddings, analysant 103 approches récentes selon les dimensions proposées qui classifient l'utilisation des embeddings.
Cette étude révèle que la tâche d'alignement complexe reste largement sous-explorée (seulement 7 % des travaux l'abordent) malgré son importance pour l'interopérabilité sémantique.
La contribution suivante concerne des améliorations de l'architecture d'un système d'alignemnt existant (CANARD) par l'intégration d'embeddings dans le calcul de la similarité entre entités.
De plus, pour combler les lacunes de CANARD, une nouvelle approche est proposée pour la génération directe d'alignements complexes avec les LLMs, où le LLM génère directement l'alignement final à partir des ontologies d'entrée.
Il s'agit d'une approche basée sur l'ingénierie de prompts qui permet aux LLMs de produire directement des alignements dans le format structuré EDOAL (Expressive and Declarative Ontology Alignment Language), pouvant être évalués automatiquement.
La dernière contribution est une nouvelle métrique d'évaluation pour les alignements complexes, basée sur des alignements de référence.
Reconnaissant l'insuffisance des métriques traditionnelles, une métrique sensible à la structure est introduite, utilisant la distance d'édition d'arbres pour comparer la structure logique des correspondances exprimées en EDOAL.
Cette métrique respecte des propriétés clés, offrant une évaluation plus précise de la qualité des alignements complexes.
Les résultats expérimentaux sur les benchmarks OAEI (Ontology Alignment Evaluation Initiative) montrent que les LLMs peuvent effectivement réaliser un alignement complexe, en particulier lorsqu'ils sont guidés par un apprentissage à partir de quelques exemples.
Avec des modules créés manuellement lors de l'étape de réduction de l'espace de recherche et avec des LLMs dotés de capacités de raisonnement, l'approche proposée atteint des performances prometteuses.
De plus, certaines expériences montrent que l'affinage (fine-tuning) de modèles plus petits peut apporter des améliorations significatives des performances sur des alignements simples lorsqu'ils sont entraînés sur des données synthétiques.
La thèse conclut que les LLMs constituent une voie prometteuse pour l'appariement direct complexe d'ontologies.
Related Results
Using Background Knowledge to Enhance Biomedical Ontology Matching
Using Background Knowledge to Enhance Biomedical Ontology Matching
Utilisation des ressources de connaissances externes pour améliorer l'alignement d'ontologies biomédicales
Les sciences de la vie produisent de grandes masses de do...
COFFEE: an objective function for multiple sequence alignments.
COFFEE: an objective function for multiple sequence alignments.
Abstract
MOTIVATION: In order to increase the accuracy of multiple sequence alignments, we designed a new strategy for optimizing multiple sequence alignments by gen...
Adaptation d'ontologies avec les grammaires de graphes typés : évolution et fusion
Adaptation d'ontologies avec les grammaires de graphes typés : évolution et fusion
Étant une représentation formelle et explicite des connaissances d'un domaine, les ontologies font régulièrement l'objet de nombreux changements et ont ainsi besoin d'être constamm...
Light-Weighted Automatic Import of Standardized Ontologies into the Content Management System Drupal
Light-Weighted Automatic Import of Standardized Ontologies into the Content Management System Drupal
The amount of ontologies, which are utilizable for widespread domains, is growing steadily. BioPortal alone, embraces over 500 published ontologies with nearly 8 million classes. I...
Machine learning with biomedical ontologies
Machine learning with biomedical ontologies
Ontologies have long been employed in the life sciences to formally represent and reason over domain knowledge, and they are employed in almost every major biological database. Rec...
Formal axioms in biomedical ontologies improve analysis and interpretation of associated data
Formal axioms in biomedical ontologies improve analysis and interpretation of associated data
Abstract
Motivation
There are now over 500 ontologies in the life sciences. Over the past years, significant resources have bee...
Ontology Alignment Techniques
Ontology Alignment Techniques
Sometimes the use of a single ontology is not sufficient to cover different vocabularies for the same domain, and it becomes necessary to use several ontologies in order to encompa...
Development of GCP Ontology for Sharing Crop Information
Development of GCP Ontology for Sharing Crop Information
AbstractThe Generation Challenge Programme (GCP – "http://www.generationcp.org":http://www.generationcp.org) is a globally distributed crop research consortium directed toward crop...

