Javascript must be enabled to continue!
Structuration sématique de documents XML centres-documents
View through CrossRef
La numérisation des documents et le développement des technologies Internet ont engendré une augmentation permanente du nombre de documents et de types de documents disponibles. Face à cette masse documentaire, XML (eXtensible Markup Language) s’est imposé comme format standard de structuration et d’échange de documents. Ainsi, un nombre de plus en plus important de documents devient disponible sous ce format. Ces documents XML peuvent être classés en deux types : les documents XML orienté-données et les documents XML orienté-textes. Les documents XML orienté-données sont constitués d’un ensemble d’éléments généralement courts et précis et sont similaires aux données relationnelles. Nous constatons que les balises utilisées pour ce type de documents décrivent généralement d’une manière précise le contenu, et offrent la sémantique basique nécessaire à la description de l’information (Exemples de balises : Article, Client, Quantité, Prix). A contrario, les documents XML orienté-textes sont riches en texte et utilisent des balises qui reflètent la plupart du temps un découpage (structurel) logique (exemples de balises : Contenu, Section, Paragraphe). Malheureusement, ces balises n’ont qu’une très pauvre vocation sémantique. Partant de cette constatation, le développement d’approches supportées par des outils automatisés permettant de décrire la sémantique des documents XML orientés-textes devient un besoin urgent, voire une nécessité pour certains usages. Dans ce contexte, nous proposons une approche de structuration sémantique des documents XML à partir de leurs structures logiques et de leurs contenus. Elle construit une arborescence de concepts. Cette approche de structuration sémantique passe par quatre phases : 1) Extraction des termes des contenus des documents en utilisant des techniques de recherche d’information ; 2) Détermination d’une taxonomie1 qui sera affectée au document, c’est-à-dire celle qui correspond au mieux à sa sémantique (cette étape se base sur une démarche de pondération d’un ensemble de taxonomies candidates) ; 3) Affectation, à chaque élément feuille de la structure logique du document, du concept le plus significatif à partir de la taxonomie retenue ; 4) Inférence de concepts aux éléments non feuilles du document. Notre approche de structuration sémantique des documents se base sur l’indexation sémantique et diffère des autres travaux par : 1) Le choix d’une taxonomie appropriée pour chaque document, il s’agit de déterminer la taxonomie qui décrit au mieux la sémantique du document, et 2) La pondération des concepts extraits de manière à donner plus d’importance aux concepts les plus spécifiques car nous partons du constat suivant : plus le niveau auquel se situe le concept est bas dans la hiérarchie, plus l’information qu’il apporte est fine et ciblée. Pour exploiter ces structures sémantiques, nous avons étendu le méta-modèle d’entrepôts de documents pour assurer leur stockage. De plus, nous avons introduit le concept de métadocument afin de permettre l’interrogation de ces structures sémantiques. Enfin, pour évaluer nos propositions, nous avons mené un ensemble d’expérimentations sur la collection de documents XML ImageCLEFMed 2010 en utilisant la ressource sémantique MeSH (NML's Medical Subject Headings). Les résultats obtenus montrent que l’algorithme de pondération des concepts des taxonomies qui a été proposé permet de sélectionner avec précision la taxonomie pertinente pour un document donné et, en conséquence, les concepts pertinents à affecter aux éléments feuilles de la structure sémantique de ce document.
Title: Structuration sématique de documents XML centres-documents
Description:
La numérisation des documents et le développement des technologies Internet ont engendré une augmentation permanente du nombre de documents et de types de documents disponibles.
Face à cette masse documentaire, XML (eXtensible Markup Language) s’est imposé comme format standard de structuration et d’échange de documents.
Ainsi, un nombre de plus en plus important de documents devient disponible sous ce format.
Ces documents XML peuvent être classés en deux types : les documents XML orienté-données et les documents XML orienté-textes.
Les documents XML orienté-données sont constitués d’un ensemble d’éléments généralement courts et précis et sont similaires aux données relationnelles.
Nous constatons que les balises utilisées pour ce type de documents décrivent généralement d’une manière précise le contenu, et offrent la sémantique basique nécessaire à la description de l’information (Exemples de balises : Article, Client, Quantité, Prix).
A contrario, les documents XML orienté-textes sont riches en texte et utilisent des balises qui reflètent la plupart du temps un découpage (structurel) logique (exemples de balises : Contenu, Section, Paragraphe).
Malheureusement, ces balises n’ont qu’une très pauvre vocation sémantique.
Partant de cette constatation, le développement d’approches supportées par des outils automatisés permettant de décrire la sémantique des documents XML orientés-textes devient un besoin urgent, voire une nécessité pour certains usages.
Dans ce contexte, nous proposons une approche de structuration sémantique des documents XML à partir de leurs structures logiques et de leurs contenus.
Elle construit une arborescence de concepts.
Cette approche de structuration sémantique passe par quatre phases : 1) Extraction des termes des contenus des documents en utilisant des techniques de recherche d’information ; 2) Détermination d’une taxonomie1 qui sera affectée au document, c’est-à-dire celle qui correspond au mieux à sa sémantique (cette étape se base sur une démarche de pondération d’un ensemble de taxonomies candidates) ; 3) Affectation, à chaque élément feuille de la structure logique du document, du concept le plus significatif à partir de la taxonomie retenue ; 4) Inférence de concepts aux éléments non feuilles du document.
Notre approche de structuration sémantique des documents se base sur l’indexation sémantique et diffère des autres travaux par : 1) Le choix d’une taxonomie appropriée pour chaque document, il s’agit de déterminer la taxonomie qui décrit au mieux la sémantique du document, et 2) La pondération des concepts extraits de manière à donner plus d’importance aux concepts les plus spécifiques car nous partons du constat suivant : plus le niveau auquel se situe le concept est bas dans la hiérarchie, plus l’information qu’il apporte est fine et ciblée.
Pour exploiter ces structures sémantiques, nous avons étendu le méta-modèle d’entrepôts de documents pour assurer leur stockage.
De plus, nous avons introduit le concept de métadocument afin de permettre l’interrogation de ces structures sémantiques.
Enfin, pour évaluer nos propositions, nous avons mené un ensemble d’expérimentations sur la collection de documents XML ImageCLEFMed 2010 en utilisant la ressource sémantique MeSH (NML's Medical Subject Headings).
Les résultats obtenus montrent que l’algorithme de pondération des concepts des taxonomies qui a été proposé permet de sélectionner avec précision la taxonomie pertinente pour un document donné et, en conséquence, les concepts pertinents à affecter aux éléments feuilles de la structure sémantique de ce document.
Related Results
KEBIASAAN MAKAN DAN ASUPAN ZAT GIZI MASYARAKAT HALMAHERA
KEBIASAAN MAKAN DAN ASUPAN ZAT GIZI MASYARAKAT HALMAHERA
<p class="MsoNormal" style="margin: 0cm 7.1pt 6pt 14.2pt; text-align: justify; text-indent: 1cm;"><span style="font-size: 10pt;" lang="en-us" xml:lang="en-us">Every com...
POLA AKTIVITAS, KONSUMSI PANGAN, STATUS GIZI DAN KESEHATAN ANAK JALANAN DI KOTA BANDUNG
POLA AKTIVITAS, KONSUMSI PANGAN, STATUS GIZI DAN KESEHATAN ANAK JALANAN DI KOTA BANDUNG
<p class="MsoTitle" style="margin: 0cm 13.05pt 6pt 17.85pt; text-align: justify; text-indent: 26.95pt;"><span style="font-size: 10pt;" lang="en-us" xml:lang="en-us">The...
SIGAda 2001 workshop, "creating a symbiotic relationship between XML and Ada"
SIGAda 2001 workshop, "creating a symbiotic relationship between XML and Ada"
The purpose of the workshop was to organize the Ada community to take advantage of the opportunity to create Ada applications that are operating systems independent because they ar...
KEGIATAN OPERASIONAL PEMBANGUNANKETAHANAN PANGAN 2006-2009
KEGIATAN OPERASIONAL PEMBANGUNANKETAHANAN PANGAN 2006-2009
<span style="font-size: 10pt;" lang="fi" xml:lang="fi">Rencana aksi ketahanan pangan periode 2005-2009 adalah suatu panduan pelak- sanaan kebijakan umum tersebut di tingkat l...
Assessment of implementation of the Pradhan Mantri national dialysis Programme in Hospitals in Delhi
Assessment of implementation of the Pradhan Mantri national dialysis Programme in Hospitals in Delhi
Background: Annual-demand for haemodialysis-sessions in India is 3.4 Crores. To make Renal-care-services affordable to APL and free to BPL, Ministry of Health and Family Welfare la...
P1847IMPROVING SHARED DECISION MAKING FOR END-STAGE RENAL DISEASE PATIENTS IN THE NETHERLANDS
P1847IMPROVING SHARED DECISION MAKING FOR END-STAGE RENAL DISEASE PATIENTS IN THE NETHERLANDS
Abstract
Background and Aims
Annually, more than 2.000 end-stage renal disease (ESRD) patients in the Netherlands receive educat...
XML and Ada complement each other
XML and Ada complement each other
XML has become a major Internet technology. The programing language that has the best fit with XML is Ada. XML and Ada have similar typing systems, visibility and scoping rules. A ...
Using Logic for Querying XML Data
Using Logic for Querying XML Data
In this chapter, we propose the use of first-order logic, in the form of deductive database rules, as a query language for XML data, and we present X-Device, an extension of the de...

