Javascript must be enabled to continue!

Structuration sématique de documents XML centres-documents

La numérisation des documents et le développement des technologies Internet ont engendré une augmentation permanente du nombre de documents et de types de documents disponibles. Face à cette masse documentaire, XML (eXtensible Markup Language) s’est imposé comme format standard de structuration et d’échange de documents. Ainsi, un nombre de plus en plus important de documents devient disponible sous ce format. Ces documents XML peuvent être classés en deux types : les documents XML orienté-données et les documents XML orienté-textes. Les documents XML orienté-données sont constitués d’un ensemble d’éléments généralement courts et précis et sont similaires aux données relationnelles. Nous constatons que les balises utilisées pour ce type de documents décrivent généralement d’une manière précise le contenu, et offrent la sémantique basique nécessaire à la description de l’information (Exemples de balises : Article, Client, Quantité, Prix). A contrario, les documents XML orienté-textes sont riches en texte et utilisent des balises qui reflètent la plupart du temps un découpage (structurel) logique (exemples de balises : Contenu, Section, Paragraphe). Malheureusement, ces balises n’ont qu’une très pauvre vocation sémantique. Partant de cette constatation, le développement d’approches supportées par des outils automatisés permettant de décrire la sémantique des documents XML orientés-textes devient un besoin urgent, voire une nécessité pour certains usages. Dans ce contexte, nous proposons une approche de structuration sémantique des documents XML à partir de leurs structures logiques et de leurs contenus. Elle construit une arborescence de concepts. Cette approche de structuration sémantique passe par quatre phases : 1) Extraction des termes des contenus des documents en utilisant des techniques de recherche d’information ; 2) Détermination d’une taxonomie1 qui sera affectée au document, c’est-à-dire celle qui correspond au mieux à sa sémantique (cette étape se base sur une démarche de pondération d’un ensemble de taxonomies candidates) ; 3) Affectation, à chaque élément feuille de la structure logique du document, du concept le plus significatif à partir de la taxonomie retenue ; 4) Inférence de concepts aux éléments non feuilles du document. Notre approche de structuration sémantique des documents se base sur l’indexation sémantique et diffère des autres travaux par : 1) Le choix d’une taxonomie appropriée pour chaque document, il s’agit de déterminer la taxonomie qui décrit au mieux la sémantique du document, et 2) La pondération des concepts extraits de manière à donner plus d’importance aux concepts les plus spécifiques car nous partons du constat suivant : plus le niveau auquel se situe le concept est bas dans la hiérarchie, plus l’information qu’il apporte est fine et ciblée. Pour exploiter ces structures sémantiques, nous avons étendu le méta-modèle d’entrepôts de documents pour assurer leur stockage. De plus, nous avons introduit le concept de métadocument afin de permettre l’interrogation de ces structures sémantiques. Enfin, pour évaluer nos propositions, nous avons mené un ensemble d’expérimentations sur la collection de documents XML ImageCLEFMed 2010 en utilisant la ressource sémantique MeSH (NML's Medical Subject Headings). Les résultats obtenus montrent que l’algorithme de pondération des concepts des taxonomies qui a été proposé permet de sélectionner avec précision la taxonomie pertinente pour un document donné et, en conséquence, les concepts pertinents à affecter aux éléments feuilles de la structure sémantique de ce document.

Agence Bibliographique de l'Enseignement Supérieur

Salma Ben Meftah

2026

Title: Structuration sématique de documents XML centres-documents

Description:

La numérisation des documents et le développement des technologies Internet ont engendré une augmentation permanente du nombre de documents et de types de documents disponibles.

Face à cette masse documentaire, XML (eXtensible Markup Language) s’est imposé comme format standard de structuration et d’échange de documents.

Ainsi, un nombre de plus en plus important de documents devient disponible sous ce format.

Ces documents XML peuvent être classés en deux types : les documents XML orienté-données et les documents XML orienté-textes.

Les documents XML orienté-données sont constitués d’un ensemble d’éléments généralement courts et précis et sont similaires aux données relationnelles.

Nous constatons que les balises utilisées pour ce type de documents décrivent généralement d’une manière précise le contenu, et offrent la sémantique basique nécessaire à la description de l’information (Exemples de balises : Article, Client, Quantité, Prix).

A contrario, les documents XML orienté-textes sont riches en texte et utilisent des balises qui reflètent la plupart du temps un découpage (structurel) logique (exemples de balises : Contenu, Section, Paragraphe).

Malheureusement, ces balises n’ont qu’une très pauvre vocation sémantique.

Partant de cette constatation, le développement d’approches supportées par des outils automatisés permettant de décrire la sémantique des documents XML orientés-textes devient un besoin urgent, voire une nécessité pour certains usages.

Dans ce contexte, nous proposons une approche de structuration sémantique des documents XML à partir de leurs structures logiques et de leurs contenus.

Elle construit une arborescence de concepts.

Cette approche de structuration sémantique passe par quatre phases : 1) Extraction des termes des contenus des documents en utilisant des techniques de recherche d’information ; 2) Détermination d’une taxonomie1 qui sera affectée au document, c’est-à-dire celle qui correspond au mieux à sa sémantique (cette étape se base sur une démarche de pondération d’un ensemble de taxonomies candidates) ; 3) Affectation, à chaque élément feuille de la structure logique du document, du concept le plus significatif à partir de la taxonomie retenue ; 4) Inférence de concepts aux éléments non feuilles du document.

Notre approche de structuration sémantique des documents se base sur l’indexation sémantique et diffère des autres travaux par : 1) Le choix d’une taxonomie appropriée pour chaque document, il s’agit de déterminer la taxonomie qui décrit au mieux la sémantique du document, et 2) La pondération des concepts extraits de manière à donner plus d’importance aux concepts les plus spécifiques car nous partons du constat suivant : plus le niveau auquel se situe le concept est bas dans la hiérarchie, plus l’information qu’il apporte est fine et ciblée.

Pour exploiter ces structures sémantiques, nous avons étendu le méta-modèle d’entrepôts de documents pour assurer leur stockage.

De plus, nous avons introduit le concept de métadocument afin de permettre l’interrogation de ces structures sémantiques.

Enfin, pour évaluer nos propositions, nous avons mené un ensemble d’expérimentations sur la collection de documents XML ImageCLEFMed 2010 en utilisant la ressource sémantique MeSH (NML's Medical Subject Headings).

Les résultats obtenus montrent que l’algorithme de pondération des concepts des taxonomies qui a été proposé permet de sélectionner avec précision la taxonomie pertinente pour un document donné et, en conséquence, les concepts pertinents à affecter aux éléments feuilles de la structure sémantique de ce document.

Back

<p class="MsoNormal" style="margin: 0cm 7.1pt 6pt 14.2pt; text-align: justify; text-indent: 1cm;"><span style="font-size: 10pt;" lang="en-us" xml:lang="en-us">Every com...

POLA AKTIVITAS, KONSUMSI PANGAN, STATUS GIZI DAN KESEHATAN ANAK JALANAN DI KOTA BANDUNG

<p class="MsoTitle" style="margin: 0cm 13.05pt 6pt 17.85pt; text-align: justify; text-indent: 26.95pt;"><span style="font-size: 10pt;" lang="en-us" xml:lang="en-us">The...

Greenhouse gas fluxes from nutrient-rich organic soils in Estonia

<p>Nutrient-rich organic soils are one of the largest key sources of greenhouse gas (GHG) emissions in cool moist climate regions in Europe, and around 15 Mha of wetl...

SIGAda 2001 workshop, "creating a symbiotic relationship between XML and Ada"

The purpose of the workshop was to organize the Ada community to take advantage of the opportunity to create Ada applications that are operating systems independent because they ar...

A recursive visual query language for XML data

PurposeeXtensible Markup Language (XML) data are data which are not necessarily constrained by a schema, XML is fast emerging as a standard for data representation and exchange on ...

A requirements‐driven workload model for XML benchmark

PurposeTo provide a more requirements‐driven workload model for eXtensible Markup Language (XML) benchmark over the electronic data exchange and management in collaborative commerc...

Korelasi Kadar Karboksihemoglobin terhadap Tekanan Darah Penduduk di Sekitar Terminal Bus Tirtonadi Surakarta

<table width="645" border="1" cellspacing="0" cellpadding="0"><tbody><tr><td valign="top" width="408"><p> </p><p>Carbon monoxide is a gas ...

KEGIATAN OPERASIONAL PEMBANGUNANKETAHANAN PANGAN 2006-2009

<span style="font-size: 10pt;" lang="fi" xml:lang="fi">Rencana aksi ketahanan pangan periode 2005-2009 adalah suatu panduan pelak- sanaan kebijakan umum tersebut di tingkat l...

Email:
Password:

Email:

Structuration sématique de documents XML centres-documents

Related Results