Search engine for discovering works of Art, research articles, and books related to Art and Culture
ShareThis
Javascript must be enabled to continue!

Un treebank pour le serbe : constitution et exploitations

View through CrossRef
Au début de cette thèse, aucun corpus annoté syntaxiquement (treebank) n’était disponible pour le serbe. Or, les treebanks annotés manuellement sont une condition sine qua non du développement (entraînement et évaluation) d’outils statistiques dédiés à l’annotation syntaxique automatique (parsers). L’existence des parsers performants permet à son tour l’annotation syntaxique de corpus plus larges, qui peuvent ensuite alimenter des recherches en linguistique théorique. De fait, l’absence de ces ressources pour le serbe freine le développement des recherches sur cette langue dans ces deux directions, et plus généralement les efforts visant l’informatisation et la valorisation du serbe. Afin de combler cette lacune, nous avons constitué un ensemble de ressources pour le traitement automatique du serbe. Il s’agit en premier lieu du treebank ParCoTrain-Synt, qui contient 101 000 tokens annotés en morphosyntaxe, en lemmes et en syntaxe de dépendances. Nous avons également confectionné le lexique ParCoLex, doté de 7 millions d’entrées provenant de 157 000 lemmes différents. En exploitant ces deux ressources, nous avons développé des modèles pour le parsing, pour l’étiquetage et pour la lemmatisation.Toutes les ressources citées sont librement diffusées à l’adresse suivante : https://github.com/aleksandra-miletic/serbian-nlp-resources. Les ressources constituées ont également été exploitées dans le cadre de deux études linguistiques, montrant ainsi que le corpus ParCoTrain-Synt ouvre la porte aux études empiriques basées sur des analyses quantitatives dans le domaine de la linguistique serbe.
Agence Bibliographique de l'Enseignement Supérieur
Title: Un treebank pour le serbe : constitution et exploitations
Description:
Au début de cette thèse, aucun corpus annoté syntaxiquement (treebank) n’était disponible pour le serbe.
Or, les treebanks annotés manuellement sont une condition sine qua non du développement (entraînement et évaluation) d’outils statistiques dédiés à l’annotation syntaxique automatique (parsers).
L’existence des parsers performants permet à son tour l’annotation syntaxique de corpus plus larges, qui peuvent ensuite alimenter des recherches en linguistique théorique.
De fait, l’absence de ces ressources pour le serbe freine le développement des recherches sur cette langue dans ces deux directions, et plus généralement les efforts visant l’informatisation et la valorisation du serbe.
Afin de combler cette lacune, nous avons constitué un ensemble de ressources pour le traitement automatique du serbe.
Il s’agit en premier lieu du treebank ParCoTrain-Synt, qui contient 101 000 tokens annotés en morphosyntaxe, en lemmes et en syntaxe de dépendances.
Nous avons également confectionné le lexique ParCoLex, doté de 7 millions d’entrées provenant de 157 000 lemmes différents.
En exploitant ces deux ressources, nous avons développé des modèles pour le parsing, pour l’étiquetage et pour la lemmatisation.
Toutes les ressources citées sont librement diffusées à l’adresse suivante : https://github.
com/aleksandra-miletic/serbian-nlp-resources.
Les ressources constituées ont également été exploitées dans le cadre de deux études linguistiques, montrant ainsi que le corpus ParCoTrain-Synt ouvre la porte aux études empiriques basées sur des analyses quantitatives dans le domaine de la linguistique serbe.

Related Results

Transformation of dairy production systems in Indonesia : assessing sustainability and long term trajectories of farms
Transformation of dairy production systems in Indonesia : assessing sustainability and long term trajectories of farms
Transformation des systèmes bovins laitiers en Indonésie : évaluation de la durabilité et des trajectoires des exploitations En Indonésie, la croissance économique ...
REGULAR ARTICLES
REGULAR ARTICLES
L. Cowen and C. J. Schwarz       657Les Radio‐tags, en raison de leur détectabilitéélevée, ...
Agricultural Land Distribution and Farm Productivity in Pakistan
Agricultural Land Distribution and Farm Productivity in Pakistan
Distribution des Terres Agricoles et Productivité Agricole au Pakistan L'agriculture est la principale source de revenus dans les économies agraires, qui emploie di...
On the Status of Rights
On the Status of Rights
Photo by Patrick Tomasso on Unsplash ABSTRACT In cases where the law conflicts with bioethics, the status of rights must be determined to resolve some of the tensions. ...
Problems of Implementation of the Constitution of Ukraine: Analysis and Solutions
Problems of Implementation of the Constitution of Ukraine: Analysis and Solutions
The article analyses the main problems of the implementation of the Constitution of Ukraine and identifies the constitutional and legal means of their solution. As a methodologica...
Avant-propos
Avant-propos
L’Agriculture Biologique (AB) se présente comme un mode de production agricole spécifique basé sur le respect d’un certain nombre de principes et de pratiques visant à réduire au m...
Bovine brucellosis in Paraguay : network analysis, risk factors and dynamic modeling approach
Bovine brucellosis in Paraguay : network analysis, risk factors and dynamic modeling approach
La brucellose bovine au Paraguay : approche par l’analyse des réseaux, les facteurs de risque et la modélisation dynamique La brucellose bovine (BB) est une maladie...
(Almost) Automatic Conversion of the Venice Italian Treebank into the Merged Italian Dependency Treebank Format
(Almost) Automatic Conversion of the Venice Italian Treebank into the Merged Italian Dependency Treebank Format
This paper describes the automatic procedure we developed to convert an Italian dependency treebank into a different format. We defined about 4,250 formal rules for rewriting depen...

Back to Top