Skip to Main content Skip to Navigation
Theses

Grammaires locales étendues : principes, mise en œuvre et applications pour l’extraction de l’information

Résumé : Les grammaires locales constituent un formalisme de description de constructions linguistiques et sont communément représentées sous la forme de graphes orientés. Utilisées pour la recherche et l'extraction de motifs dans un texte, elles trouvent leurs limites dans le traitement de variations non décrites ou fautives ainsi que dans la capacité à accéder à des connaissances exogènes, c'est-à-dire des informations à extraire, au cours de l'analyse, de ressources externes à la grammaire et qui peuvent s'avérer utiles pour normaliser, enrichir, valider ou mettre en relation les motifs reconnus. Dans cette thèse nous introduisons la notion de grammaire locale étendue. Il s'agit d'un formalisme capable d'étendre le modèle classique des grammaires locales. Premièrement, en ajoutant des fonctions arbitraires à satisfaire, appelées fonctions étendues, qui ne sont pas prédéfinies à l'avance et qui sont évaluées en dehors de la grammaire. De surcroît, ce formalisme fournit à l'analyseur syntaxique la possibilité de déclencher des événements qui peuvent également être traités sous la forme de fonctions étendues. Le travail présenté se divise en trois parties: dans un premier temps, nous étudions les principes concernant la construction des grammaires locales étendues. Nous présentons ensuite la mise en œuvre d'un moteur d'analyse textuelle implémentant le formalisme proposé. Enfin, nous étudions quelques applications pour l'extraction de l'information dans des textes bien formés et des textes bruités. Nous nous focalisons sur le couplage des ressources externes et des méthodes non-symboliques dans la construction de nos grammaires en montrant la pertinence de cette approche pour dépasser les limites des grammaires locales classiques
Document type :
Theses
Complete list of metadatas

Cited literature [123 references]  Display  Hide  Download

https://tel.archives-ouvertes.fr/tel-01799012
Contributor : Abes Star :  Contact
Submitted on : Thursday, May 24, 2018 - 11:19:07 AM
Last modification on : Wednesday, July 15, 2020 - 5:15:17 PM
Document(s) archivé(s) le : Saturday, August 25, 2018 - 2:00:37 PM

File

TH2017PESC1075.pdf
Version validated by the jury (STAR)

Identifiers

  • HAL Id : tel-01799012, version 1

Citation

Cristian Martinez. Grammaires locales étendues : principes, mise en œuvre et applications pour l’extraction de l’information. Traitement du texte et du document. Université Paris-Est, 2017. Français. ⟨NNT : 2017PESC1075⟩. ⟨tel-01799012⟩

Share

Metrics

Record views

373

Files downloads

695