Skip to Main content Skip to Navigation
Theses

Méthodes d’apprentissage interactif pour la classification des messages courts

Résumé : La classification automatique des messages courts est de plus en plus employée de nos jours dans diverses applications telles que l'analyse des sentiments ou la détection des « spams ». Par rapport aux textes traditionnels, les messages courts, comme les tweets et les SMS, posent de nouveaux défis à cause de leur courte taille, leur parcimonie et leur manque de contexte, ce qui rend leur classification plus difficile. Nous présentons dans cette thèse deux nouvelles approches visant à améliorer la classification de ce type de message. Notre première approche est nommée « forêts sémantiques ». Dans le but d'améliorer la qualité des messages, cette approche les enrichit à partir d'une source externe construite au préalable. Puis, pour apprendre un modèle de classification, contrairement à ce qui est traditionnellement utilisé, nous proposons un nouvel algorithme d'apprentissage qui tient compte de la sémantique dans le processus d'induction des forêts aléatoires. Notre deuxième contribution est nommée « IGLM » (Interactive Generic Learning Method). C'est une méthode interactive qui met récursivement à jour les forêts en tenant compte des nouvelles données arrivant au cours du temps, et de l'expertise de l'utilisateur qui corrige les erreurs de classification. L'ensemble de ce mécanisme est renforcé par l'utilisation d'une méthode d'abstraction permettant d'améliorer la qualité des messages. Les différentes expérimentations menées en utilisant ces deux méthodes ont permis de montrer leur efficacité. Enfin, la dernière partie de la thèse est consacrée à une étude complète et argumentée de ces deux prenant en compte des critères variés tels que l'accuracy, la rapidité, etc.
Document type :
Theses
Complete list of metadatas

Cited literature [88 references]  Display  Hide  Download

https://tel.archives-ouvertes.fr/tel-01590468
Contributor : Abes Star :  Contact
Submitted on : Tuesday, September 19, 2017 - 3:56:05 PM
Last modification on : Tuesday, May 26, 2020 - 6:50:56 PM

File

2017AZUR4039.pdf
Version validated by the jury (STAR)

Identifiers

  • HAL Id : tel-01590468, version 1

Collections

Citation

Ameni Bouaziz. Méthodes d’apprentissage interactif pour la classification des messages courts. Autre [cs.OH]. Université Côte d'Azur, 2017. Français. ⟨NNT : 2017AZUR4039⟩. ⟨tel-01590468⟩

Share

Metrics

Record views

519

Files downloads

1464