Unsupervised Word Segmentation and Wordhood Assessment: The case for Mandarin Chinese

Résumé : Ce mémoire traite de la segmentation non-supervisée en mots et de l'évaluation de la «lexicalité» des formes. Le chinois moderne standard (mandarin) est choisi pour les expériences et évaluations. La première partie porte sur les aspects linguistiques. Elle présente les critères couramment utilisés pour définir le «mot» en linguistique chinoise et en montre les limites au travers d'une discussion de linguistique plus générale, abordant notamment la question des «expressions multi-mots». Nous présentons ensuite l'historique du développement de la Segmentation en Mot du Chinois comme une tâche typique en TAL, et défendons l'idée qu'une part d'arbitraire dans l'annotation des corpus d'évaluation favorise les systèmes d'apprentissage supervisés alors que nous considérons les systèmes non-supervisés d'un plus grand intérêt pour la linguistique. La première partie nous amène à fonder notre définition de la lexicalité sur deux critères: une forte autonomie de combinaison et un haut degré d'appartenance à une classe distributionnelle. La seconde partie présente une méthode non-supervisée pour évaluer l'autonomie des formes inspirée par les hypothèses de Harris. Avec un algorithme de segmentation simple et rapide basé uniquement sur cette mesure, nous obtenons des résultats proches de l'état de l'art. Nous discutons ensuite de l'importance des pré-traitements et présentons des experiences utilisant la MDL. Enfin, nous proposons une méthode et des outils pour une évaluation plus qualitative des analyses fournies par notre systèmes. Nous présentons aussi quelques résultats préliminaires sur d'autres langues.
Type de document :
Thèse
Linguistics. Paris Diderot; Inria, 2013. English. 〈NNT : 2013PA070077〉
Liste complète des métadonnées

Littérature citée [249 références]  Voir  Masquer  Télécharger

https://hal.archives-ouvertes.fr/tel-01573561
Contributeur : Pierre Magistry <>
Soumis le : mercredi 9 août 2017 - 20:36:57
Dernière modification le : mercredi 29 novembre 2017 - 15:34:58

Licence


Distributed under a Creative Commons Paternité - Pas de modifications 4.0 International License

Identifiants

  • HAL Id : tel-01573561, version 1

Collections

Citation

Pierre Magistry. Unsupervised Word Segmentation and Wordhood Assessment: The case for Mandarin Chinese. Linguistics. Paris Diderot; Inria, 2013. English. 〈NNT : 2013PA070077〉. 〈tel-01573561〉

Partager

Métriques

Consultations de la notice

204

Téléchargements de fichiers

46