Segmentation et classification dans les images de documents numérisés

Résumé : Les travaux de cette thèse ont été effectués dans le cadre de l'analyse et du traitement d'images de documents imprimés afin d'automatiser la création de revues de presse. Les images en sortie du scanner sont traitées sans aucune information a priori ou intervention humaine. Ainsi, pour les caractériser, nous présentons un système d'analyse de documents composites couleur qui réalise une segmentation en zones colorimétriquement homogènes et qui adapte les algorithmes d'extraction de textes aux caractéristiques locales de chaque zone. Les informations colorimétriques et textuelles fournies par ce système alimentent une méthode de segmentation physique des pages de presse numérisée. Les blocs issus de cette décomposition font l'objet d'une classification permettant, entre autres, de détecter les zones publicitaires. Dans la continuité et l'expansion des travaux de classification effectués dans la première partie, nous présentons un nouveau moteur de classification et de classement générique, rapide et facile à utiliser. Cette approche se distingue de la grande majorité des méthodes existantes qui reposent sur des connaissances a priori sur les données et dépendent de paramètres abstraits et difficiles à déterminer par l'utilisateur. De la caractérisation colorimétrique au suivi des articles en passant par la détection des publicités, l'ensemble des approches présentées ont été combinées afin de mettre au point une application permettant la classification des documents de presse numérisée par le contenu.
Type de document :
Thèse
Autre [cs.OH]. INSA de Lyon, 2012. Français. 〈NNT : 2012ISAL0044〉
Liste complète des métadonnées

Littérature citée [119 références]  Voir  Masquer  Télécharger

https://tel.archives-ouvertes.fr/tel-00749933
Contributeur : Abes Star <>
Soumis le : jeudi 8 novembre 2012 - 15:57:15
Dernière modification le : vendredi 10 novembre 2017 - 01:20:09
Document(s) archivé(s) le : samedi 9 février 2013 - 03:50:34

Fichier

these.pdf
Version validée par le jury (STAR)

Identifiants

  • HAL Id : tel-00749933, version 1

Collections

Citation

Asma Ouji. Segmentation et classification dans les images de documents numérisés. Autre [cs.OH]. INSA de Lyon, 2012. Français. 〈NNT : 2012ISAL0044〉. 〈tel-00749933〉

Partager

Métriques

Consultations de la notice

556

Téléchargements de fichiers

12794