Skip to Main content Skip to Navigation
Theses

EXTENDED BAG-OF-WORDS FORMALISM FOR IMAGE CLASSIFICATION

Sandra Avila 1
1 MLIA - Machine Learning and Information Access
LIP6 - Laboratoire d'Informatique de Paris 6
Résumé : L'information visuelle, représentée sous la forme d'images ou de vidéos numériques, est devenue si omniprésente dans le monde numérique d'aujourd'hui, qu'elle ne peut plus être considérée comme un "citoyen de seconde zone", par rapport à l'information textuelle. Néanmoins, contrairement aux documents textuels, les images sont constituées de pixels ne portant pas d'information sémantique directement accessible, ajoutant ainsi une difficulté à la tâche d'interprétation. Dans ce contexte, la classification d'images est devenue une tâche critique. En particulier, l'identification automatique d'objets complexes et de concepts sémantiques dans les images, a suscité de nombreux travaux récents, aussi bien en Recherche d'Information, Vision par Ordinateur, Traitement d'Image qu'en Intelligence Artificielle. Dans cette thèse, nous traitons le problème de la représentation des images. Notre objectif est la détection de concepts à partir d'une analyse du contenu visuel des images et des vidéos. Pour cela, nous introduisons une nouvelle représentation qui enrichit le modèle classique par sacs de mots visuels. S'appuyant sur la quantification de descripteurs locaux, et l'agrégation de ces descripteurs quantifiés en un vecteur de caractéristique unique, le modèle par sacs de mots visuels a émergé comme l'approche la plus efficace pour la classification d'images. Nous proposons BossaNova, une nouvelle représentation d'images permettant de conserver plus d'information lors de l'opération d'agrégation (pooling) en exploitant la distribution des distances entre les descripteurs locaux et les mots visuels. L'évaluation expérimentale sur plusieurs bases de données de classification d'images, telles que ImageCLEF Photo Annotation, MIRFLICKR, PASCAL VOC et 15-Scenes, a montré l'intérêt de Bossanova vis-à-vis des techniques traditionnelles, même sans utiliser de combinaisons complexes de multiples descripteurs locaux.
Complete list of metadatas

Cited literature [315 references]  Display  Hide  Download

https://tel.archives-ouvertes.fr/tel-00958547
Contributor : Matthieu Cord <>
Submitted on : Wednesday, March 12, 2014 - 5:24:00 PM
Last modification on : Friday, June 5, 2020 - 3:09:35 PM
Document(s) archivé(s) le : Thursday, June 12, 2014 - 12:06:00 PM

Identifiers

  • HAL Id : tel-00958547, version 1

Citation

Sandra Avila. EXTENDED BAG-OF-WORDS FORMALISM FOR IMAGE CLASSIFICATION. Computer Vision and Pattern Recognition [cs.CV]. Université Pierre et Marie Curie - Paris VI, 2013. English. ⟨tel-00958547⟩

Share

Metrics

Record views

634

Files downloads

1972