Modélisation et synthèse de voix chantée à partir de descripteurs visuels extraits d'images échographiques et optiques des articulateurs

Aurore Jaumard-Hakoun

Thèse Année : 2016

Singing voice modeling and synthesis using visual features extracted from ultrasound and optical images of articulators

Modélisation et synthèse de voix chantée à partir de descripteurs visuels extraits d'images échographiques et optiques des articulateurs

(1)

Aurore Jaumard-Hakoun

Fonction : Auteur

Institut Langevin - Ondes et Images (UMR7587)

Résumé

This thesis reports newly developed methods which can be applied to extract relevant features from articulator images in rare singing: traditional Corsican and Sardinian polyphonies, Byzantine music, as well as Human Beat Box. We collected data, and modeled these using machine learning methods, specifically novel deep learning methods. We first modelled tongue ultrasound image sequences, carrying relevant articulatory information which would otherwise be difficult to interpret without specialized skills in ultrasound imaging. We developed methods to extract automatically the superior contour of the tongue displayed on ultrasound images. Our tongue contour extraction results are comparable with those obtained in the literature, which could lead to applications in singing pedagogy. Afterwards, we predicted the evolution of the vocal tract filter parameters from sequences of tongue and lip images, first on isolated vowel databases then on traditional Corsican singing. Applying the predicted filter parameters, combined with the development of a vocal source acoustic model exploiting electroglottographic recordings, allowed us to synthesize singing voice excerpts using articulatory images (of tongue and lips) and glottal activity, with results superior to those obtained using existing technics reported in the literature.

Le travail présenté dans cette thèse porte principalement sur le développement de méthodes permettant d'extraire des descripteurs pertinents des images acquises des articulateurs dans les chants rares : les polyphonies traditionnelles Corses, Sardes, la musique Byzantine, ainsi que le Human Beat Box. Nous avons collecté des données, et employons des méthodes d'apprentissage statistique pour les modéliser, notamment les méthodes récentes d'apprentissage profond (Deep Learning).Nous avons étudié dans un premier temps des séquences d'images échographiques de la langue apportant des informations sur l'articulation, mais peu lisibles sans connaissance spécialisée en échographie. Nous avons développé des méthodes pour extraire de façon automatique le contour supérieur de la langue montré par les images échographiques. Nos travaux ont donné des résultats d'extraction du contour de la langue comparables à ceux obtenus dans la littérature, ce qui pourrait permettre des applications en pédagogie du chant.Ensuite, nous avons prédit l'évolution des paramètres du filtre qu'est le conduit vocal depuis des séquences d'images de langue et de lèvres, sur des bases de données constituées de voyelles isolées puis de chants traditionnels Corses. L'utilisation des paramètres du filtre du conduit vocal, combinés avec le développement d'un modèle acoustique de source vocale exploitant l'enregistrement électroglottographique, permet de synthétiser des extraits de voix chantée en utilisant les images articulatoires (de la langue et des lèvres)et l'activité glottique, avec des résultats supérieurs à ceux obtenus avec les techniques existant dans la littérature.

Mots clés

Singing voice synthesis Deep learning Ultrasound image

Techniques de chant rare Échographie Contour de langue Réseaux de neurones Deep learning Synthèse vocale

Domaines

Electronique

Fichier principal

2016PA066223.pdf (7.73 Mo)

Origine : Version validée par le jury (STAR)

ABES STAR : Contact

https://theses.hal.science/tel-01441742

Soumis le : vendredi 20 janvier 2017-10:34:06

Dernière modification le : vendredi 19 avril 2024-16:18:59

Archivage à long terme le : vendredi 21 avril 2017-13:34:22

Dates et versions

tel-01441742 , version 1 (20-01-2017)

Identifiants

HAL Id : tel-01441742 , version 1

Citer

Aurore Jaumard-Hakoun. Modélisation et synthèse de voix chantée à partir de descripteurs visuels extraits d'images échographiques et optiques des articulateurs. Electronique. Université Pierre et Marie Curie - Paris VI, 2016. Français. ⟨NNT : 2016PA066223⟩. ⟨tel-01441742⟩

Exporter

BibTeX XML-TEI Dublin Core DC Terms EndNote DataCite

Collections

ESPCI CNRS THESES-UPMC STAR PARISTECH IL LANGEVIN PSL SORBONNE-UNIVERSITE THESES-SU SU-SCIENCES UP-SCIENCES ESPCI-PSL

613 Consultations

963 Téléchargements

Singing voice modeling and synthesis using visual features extracted from ultrasound and optical images of articulators

Modélisation et synthèse de voix chantée à partir de descripteurs visuels extraits d'images échographiques et optiques des articulateurs

Résumé

Mots clés

Domaines

Dates et versions

Identifiants

Citer

Exporter

Collections

Partager