Modélisation Sinusoïdale à Long Terme du Signal de Parole - TEL - Thèses en ligne Accéder directement au contenu
Thèse Année : 2007

Modélisation Sinusoïdale à Long Terme du Signal de Parole

Résumé

The sinusoidal model of speech signals is usually defined on a “short-term” basis, i.e. on successive frames of about 10–30 ms. In this thesis, we add to this usual spectral modeling a new level of modeling along the temporal axis: the goal is to model the temporal trajectories of the sinusoidal parameters (amplitudes and phases) over durations which are significantly longer than the short-term frames (typically several hundreds of ms; continuously voiced sections of speech are considered in this study). For this, we propose to use different long-term models based on discrete cosine and polynomial functions. The fitting of these models with the parameters trajectories is achieved by a weighted least square minimisation technique, the weights being derived from perceptual criteria which are adapted to the long-term processing. For this task, a series of iterative algorithms is proposed and tested. The proposed long-term approach is shown to provide an efficent and sparse representation of the dynamics of voiced speech signals.
La modélisation sinusoïdale du signal de parole est usuellement définie à « court terme », c'est-à-dire sur des trames successives de signal d'une durée de l'ordre de 10 à 30 ms. Cette thèse apporte une contribution nouvelle à ce domaine en ajoutant à ce niveau traditionnel de modélisation spectrale un niveau supplémentaire le long de l'axe temporel : on cherche à modéliser les trajectoires de paramètres sinusoïdaux (amplitudes et phases) sur des durées significativement plus longues que celles des trames à court terme (typiquement plusieurs centaines de ms ; on considère dans cette thèse des sections de parole continûment voisées). Nous proposons pour cela d'utiliser différents modèles à long terme à base de fonctions en cosinus discrets et de fonctions polynomiales. L'ajustement des trajectoires est réalisé par une régression au sens des moindres carrés pondérés, les poids de la régression étant déterminés par des critères perceptifs adaptés au traitement à long terme. Pour cette tâche, une série d'algorithmes itératifs est proposée et testée. L'approche à long terme se révèle à la fois efficace et parcimonieuse pour décrire la dynamique des signaux de parole voisés.
Fichier principal
Vignette du fichier
these2007-Firouzmand.pdf (3.75 Mo) Télécharger le fichier
Loading...

Dates et versions

tel-00211294 , version 1 (21-01-2008)

Identifiants

  • HAL Id : tel-00211294 , version 1

Citer

Mohammad Firouzmand. Modélisation Sinusoïdale à Long Terme du Signal de Parole. Traitement du signal et de l'image [eess.SP]. Institut National Polytechnique de Grenoble - INPG, 2007. Français. ⟨NNT : ⟩. ⟨tel-00211294⟩
182 Consultations
1391 Téléchargements

Partager

Gmail Facebook X LinkedIn More