Reconnaissance automatique de la parole à large vocabulaire : des approches hybrides aux approches End-to-End

Abdelwahab Heba

Résumé

At Linagora, the OpenPaasNG project was launched in 2015 for a period of 4 years with the purpose of building a new generation of collaborative platform which provides a videoconferencing tool using artificial intelligence technologies such as speech transcription, keyword extraction and automatic meeting summary. In this context, my industrial thesis tackled Automatic Speech Recognition (ASR) for virtual meetings in real time and offiine. This thesis deals with the study of acoustic modeling methods for ASR. The upheaval of sequential neural architectures has nowadays allowed major advances in the improvement of modeling and learning of acoustic models. I explored in this work the two main families of RAP systems : hybrid and End-to-End systems. A first part of this thesis concerns traditional approaches and is dedicated to the implementation of a large vocabulary RAP system in French for spontaneous speech, which has been deployed in several industrial use cases. A large work of data collection, processing and standardization was carried out in a first step to reach the goal of 1000 hours of annotated speech. An evaluation of the acoustic, lexical and linguistic components is proposed to refine the choice and orientation of the hybrid DNN-HMM modeling for the French language. I proposed for this part an industrial platform for the adaptation of hybrid components called "LinSTT Model Factory" allowing an adaptation of the models to the conditions of use, namely : a particular acoustic context, a vocabulary specific to a target domain. In a second part, I approached the problem of automatically transcribing speech directly from acoustic observations. To do so, I conducted an in-depth study of the End-to-End RAP approaches : how can we learn sequential alignments between audio and text ? What type of architecture to use ? And especially, what type of output units to choose (character, word piece, word) ? I tried to answer to these questions with a set of experiments on the TIMIT and LibriSpeech datasets. A large part of this work has been conducted during a scientific stay at the Mila laboratory in Canada, where I actively contributed to the development of the open-source tool "SpeechBrain". In a third part, I report multi-task learning experiments using end-to-end systems in order to exploit several output representations, in our case characters and consonant / vowel categories. I proposed a new technique of combining thses representations for improving recognition performance.

Ma thèse s'inscrit dans le cadre du projet de recherche OpenPaasNG 1 qui a été lancé en 2015 pour une durée de 4 ans avec l'objectif de développer une nouvelle génération de plateforme collaborative proposant un outil de visio-conférence utilisant des technologies d'intelligence artificielle pour la transcription de la parole, l'extraction des mots clés et le résumé automatique des réunions. Dans ce contexte, l'objectif de cette thèse est d'étudier, d'approfondir, de construire et d'enrichir la brique de reconnaissance automatique de la parole (RAP) pour aider à l'exploitation de l'information verbale durant les réunions en temps réel et en off-line à des fins d'archivage. Cette thèse porte sur l'étude des méthodes de modélisation acoustique pour la RAP. Le boule- versement des architectures neuronales séquentielles ont permis de nos jours des avancées majeures dans l'amélioration de la modélisation et l'apprentissage du modèle acoustique. Nous explorons dans ce travail les deux grandes familles des systèmes RAP à savoir : les approches traditionnelles hybrides et End-to-End. Une première partie de cette thèse concerne les approches traditionnelles et est dédiée à la mise en place d'un système RAP large vocabulaire en français pour la parole spontanée, déployé dans le contexte industriel. Un grand travail de collecte de données, de traitement et de normalisation a été effectué dans un premier temps pour atteindre l'objectif des 1000 heures de parole annotée. Une évaluation des composants acoustique, lexical et linguistique est proposée pour affiner au mieux le choix et l'orientation de la modélisation hybride DNN-HMM pour la langue française. Nous décri- vons dans cette partie le développement de la plateforme industrielle d'adaptation des composants hybrides appelée "LinSTT Model Factory" permettant une adaptation des modèles aux conditions d'utilisations, à savoir : un contexte acoustique particulier, un vocabulaire spécifique à un domaine cible. Dans une deuxième partie, nous abordons la problématique de prédiction de représentation textuelle directement à partir des observations acoustiques. Pour cela, nous effectuons une étude approfondie des approches RAP End-to-End : comment pouvons nous apprendre des alignements séquentiels entre l'audio et le texte ? Quel type d'architecture utiliser ? Et surtout, quel type d'unités en sortie choisir (caractère, pièce de mot, mot) ? Nous répondons à ces questions avec un ensemble d'expérience sur les corpus TIMIT et LibriSpeech. Ces travaux ont été, dans une grande partie, menés au cours d'un séjour scientifique au laboratoire du Mila au Canada dans le cadre du développement de l'outil open-source "SpeechBrain". Dans une troisième partie, nous explorons des approches multi-tâche sur les systèmes RAP End-to-End afin d'exploiter plusieurs représentations textuelles, dans notre cas, des sorties caractères et des sorties consonnes/voyelles. Nous avons proposé une nouvelle technique de combinaisons des représentations textuelles pour l'amélioration des performances de reconnaissance.

Automatic Speech Recognition : from hybrid to end-to-end approach

Reconnaissance automatique de la parole à large vocabulaire : des approches hybrides aux approches End-to-End

Résumé

Mots clés

Domaines

Dates et versions

Identifiants

Citer

Exporter

Collections

Partager