Contactez-nous
Réseaux neuronaux profonds
Reconnaissance automatique de la parole
H3728 v3 Article de référence

Réseaux neuronaux profonds
Reconnaissance automatique de la parole

Auteur(s) : Jean-Paul HATON

Date de publication : 10 oct. 2018 | Read in English

Logo Techniques de l'Ingenieur Cet article est réservé aux abonnés
Pour explorer cet article plus en profondeur Consulter l'extrait gratuit

Déjà abonné ?

Présentation

1 - Caractéristiques de la communication parlée homme-machine

2 - Domaines de la reconnaissance automatique de la parole

  • 2.1 - Historique
  • 2.2 - Applications
  • 2.3 - Mise en œuvre et évaluation d’un système

3 - Analyse du signal de parole

4 - Reconnaissance de mots

5 - Reconnaissance et compréhension de la parole continue

6 - Méthodes robustes pour la reconnaissance

7 - Réseaux neuronaux profonds

8 - Perspectives et conclusion

Sommaire

Présentation

RÉSUMÉ

Des progrès importants ont été faits ces dernières années concernant les taux de reconnaissance de la parole (proches de ceux d’un être humain), mais le niveau de compréhension demeure très faible. Les systèmes sont fondés sur une modélisation statistique de la langue parlée: modèles acoustiques de Markov cachés (Hidden Markov Models, HMM) et modèles n-grammes mémorisant les probabilités conditionnelles de séquences d’unités linguistiques. Les progrès récents proviennent du couplage de ces modèles statistiques à des modèles neuronaux profonds, comportant un grand nombre de couches cachées, entraînés à l’aide d’énorme quantité de données. Les applications concernent la dictée vocale, la transcription de médias (radio, télévision) et surtout la télématique vocale (assistants vocaux).

Lire cet article issu d'une ressource documentaire complète, actualisée et validée par des comités scientifiques.

Lire l’article

Auteur(s)

  • Jean-Paul HATON : Professeur à l’Université de Lorraine, LORIA/INRIA – Membre de l’Institut universitaire de France

INTRODUCTION

L’utilisation de la parole comme mode de communication entre un homme et une machine a été largement étudiée au cours des dernières décennies. Nous nous intéressons dans cet article à la reconnaissance automatique de la parole (RAP), c’est-à-dire à l’ensemble des techniques permettant de communiquer oralement avec une machine. La RAP présente un intérêt pratique indéniable, dans certaines conditions d’utilisation (accès à distance, charge de travail importante, handicapés, etc.). Des produits commerciaux existent depuis plus de trente ans, d’abord essentiellement pour la reconnaissance de mots isolés et enchaînés puis maintenant pour des phrases prononcées continûment. La plupart sont fondés sur des algorithmes de programmation dynamique et des modèles stochastiques (sources de Markov). Néanmoins, des problèmes restent à résoudre pour accroître la robustesse de ces systèmes et étendre leurs capacités de dialogue. Les recherches menées actuellement portent ainsi sur la reconnaissance de parole bruitée, le traitement d’énoncés incomplets ou incorrects, la définition de procédures de dialogue, etc.

Logo Techniques de l'Ingenieur

Cet article est réservé aux abonnés.
Il vous reste 93 % à découvrir.

Pour explorer cet article Consulter l'extrait gratuit

Déjà abonné ?


VERSIONS

Il existe d'autres versions de cet article :

DOI (Digital Object Identifier)

https://doi.org/10.51257/a-v3-h3728

Lecture en cours
Présentation

Article inclus dans l'offre

"Technologies logicielles Architectures des systèmes"

(237 articles)

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques.

Des contenus enrichis

Quiz, médias, tableaux, formules, vidéos, etc.

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.

Des avantages inclus

Un ensemble de services exclusifs en complément des ressources.

Voir l'offre

7. Réseaux neuronaux profonds

Vers 2006, les modèles acoustiques de reconnaissance ont été améliorés de façon importante grâce aux modèles neuronaux profonds (Deep Neural Networks, DNN) possédant un nombre de couches cachées nettement supérieur aux traditionnels perceptrons multicouches (plusieurs dizaines, voire plus, avec des milliers de nœuds dans les couches cachées). Ces réseaux, inspirés du fonctionnement du cortex animal, sont capables d’apprendre des fonctions beaucoup plus complexes qu’auparavant. Un algorithme d’apprentissage possible de ces réseaux profonds, proposé par G. Hinton est de type semi-supervisé. Le principe revient à initialiser les poids des connexions de chaque couche de façon non supervisée, puis d’adapter l’ensemble du réseau de façon supervisée. Les DNN ont montré leur efficacité dans des domaines très variés, y compris en reconnaissance de la parole, mais aussi en traitement de textes, en vision par ordinateur et en diagnostic. Il faut aussi citer les précurseurs de ces modèles profonds conçus pour le traitement d’images et la reconnaissance de l’écriture : Fukushima (1980) et son Neocognitron, et Le Cun (1990) et ses réseaux neuronaux convolutionnels. Parmi les réseaux neuronaux profonds, une place importante en reconnaissance de la parole est tenue par les réseaux récurrents comportant des rétroactions de la couche de sortie du réseau vers les couches précédentes jusqu’à la couche d’entrée.

La rapide émergence des réseaux profonds et leurs performances exceptionnelles sont dues à la convergence de trois conditions :

  • l’existence de très grandes bases de données acoustiques étiquetées nécessaires à l’apprentissage de ces modèles. Il s’agit d’un exemple du phénomène récent de Big Data. Les grands opérateurs du domaine disposent de millions d’heures de parole, ce qui permet de disposer de systèmes de reconnaissance dans de nombreuses langues (plus d’une centaine pour Google, par exemple) ;

  • la disponibilité de capacités de calcul sans cesse en augmentation (notamment à l’aide cartes additionnelles GPU et calcul haute performance) ;

  • l’amélioration des algorithmes d’apprentissage de ces modèles (Deep Learning).

Les réseaux neuronaux profonds ont également permis des progrès considérables dans de nombreux autres domaines : jeux (échecs,...

Logo Techniques de l'Ingenieur

Cet article est réservé aux abonnés.
Il vous reste 93 % à découvrir.

Pour explorer cet article Consulter l'extrait gratuit

Déjà abonné ?


Lecture en cours
Réseaux neuronaux profonds

Article inclus dans l'offre

"Technologies logicielles Architectures des systèmes"

(237 articles)

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques.

Des contenus enrichis

Quiz, médias, tableaux, formules, vidéos, etc.

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.

Des avantages inclus

Un ensemble de services exclusifs en complément des ressources.

Voir l'offre

Sommaire
Sommaire

BIBLIOGRAPHIE

  • (1) - RABINER (L.), HUANG (B.H.) -   Fundamentals of speech recognition. –  -  Prentice-Hall, Englewood Cliffs (1993).

  • (2) - JUNQUA (J.-C.), HATON (J.-P.) -   Robustness in automatic speech recognition. –  -  Kluwer Academic, Dordrecht (1996).

  • (3) - BOITE (R.), BOURLARD (H.), DUTOIT (T.), HANCQ (J.), LEICH (H.) -   Traitement de la parole. –  -  Presses polytechniques et universitaires romandes, Lausanne (2000).

  • (4) - MINKER (W.), BENNACEF (S.) -   Reconnaissance vocale et dialogue homme-machine. –  -  Eyrolles, Paris (2000).

  • (5) - MARIANI (J.) (éd.) -   Reconnaissance de la parole : traitement automatique du langage parlé. –  -  Hermes – Science – Lavoisier, Paris (2002).

  • (6) - COHEN (M.), GIANGOLA (J.), BALOGH (J.) -   Voice...

1 Outils logiciels

HTK (HMM ToolKit) : logiciel libre destiné au développement d’applications complètes de reconnaissance de la parole fondées sur MMC http://www.htk.eng.cam.ac.uk/

VISPER (Visual speech processing system) : logiciel libre permettant de visualiser les étapes de reconnaissance par programmation dynamique et par MMC développé par l’Université Technique de Liberec, Tchéquie https://www.ite.tul.cz/speechlabe/index.php/old-projects/visper.html

SNOORI : logiciel libre d’analyse, de visualisation et d’étiquetage de la parole développé au LORIA par Yves Laprie pour les recherches en phonétique, perception et traitement automatique de la parole

Bases de données de parole étiquetée disponibles pour de nombreuses langues par l’intermédiaire des organismes :

LDC, Linguistic Data Consortium http://www.ldc.upenn.edu/

ELRA, European Language Resources Association http://www.elra.info/

Dragon Naturally Speaking de Nuance http://www.nuance.fr/Dragon12

HAUT DE PAGE

2 Annuaire

Constructeurs – Fournisseurs – Distributeurs (liste non exhaustive)

Sociétés spécialisées...

Logo Techniques de l'Ingenieur

Cet article est réservé aux abonnés.
Il vous reste 95 % à découvrir.

Pour explorer cet article Consulter l'extrait gratuit

Déjà abonné ?


Article inclus dans l'offre

"Technologies logicielles Architectures des systèmes"

(237 articles)

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques.

Des contenus enrichis

Quiz, médias, tableaux, formules, vidéos, etc.

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.

Des avantages inclus

Un ensemble de services exclusifs en complément des ressources.

Voir l'offre

Contenus associés

Sur le même sujet

S'inscrire à la Veille Personnalisée

Ressources documentaires

Méthodes numériques de base - Analyse numérique

L’analyse numérique étudie les méthodes, appelées constructives, de résolution numérique des problèmes. ...

Calcul des valeurs propres

Calculer les valeurs propres et les vecteurs propres de matrices est un important problème en analyse ...

Interpolation, approximation et extrapolation rationnelles

Le but de cet article est de présenter les méthodes d'interpolation et d'approximation par des fonctions ...