Perspectives et conclusion
Reconnaissance automatique de la parole

H3728 v2 Archive

Perspectives et conclusion
Reconnaissance automatique de la parole

Auteur(s) : Jean-Paul HATON

Date de publication : 10 nov. 2012

Cet article est réservé aux abonnés

Pour explorer cet article plus en profondeur Consulter l'extrait gratuit

Déjà abonné ?Se connecter

Sommaire
Médias

Présentation

1 - Caractéristiques de la communication parlée homme-machine

2 - Domaines de la reconnaissance automatique de la parole

2.1 - Historique
2.2 - Applications
2.3 - Mise en œuvre et évaluation d'un système

3 - Analyse du signal de parole

3.1 - Méthodes générales
3.2 - Méthodes avec modélisation
3.3 - Tendances actuelles

Figure 6 - Ondelette de Morlet

4 - Reconnaissance de mots

4.1 - Principe général
4.2 - Normalisation temporelle
4.3 - Modélisation stochastique
4.4 - Modèles neuromimétiques

5 - Reconnaissance et compréhension de la parole continue

5.1 - Position du problème
5.2 - Approche bayésienne
5.3 - Architecture d'un système de reconnaissance de parole continue
5.4 - Compréhension de la parole et systèmes de dialogue

6 - Méthodes robustes pour la reconnaissance

6.1 - Position du problème
6.2 - Méthodes de prétraitement du signal
6.3 - Adaptation de systèmes
6.4 - Méthodes de paramétrisation robustes

7 - Perspectives et conclusion

Bibliographie & annexes

Présentation

Auteur(s)

Jean-Paul HATON : Professeur à l'Université de Lorraine, LORIA/INRIA - Membre de l'Institut universitaire de France

Lire cet article issu d'une ressource documentaire complète, actualisée et validée par des comités scientifiques.

Lire l’article

INTRODUCTION

L'utilisation de la parole comme mode de communication entre un homme et une machine a été largement étudiée au cours des dernières décennies. Nous nous intéressons dans ce dossier à la reconnaissance automatique de la parole (RAP), c'est-à-dire à l'ensemble des techniques permettant de communiquer oralement avec une machine. La RAP présente un intérêt pratique indéniable, dans certaines conditions d'utilisation (accès à distance, charge de travail importante, handicapés, etc.). Des produits commerciaux existent depuis plus de trente ans, d'abord essentiellement pour la reconnaissance de mots isolés et enchaînés puis maintenant pour des phrases prononcées continûment. La plupart sont fondés sur des algorithmes de programmation dynamique et des modèles stochastiques (sources de Markov). Néanmoins, des problèmes restent à résoudre pour accroître la robustesse de ces systèmes et pour étendre leurs capacités de dialogue. Les recherches menées actuellement portent ainsi sur la reconnaissance de parole bruitée, le traitement d'énoncés incomplets ou incorrects, la définition de procédures de dialogue, etc.

Cet article est réservé aux abonnés.
Il vous reste 95 % à découvrir.

Pour explorer cet article Consulter l'extrait gratuit

Déjà abonné ? Se connecter

VERSIONS

Il existe d'autres versions de cet article :

Version archivée 1 de août 1998 par Jean-Paul HATON
Version courante de oct. 2018 par Jean-Paul HATON

DOI (Digital Object Identifier)

https://doi.org/10.51257/a-v2-h3728

Lecture en cours
Présentation

Page
suivante

Caractéristiques de la communication parlée homme-machine

Article inclus dans l'offre

"Documents numériques Gestion de contenu"

(65 articles)

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques.

Des contenus enrichis

Quiz, médias, tableaux, formules, vidéos, etc.

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.

Des avantages inclus

Un ensemble de services exclusifs en complément des ressources.

Voir l'offre

7. Perspectives et conclusion

Après plus de soixante années de recherches et de développement industriel, les performances des systèmes de RAP se sont considérablement améliorées, permettant d'aborder des domaines d'application de complexité croissante. Les travaux actuels les plus avancés concernent des systèmes de dialogue via le téléphone, la reconnaissance de la parole spontanée ou la transcription d'émissions de radio ou télévision. Les performances obtenues dépendent beaucoup du type de tâche considérée (taille et difficulté du vocabulaire, locuteurs, conditions d'enregistrement).

Le traitement automatique de la parole a été dès l'origine fortement tributaire de l'évolution technologique. D'abord purement en électronique analogique, les systèmes de RAP ont ensuite été implantés sur ordinateur. Les progrès de la microélectronique permettent la miniaturisation et l'implantation de systèmes complexes de RAP sous forme logicielle ou sur une puce et, de ce fait, leur utilisation dans des secteurs d'activité très variés, en particulier en lien avec le développement de la télématique vocale.

Malgré ces avancées, les systèmes actuels sont encore imparfaits. Les problèmes à résoudre représentent un des défis les plus difficiles posés à l'intelligence artificielle. Un important effort de recherche est nécessaire, notamment sur le plan de la robustesse des méthodes de reconnaissance et de la conception de systèmes de dialogue.

Les travaux à mener nécessitent un effort pluridisciplinaire de collecte de signal vocal, mais aussi de modélisation d'un ensemble de faits et de connaissances sur la langue naturelle et sur les mécanismes de la communication parlée. Nous avons vu qu'une modélisation stochastique permet de résoudre en partie le problème, mais il n'est pas exclu que l'utilisation de connaissances explicites revienne à l'ordre du jour à l'avenir.

Ainsi, la parole pourra devenir un des modes de communication privilégiés des futurs systèmes intelligents d'aide à l'utilisateur, dans des domaines d'activité variés.

HAUT DE PAGE

Cet article est réservé aux abonnés.
Il vous reste 92 % à découvrir.

Pour explorer cet article Consulter l'extrait gratuit

Déjà abonné ? Se connecter

Lecture en cours
Perspectives et conclusion

Page
précédenteMéthodes robustes pour la reconnaissance

Article inclus dans l'offre

"Documents numériques Gestion de contenu"

(65 articles)

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques.

Des contenus enrichis

Quiz, médias, tableaux, formules, vidéos, etc.

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.

Des avantages inclus

Un ensemble de services exclusifs en complément des ressources.

Voir l'offre

BIBLIOGRAPHIE

(1) - RABINER (L.), HUANG (B.H.) - Fundamentals of speech recognition. - Prentice-Hall, Englewood Cliffs (1993).
(2) - JUNQUA (J.-C.), HATON (J.-P.) - Robustness in automatic speech recognition. - Kluwer Academic, Dordrecht (1996).
(3) - BOITE (R.), BOURLARD (H.), DUTOIT (T.), HANCQ (J.), LEICH (H.) - Traitement de la parole. - Presses polytechniques et universitaires romandes, Lausanne (2000).
(4) - MINKER (W.), BENNACEF (S.) - Reconnaissance vocale et dialogue homme-machine. - Eyrolles, Paris (2000).
(5) - MARIANI (J.) (éd.) - Reconnaissance de la parole : traitement automatique du langage parlé. - Hermes – Science – Lavoisier, Paris (2002).
(6) - COHEN (M.), GIANGOLA (J.), BALOGH (J.) - Voice user interface design. - Addison-Wesley,...

ANNEXES

1 Outils logiciels
2 Annuaire
1. 2.1 Constructeurs – Fournisseurs – Distributeurs (liste non exhaustive)
3 Documentation

1 Outils logiciels

HTK (HMM ToolKit) : logiciel libre destiné au développement d'applications complètes de reconnaissance de la parole fondées sur MMC https://htk.eng.cam.ac.uk/

VISPER (Visual speech processing system ) : logiciel libre permettant de visualiser les étapes de reconnaissance par programmation dynamique et par MMC développé par l'Université Technique de Liberec, Tchéquie https://www.ite.tul.cz/speechlabe/index.php/old-projects/visper.html

SNOORI : logiciel libre d'analyse, de visualisation et d'étiquetage de la parole développé au LORIA par Yves Laprie pour les recherches en phonétique, perception et traitement automatique de la parole

Bases de données de parole étiquetée disponibles pour de nombreuses langues par l'intermédiaire des organismes :

LDC, Linguistic Data Consortium http://www.ldc.upenn.edu/

ELRA, European Language Resources Association http://www.elra.info/

Dragon Naturally Speaking de Nuance https://www.nuance.com/fr-fr/dragon.html

HAUT DE PAGE

2 Annuaire

...

Cet article est réservé aux abonnés.
Il vous reste 93 % à découvrir.

Pour explorer cet article Consulter l'extrait gratuit

Déjà abonné ? Se connecter

Article inclus dans l'offre

"Documents numériques Gestion de contenu"

(65 articles)