L’intelligence artificielle (IA) est née au cours des années 1950,
sous l’impulsion de pionniers notamment John McCarthy, Marvin Minsky,
Claude Shannon. Son but est d’implanter sur ordinateur des systèmes
simulant des fonctions réputées intelligentes : reconnaissance de
la parole et des images, raisonnement, prise de décision, etc.
De tels systèmes se fondent sur différents types de modèles, en
particulier les réseaux neuronaux, ou neuromimétiques, qui tirent
leur inspiration du modèle cortical humain ou animal : un ensemble
d’unités très simples (les « neurones ») en très grand nombre et fortement
interconnectés. Un avantage majeur est leur capacité d’apprentissage
à partir d’exemples. Vers 2010, des résultats spectaculaires dans
de nombreux domaines (jeu de go, interprétation d’images, reconnaissance
de la parole, traitement de la langue naturelle écrite, diagnostic)
ont mis en lumière un type particulier de ces modèles : les réseaux
neuronaux profonds (
Deep Neural Networks
).
La caractéristique de tels modèles est d’être formés d’un nombre
important de couches de neurones pouvant atteindre plusieurs centaines.
L’apprentissage profond de ces modèles nécessitent à la fois trois
conditions :
des algorithmes performants (amélioration de la rétropropagation
du gradient d’erreur) ;
des moyens de calcul parfois considérables (processeur spécialisés
tels que ceux de la firme Nvidia) ;
la disponibilité de quantités importantes de données d’apprentissage,
notamment les
big data
, ces données numériques que nous produisons
tous quotidiennement de façon massive (messages vocaux et écrits,
signaux GPS, informations climatiques, achats, transactions bancaires,
publications scientifiques, journaux et revues, etc.)
Parmi ces réseaux neuronaux profonds, un modèle s’est révélé particulièrement
performants. Il s’agit des réseaux convolutifs, conçus initialement
pour l’image et étendu ensuite à de nombreux domaines d’application.
L’IA générative utilise les réseaux neuronaux profonds pour produire
à la demande un texte, une image, une vidéo, une musique, etc. Cette
production résulte d’une courte description textuelle appelée prompt.
Cet article présente les différents types de modèles d’IA générative
et décrit leur fonctionnement. Les domaines de l’écrit (notamment
ChatGPT
) et de l’image (tel que
MidJourney
) sont particulièrement
considérés.