Présentation
RÉSUMÉ
Cet article présente l’évolution récente des techniques d’évaluation et d’amélioration de la qualité des données basées sur des méthodes d’apprentissage automatique. Il décrit les solutions issues principalement du monde de la recherche ainsi que des approches mises en œuvre pour détecter et corriger les principaux problèmes de qualité des données que sont les données aberrantes, incohérentes ou manquantes et les doublons.
Lire cet article issu d'une ressource documentaire complète, actualisée et validée par des comités scientifiques.
Lire l'articleAUTEUR(S)
-
Laure BERTI-ÉQUILLE : Directrice de Recherche - Institut de Recherche pour le Développement - ESPACE-DEV - Montpellier, France
INTRODUCTION
Des progrès significatifs ont été accomplis ces dernières années dans la conception d’outils permettant d’automatiser l’évaluation, le suivi et l’amélioration de la qualité des données, notamment grâce aux avancées technologiques de l’Intelligence Artificielle, et en particulier, de l’apprentissage automatique ( ML – Machine Learning ). Les techniques d’apprentissage ont été rendues opérationnelles à grande échelle et largement déployées dans tous les secteurs d’activités afin d’automatiser les tâches de prédiction et de classification en aide à la décision pour de nombreux domaines d’application (santé, finance, marketing, etc.). La fiabilité des résultats de ces méthodes demeure cependant très dépendante de la qualité des données en entrée des modèles d’apprentissage. Les données sont souvent imparfaites et la qualité des données optimale est rarement au rendez-vous. Ainsi, deux approches complémentaires sont communément proposées : l’une émanant de la communauté de recherche en gestion des données visant à corriger les données en amont des chaînes d’analyse (par nettoyage ou réparation des données) et l’autre issue de la communauté des chercheurs et praticiens en apprentissage ( data scientists ) visant à développer des modèles plus robustes au bruit et plus performants en mettant davantage l’accent sur la transformation et la préparation des données en fonction d’une tâche prédictive particulière.
Pendant des décennies, pour la communauté spécialisée en gestion des données, le nettoyage des données a consisté à corriger et transformer les données par des approches déclaratives de type ETL (Extraction-Transformation-Loading) , à détecter les incohérences dans les bases de données relationnelles sous forme de violation de contraintes, à les « réparer »
Cet article est réservé aux abonnés. Il vous reste 92 % à découvrir.
Déjà abonné ? Se connecter
MOTS-CLÉS
apprentissage automatique | qualité des données | science des données | détection d'anomalies | nettoyage des données | gestion de la qualité des données | réparation de données
DOI (DIGITAL OBJECT IDENTIFIER)
Détection et correction des problèmes de qualité de données par apprentissage automatique
Sources bibliographiques
Cet article est réservé aux abonnés. Il vous reste 92 % à découvrir.
Déjà abonné ? Se connecter
Quiz et tests de validation présents dans cet article
Entraînez-vous autant que vous le voulez avec les quiz d'entraînement.
Article inclus dans l'offre
"Technologies logicielles Architectures des systèmes"
(
408 articles
)
Actualisée et enrichie d’articles validés par nos comités scientifiques.
Quiz, médias, tableaux, formules, vidéos, etc.
Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.
Un ensemble de services exclusifs en complément des ressources.