3. Préparer les données
Il est illusoire de penser que les données trouvées dans les différentes sources seront prêtes à l’emploi.
L’analyste devra appliquer plusieurs traitements successifs :
contrôle des aberrations et des extrêmes avec suppression éventuelle ;
homogénéisation des données lorsque cela est possible (qu’il s’agisse de données chiffrées à convertir ou de noms à uniformiser par exemple) ; cf. figure « Exemple de traitement d’homogénéisation des noms proposé par Open Refine ». Open Refine est un outil qui permet de retraiter les données, de les uniformiser, ou de les dédoublonner ;
structuration des données en exploitant par exemple des solutions de segmentation (Web scrapping) ou d’extraction d’entités nommées ;
exploitation des données (traitements...
Cet article est réservé aux abonnés
Cet article est réservé aux abonnés. Il vous reste 92 % à découvrir.
Déjà abonné ?
Se connecter
Lecture en cours
Préparer les données