3. Moteur d'indexation
Une fois les pages du Web crawlées, le
spider
envoie au
moteur d'indexation les informations collectées. L'indexation s'effectue
en texte intégral : tous les mots d'une page, et plus globalement
son code HTML, sont alors pris en compte.
Les systèmes d'indexation se chargent ensuite d'identifier en
« plein texte » l'ensemble des mots des textes contenus dans les pages
ainsi que leur position à l'intérieur de celle-ci. Certains moteurs
peuvent cependant limiter leur capacité d'indexation. Ainsi, pendant
de longues années, Google s'est limité aux 101 premiers kilooctets
des pages (ce qui représentait cependant une taille assez conséquente).
Cette limite n'est plus aujourd'hui d'actualité. D'autres moteurs...
Cet article est réservé aux abonnés
Cet article est réservé aux abonnés. Il vous reste 92 % à découvrir.
Déjà abonné ?
Se connecter
Lecture en cours
Moteur d'indexation