Analyse et reconnaissance d'images de documents

Ajouter à la bibliothèque

H7020 V1 Article de référence

Analyse et reconnaissance d'images de documents

Auteur(s) : Rolf INGOLD

Date de publication : 10 août 2002 | Read in english

Ajouter à la bibliothèque Ajouter à la bibliothèque

Logo Techniques de l'Ingenieur Cet article est réservé aux abonnés
Pour explorer cet article plus en profondeur Consulter un extrait gratuit

Déjà abonné ?

Présentation

Lire cet article issu d'une ressource documentaire complète, actualisée et validée par des comités scientifiques.

Lire l'article

AUTEUR(S)

  • Rolf INGOLD : Professeur - Département d’informatique, université de Fribourg (Suisse)

 INTRODUCTION

L’analyse et la reconnaissance d’images de documents désignent une discipline scientifique qui regroupe un ensemble de techniques informatiques dont le but est de reconstituer le contenu d’un document à partir de son image. Alors qu’elle est longtemps restée cantonnée dans la problématique de la reconnaissance de caractères, elle vise aujourd’hui des objectifs beaucoup plus larges, allant de la simple classification de documents à l’interprétation complète du contenu en passant par l’indexation ou la réédition. Ainsi, le but ultime de la reconnaissance d’images de documents est de générer une représentation de haut niveau sous la forme de documents structurés, selon une forme adéquate pour l’application visée.

À titre introductif, considérons par exemple une page tirée d’un livre scientifique (figure  1 a ) qu’il s’agirait d’« hypertextualiser », c’est-à-dire d’en produire une version électronique munie des liens hypertexte pour la navigation. Dans une telle application, il est impératif de déterminer la structure logique de l’ouvrage, c’est-à-dire son organisation hiérarchique en chapitres, sections et paragraphes, d’identifier les définitions, les énoncés d’exercices, les descriptions d’expériences, les formules, etc. La figure  1 b reflète visuellement cette structure au niveau de la page alors que la figure  1 c illustre la structure hiérarchique qui en découle. C’est cette structure qui pourra être exploitée lors de la navigation dans l’hypertexte.

Traditionnellement, la reconnaissance de documents s’est avant tout appliquée aux documents papier pour lesquels aucune forme électronique n’était disponible. Aujourd’hui, on reconnaît l’intérêt de ces techniques pour la restructuration de documents électroniques, non ou mal structurés, en se servant de l’image produite de manière synthétique, par exemple à l’aide d’un moteur d’impression Postscript.

Sur le plan historique, il est intéressant de remarquer que la lecture optique de caractères est bien antérieure au développement de l’informatique puisque des brevets ont déjà été déposés au XIX e siècle et qu’un prototype de démonstration a été signalé en 1916. Les premières approches informatiques de la reconnaissance de caractères remontent au début des années 1960 ; ainsi, la première machine à trier le courrier (limitée aux adresses dactylographiées) a été installée aux États-Unis en 1965. Cependant, les...

Cet article est réservé aux abonnés
Logo Techniques de l'Ingenieur

Cet article est réservé aux abonnés. Il vous reste 92 % à découvrir.

Cet article est réservé aux abonnés Consulter un extrait gratuit

Déjà abonné ?


DOI (DIGITAL OBJECT IDENTIFIER)

https://doi.org/10.51257/a-v1-h7020

Lecture en cours
Analyse et reconnaissance d'images de documents

Article inclus dans l'offre

"Documents numériques Gestion de contenu"

( 114 articles )

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques.

Services

Quiz, médias, tableaux, formules, vidéos, etc.

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.

Des avantages inclus

Un ensemble de services exclusifs en complément des ressources.

Voir le détail de l'offre

Dans les ressources documentaires

XML : syntaxe

C’est une certitude, le langage XML est la nouvelle base du document numérique, grâce à ses nombreux avan...

XML et son écosystème

Cet article traite de la structuration de fichiers XML, de la manière de les produire, de les utiliser, d...

Indexation et archivage de contenus multimédias

L'indexation consiste à caractériser le contenu d'un document et l'information qu'il détient de manière à...

Reconnaissance en-ligne d'écriture manuscrite

Dans cet article, est exposé un panorama de la recherche sur la reconnaissance de l'écriture manuscrite, ...

Tous les livres blancs
Article Vers un nouveau record des cyberattaques ?
25 septembre 2019
Vers un nouveau record des cyberattaques ?

Année après année, c’est toujours le même constat : peu ou mal protégées, les entreprises et les administrations sont de plus en plus nombreuses à être victimes...

Article Le who’s who des pirates
29 octobre 2019
Le who’s who des pirates

Les groupes français Thales et israélien Verint ont publié un annuaire mondial des groupes de pirates les plus actifs et efficaces.

Toutes les actualités

Inscrivez-vous aux newsletters !

Contactez-nous