Échange et restitution de caractères
Codage des caractères
H7008 v1 Article de référence

Échange et restitution de caractères
Codage des caractères

Auteur(s) : Jacques ANDRÉ

Date de publication : 10 nov. 2001

Logo Techniques de l'Ingenieur Cet article est réservé aux abonnés
Pour explorer cet article plus en profondeur Consulter l'extrait gratuit

Déjà abonné ?

Présentation

1 - Échange et restitution de caractères

2 - Codages à moins de 7 moments

3 - Codage à 7 bits : Ascii ou ISO 646

4 - Codages à 8 bits

5 - Codage 16 ou 32 bits : Unicode et ISO 10646

6 - Échange de caractères sur Internet

  • 6.1 - Organismes
  • 6.2 - Codage des caractères avec X400
  • 6.3 - Courrier électronique
  • 6.4 - HTML et XML
  • 6.5 - Multilinguisme

7 - Outils de transcodage

8 - Conclusion

Sommaire

Présentation

Auteur(s)

Lire cet article issu d'une ressource documentaire complète, actualisée et validée par des comités scientifiques.

Lire l’article

INTRODUCTION

Un codage de caractère est un ensemble de couples associant à chaque caractère un nom et une valeur numérique. Après avoir explicité le concept de caractère (entité abstraite) et celui de glyphe (forme graphique), on présente les divers standards ou normes d’échange de caractères en fonction de la taille des répertoires. On présente notamment les codages Ascii (7 bits, utilisé pour l’américain), Latin-1 (8 bits, utilisé pour les langues de l’Europe de l’ouest) et le nouveau codage universel Unicode (16 bits, couvrant toutes les langues du monde). On montre enfin l’utilisation de ces normes dans le cadre de l’échange d’information sur le web, en particulier pour le courrier électronique (RFC, MIME) et par le biais d’HTML et de XML.

Cet article est essentiellement consacré aux normes d’échanges de caractères, un second article [H 7 012] devant traiter des problèmes d’impression ou d’affichage de ces caractères (c’est-à-dire de ce que l’on nomme souvent les « fontes »). Dans l’introduction du présent article, nous expliquons la différence entre ces domaines et en précisons les limites. Un troisième article [H 7 014] traitera de saisie et notamment des claviers et enfin un quatrième [H 7 358] de multilinguisme.

Logo Techniques de l'Ingenieur

Cet article est réservé aux abonnés.
Il vous reste 94 % à découvrir.

Pour explorer cet article Consulter l'extrait gratuit

Déjà abonné ?


DOI (Digital Object Identifier)

https://doi.org/10.51257/a-v1-h7008

Lecture en cours
Présentation

Article inclus dans l'offre

"Documents numériques Gestion de contenu"

(66 articles)

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques.

Des contenus enrichis

Quiz, médias, tableaux, formules, vidéos, etc.

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.

Des avantages inclus

Un ensemble de services exclusifs en complément des ressources.

Voir l'offre

1. Échange et restitution de caractères

S’il est un domaine irritant en matière de documents électroniques c’est bien celui de l’emploi des caractères dès que l’on communique avec une tierce personne. Mais à bien y réfléchir, cette difficulté de manipulation des caractères est sans doute chose normale car la notion de caractère est sujette à interprétations différentes selon que l’on est linguiste ou typographe (les premiers ignorant par exemple la ligature «  ; »), asiatique (avec idéogrammes), européen (avec caractères alphabétiques) ou hébreu (sans la notion de majuscule /minuscule), mais aussi selon que l’on dispose, ou non, d’un ordinateur où taper un « É » ne pose pas de problème (car alors on a envie de dire que l’on est dans le vrai et que les autres ont tort !), etc.

Ce qui est vrai pour les hommes l’est aussi pour les machines ! Chaque ordinateur a son propre codage (c’est-à-dire la façon de remplacer un caractère par un nombre) et on pourrait même dire chaque morceau d’ordinateur : lorsqu’un auteur francophone tape un « î », il frappe, selon son clavier, la touche morte « ^ » puis la touche « i », ou directement une touche « î ». Nous verrons ces problèmes de saisie dans l’article sur les claviers [H 7 014].

Avec un Macintosh, le caractère « î » sera codé en interne comme le nombre 235, tandis que sous Windows, ce sera 238. Si ledit auteur a saisi son texte en Word sous Windows et qu’il l’enregistre sous forme HTML, ce « î » sera remplacé par une séquence de plusieurs caractères, à savoir « î » ; s’il l’enregistre au format RTF, ce sera « \’e ». S’il met la version HTML sur le web ou s’il envoie son fichier RTF par l’internet à un correspondant, en principe tout le monde pourra bien lire le « î » ! En revanche, si cet auteur tape un « î » dans un message et si son serveur de messagerie (ou...

Logo Techniques de l'Ingenieur

Cet article est réservé aux abonnés.
Il vous reste 95 % à découvrir.

Pour explorer cet article Consulter l'extrait gratuit

Déjà abonné ?


Lecture en cours
Échange et restitution de caractères

Article inclus dans l'offre

"Documents numériques Gestion de contenu"

(66 articles)

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques.

Des contenus enrichis

Quiz, médias, tableaux, formules, vidéos, etc.

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.

Des avantages inclus

Un ensemble de services exclusifs en complément des ressources.

Voir l'offre

Sommaire
Sommaire

BIBLIOGRAPHIE

  • (1) - AKIRA (M.) -   Writing Systems of the World : Alphabets, Syllabaries, Pictograms,  -  Charles E Tuttle Co ; ISBN : 0804816549, octobre 1990.

  • (2) - ANDRÉ (J.) -   IsoLatin-1, une norme de codage de caractères européens ? trois caractères français en sont absent !  -  Cahier GUTenberg, no 25, p. 65-77. Voir [18], novembre 1996.

  • (3) - ANDRÉ (J.) -   Iso-Latin-9, euro et typographie française.  -  Document numérique, vol. 2, no 2, p. 231-240 (1998).

  • (4) - AUMONT (S.), DIRLEWANGER (R.) -   Recevoir les accents dans votre messagerie, c’est possible...  -  Document numérique, vol. 2, no 1, p. 93-101 (1998). http://www.cru.fr/listes/apropos/accents.html

  • (5) - BEEBE (N.) -   Fonts for the Unicode Character Set.  -  http://www.math.utah.edu/~beebe/fonts/unicode.html

  • (6) - BIGELOW...

1 Sites Internet

HAUT DE PAGE

1.1 Normes et standards de codage de caractères

Alphabet phonétique international/IPA : http://www.arts.gla.ac.uk/IPA/ipa.html

EBCDIC : http://www4.ibm.com/software/ts/mqseries/support/faqs/conver16.html/ http://anubis.dkuug.dk/i18n/charmaps/

ISO 2022 : http://www.iso.ch/catf/d22747.html

ISO 8859 : http://babel.alis.com/codage/iso8859/

Latin-9 : LABONTÉ (A.) et EVERSON (M.). – Épreuve finale pour l’alphabet latin no 9 : http://www.indigo.ie/egt/standards/iso8859/8859-15-fr.pdf

Latin-10 : EVERSON (M.), CD pour l’alphabet latin no 10 : http://www.indigo.ie/egt/standards/iso8859/cd8859-16-fr.pdf

Standard Roman Character Set d’Apple : http://developer.apple.com/techpubs/mac/Text/Text-30.htmlMARKER-9-69

STIX : Proposition pour le codage des caractères MathML : http://www.ams.org/STIX/

UNICODE :...

Logo Techniques de l'Ingenieur

Cet article est réservé aux abonnés.
Il vous reste 94 % à découvrir.

Pour explorer cet article Consulter l'extrait gratuit

Déjà abonné ?


Article inclus dans l'offre

"Documents numériques Gestion de contenu"

(66 articles)

Une base complète d’articles

Actualisée et enrichie d’articles validés par nos comités scientifiques.

Des contenus enrichis

Quiz, médias, tableaux, formules, vidéos, etc.

Des modules pratiques

Opérationnels et didactiques, pour garantir l'acquisition des compétences transverses.

Des avantages inclus

Un ensemble de services exclusifs en complément des ressources.

Voir l'offre

Ressources documentaires

Protocoles SSL/TLS

Cet article a pour objet la sécurisation des applications de type client-serveur sur Internet. La ...

XML : syntaxe

C’est une certitude, le langage XML est la nouvelle base du document numérique, grâce à ses nombreux ...

Métadonnées, ontologies et documents numériques

L'arrivée du XXIe siècle coïncide avec une explosion du volume des informations numériques qu’il importe ...