Histoire
7 min de lecture

Unicode et UTF-8 : comprendre l'encodage des accents

Les problèmes d'encodage transforment vos accents en caractères illisibles. Comprenez Unicode et UTF-8 pour les éviter.

Publié le

Pourquoi vos accents se transforment-ils parfois en caractères illisiblescomme « é » ou « ç » ? La réponse tient en deux mots : Unicode et encodage.

Le problème historique

Dans les années 1960, le standard ASCII ne définissait que 128 caractères — suffisant pour l'anglais, mais pas pour le français. Chaque pays a créé ses propres extensions :

  • Latin-1 (ISO 8859-1) : pour les langues d'Europe occidentale
  • Windows-1252 : variante Microsoft de Latin-1
  • MacRoman : encodage des anciens Mac

Résultat : un fichier créé sur un système pouvait devenir illisible sur un autre.

La solution : Unicode

Unicode attribue un numéro unique à chaque caractère de toutes les langues du monde. Par exemple :

CaractèreCode UnicodeNom
ÉU+00C9Latin Capital Letter E With Acute
ÇU+00C7Latin Capital Letter C With Cedilla
ŒU+0152Latin Capital Ligature OE
U+20ACEuro Sign

UTF-8 : l'encodage universel

UTF-8 est la méthode d'encodage Unicode la plus utilisée. Elle est compatible avec ASCII et supporte tous les caractères français.

Le « Mojibake » : caractères corrompus

Quand un texte UTF-8 est interprété comme Latin-1 (ou inversement), les accents deviennent des séquences de caractères bizarres :

Texte originalMojibake
éé
èè
çç
àà

Comment éviter les problèmes ?

  • Enregistrez toujours en UTF-8
  • Vérifiez l'encodage des fichiers reçus
  • Configurez vos bases de données en utf8mb4
  • En HTML, ajoutez <meta charset="UTF-8">
💡 Astuce : Si vous rencontrez des accents corrompus, l'outil Copier-Accent.frvous permet de copier les bons caractères pour corriger manuellement.

Questions fréquentes

C'est un problème d'encodage appelé 'Mojibake'. Le fichier a été enregistré dans un encodage (ex: UTF-8) et lu dans un autre (ex: Latin-1). La solution : convertir en UTF-8.

ASCII ne supporte que 128 caractères (pas d'accents). UTF-8 supporte plus d'un million de caractères, dont tous les accents français. UTF-8 est le standard moderne.

Dans Notepad++ : menu Encodage. Dans VS Code : en bas à droite de la fenêtre. La bonne pratique est de toujours utiliser UTF-8 pour les textes français.

UnicodeUTF-8encodageASCIIcaractères françaisMojibake

🔤 Copier les lettres mentionnées

Accédez directement aux pages de ces caractères pour les copier

Articles similaires

Continuez votre lecture avec ces guides complémentaires