Le français a une particularité que peu de langues partagent : la ligature « œ » (comme dans « œuf » ou « sœur ») possède son propre point de code Unicode (U+0153), distinct des lettres « o » et « e » séparées — elle s'échappe donc comme un seul caractère, \u0153, et non comme deux.
À quoi ressemble une phrase française échappée
Un mot comme « cœur » génère un code d'échappement pour le « œ » qui n'a aucun équivalent en écrivant simplement « o » suivi de « e » — remplacer la ligature par les deux lettres séparées changerait le texte, pas seulement sa forme visuelle. C'est une source d'erreurs fréquente quand un outil « corrige » automatiquement l'orthographe.
JSON et les séquences d'échappement
La spécification JSON permet d'échapper n'importe quel caractère d'une chaîne sous la forme \uXXXX. C'est fréquent quand les données sont générées automatiquement et que le sérialiseur évite les caractères hors ASCII par compatibilité — un mot comme « déjà » peut alors apparaître dans un JSON sous la forme d'une série de codes d'échappement.
Quand c'est nécessaire
- Lire, en langage clair, quel texte se cache derrière des séquences d'échappement dans une réponse JSON d'API.
- Préparer une chaîne pour un environnement qui n'accepte pas les caractères hors ASCII.
- Diagnostiquer des problèmes d'encodage lors du traitement de données externes.
Caractères hors du plan de base (emojis)
Le « œ » comme les lettres accentuées françaises tiennent dans un seul code d'échappement, car ils appartiennent au plan multilingue de base. Les emojis, eux, se situent en dehors de ce plan et sont encodés en JavaScript avec deux codes — une paire supplétive comme \ud83d\ude00 — ce qui n'arrive jamais avec les lettres propres au français.