Kodierung

Unicode Escape

Kodierung und Dekodierung von Unicode-Sequenzen — Zeichen im Format \uXXXX und zurück.

A Unicode escape sequence (\uXXXX) writes a character as its code point instead of the character itself — so a string literal in code can contain any Unicode character while the source file itself stays plain ASCII.

How to use it

Common uses

Things to keep in mind

\uXXXX encodes exactly one 16-bit UTF-16 unit, not one visible character — characters outside the Basic Multilingual Plane (most emoji) need two such sequences together (a surrogate pair).

JSON only requires escaping for control characters and a few special characters — escaping every character as \uXXXX isn't required, though it is valid.

Artikel zu diesem Tool: Unicode Escape: was \uXXXX-Sequenzen bedeuten

Häufig gestellte Fragen

Was bedeutet das Format \uXXXX?

Es ist eine Escape-Sequenz, die einen Unicode-Codepunkt als vier hexadezimale Ziffern darstellt, etwa \u00e4 für ä. Sie wird in JavaScript, JSON und vielen anderen Sprachen verwendet, um Zeichen darzustellen, die nicht direkt im Quelltext getippt werden können.

Warum werden manche Zeichen wie Emojis als zwei \uXXXX-Sequenzen kodiert?

Zeichen außerhalb der Basic Multilingual Plane, etwa die meisten Emojis, passen nicht in einen einzelnen 16-Bit-Codepunkt und werden deshalb als Surrogatpaar aus zwei \uXXXX-Sequenzen dargestellt.

Wird der eingegebene Text irgendwohin übertragen?

Nein, die Kodierung und Dekodierung geschieht vollständig im Browser, ohne dass Daten an einen Server gesendet werden.

Was passiert, wenn ein Surrogatpaar mittendurch getrennt wird?

Es entsteht eine ungültige „verwaiste" Zeichen-Einheit – ein einzelner Code ohne seinen Partner. Die meisten Parser lehnen einen solchen String entweder mit einer Fehlermeldung ab oder zeigen das Ersatzzeichen „�" an.

Lässt sich ein Emoji mit einem einzigen \uXXXX kodieren?

Nein, sofern das Emoji außerhalb der Basic Multilingual Plane liegt (was auf die meisten modernen Emojis zutrifft) – dafür ist immer ein Surrogatpaar aus zwei \uXXXX-Sequenzen nötig.

Artikel: Kodierung

Base64: wozu Kodierung dient und wie sie funktioniert

Wie Base64 binäre Daten in ASCII-Text verwandelt und wann das wirklich gebraucht wird.

Base32: der Unterschied zu Base64 und wann es praktischer ist

Das case-insensitive Alphabet von Base32 und Fälle, in denen es praktischer ist als Base64.

URL Encode/Decode: Percent-Encoding in Links

Wie Sonderzeichen in Adressen und Query-Parametern zu %XX-Sequenzen werden.

HTML Entities: Sonderzeichen sicher auf einer Seite ausgeben

Warum die Zeichen < > & escapt werden müssen und wie das kaputtes Markup verhindert.

JWT: Aufbau eines Tokens und was „Dekodieren" eines JWT bedeutet

Header, Payload und Signature eines JWT — und warum Dekodieren nicht dasselbe ist wie Signaturprüfung.

ROT13 und die Caesar-Verschlüsselung: einfache Zeichensubstitution

Warum eine Verschiebung um 13 Buchstaben ROT13 selbstinvers macht und wozu man es heute noch nutzt.

Punycode: wie internationalisierte Domains im DNS funktionieren

Wie eine Domain mit nicht-lateinischen Zeichen zu einer ASCII-Form mit dem Präfix xn-- wird.

Morsecode: wie Text zu Punkten und Strichen wird

Das Prinzip der Kodierung von Buchstaben als Punkte und Striche, und wo Morsecode heute noch genutzt wird.

Data URI: wann Bilder direkt in den Code einbetten

Wie ein Data-URI den Inhalt einer Datei direkt in HTML oder CSS einbettet, und wann sich das lohnt.

Gzip + Base64: Daten komprimieren für die Übertragung als Text

Warum komprimierte Binärdaten zusätzlich Base64-kodiert werden, bevor sie in ein Textfeld kommen.

XML Entities: Zeichen in XML-Dokumenten escapen

Die fünf Pflicht-Entities von XML, ohne die das Dokument beim Parsen bricht.