Kodierung
Unicode Escape
Kodierung und Dekodierung von Unicode-Sequenzen — Zeichen im Format \uXXXX und zurück.
A Unicode escape sequence (\uXXXX) writes a character as its code point instead of the character itself — so a string literal in code can contain any Unicode character while the source file itself stays plain ASCII.
How to use it
- Encode: paste text and every non-ASCII character gets replaced with its matching \uXXXX sequence.
- Decode: paste a string containing \uXXXX sequences to get plain, readable text back.
- Characters outside the Basic Multilingual Plane (most emoji) are encoded as a surrogate pair of two sequences.
Common uses
- Reading JSON or JS code where non-ASCII text was pre-escaped into \uXXXX for compatibility.
- Inserting a character that's not on the keyboard into code via an explicit Unicode escape.
- Debugging why a string with an emoji shows up as two odd characters — recognizing a surrogate pair.
Things to keep in mind
\uXXXX encodes exactly one 16-bit UTF-16 unit, not one visible character — characters outside the Basic Multilingual Plane (most emoji) need two such sequences together (a surrogate pair).
JSON only requires escaping for control characters and a few special characters — escaping every character as \uXXXX isn't required, though it is valid.
Artikel zu diesem Tool: Unicode Escape: was \uXXXX-Sequenzen bedeuten
Häufig gestellte Fragen
Was bedeutet das Format \uXXXX?
Es ist eine Escape-Sequenz, die einen Unicode-Codepunkt als vier hexadezimale Ziffern darstellt, etwa \u00e4 für ä. Sie wird in JavaScript, JSON und vielen anderen Sprachen verwendet, um Zeichen darzustellen, die nicht direkt im Quelltext getippt werden können.
Warum werden manche Zeichen wie Emojis als zwei \uXXXX-Sequenzen kodiert?
Zeichen außerhalb der Basic Multilingual Plane, etwa die meisten Emojis, passen nicht in einen einzelnen 16-Bit-Codepunkt und werden deshalb als Surrogatpaar aus zwei \uXXXX-Sequenzen dargestellt.
Wird der eingegebene Text irgendwohin übertragen?
Nein, die Kodierung und Dekodierung geschieht vollständig im Browser, ohne dass Daten an einen Server gesendet werden.
Was passiert, wenn ein Surrogatpaar mittendurch getrennt wird?
Es entsteht eine ungültige „verwaiste" Zeichen-Einheit – ein einzelner Code ohne seinen Partner. Die meisten Parser lehnen einen solchen String entweder mit einer Fehlermeldung ab oder zeigen das Ersatzzeichen „�" an.
Lässt sich ein Emoji mit einem einzigen \uXXXX kodieren?
Nein, sofern das Emoji außerhalb der Basic Multilingual Plane liegt (was auf die meisten modernen Emojis zutrifft) – dafür ist immer ein Surrogatpaar aus zwei \uXXXX-Sequenzen nötig.