Kodlama
Unicode Escape
Unicode dizilerini kodlama ve çözme — karakterleri \uXXXX biçiminde ve tersi.
A Unicode escape sequence (\uXXXX) writes a character as its code point instead of the character itself — so a string literal in code can contain any Unicode character while the source file itself stays plain ASCII.
How to use it
- Encode: paste text and every non-ASCII character gets replaced with its matching \uXXXX sequence.
- Decode: paste a string containing \uXXXX sequences to get plain, readable text back.
- Characters outside the Basic Multilingual Plane (most emoji) are encoded as a surrogate pair of two sequences.
Common uses
- Reading JSON or JS code where non-ASCII text was pre-escaped into \uXXXX for compatibility.
- Inserting a character that's not on the keyboard into code via an explicit Unicode escape.
- Debugging why a string with an emoji shows up as two odd characters — recognizing a surrogate pair.
Things to keep in mind
\uXXXX encodes exactly one 16-bit UTF-16 unit, not one visible character — characters outside the Basic Multilingual Plane (most emoji) need two such sequences together (a surrogate pair).
JSON only requires escaping for control characters and a few special characters — escaping every character as \uXXXX isn't required, though it is valid.
Bu araç hakkında makale: Unicode Escape: \uXXXX dizileri ne anlama gelir
Sıkça sorulan sorular
Bir \uXXXX kaçış dizisi neyi temsil eder?
Dört onaltılık basamak olarak yazılan bir Unicode kod noktasıdır; JSON, JavaScript dizeleri ve benzer biçimlerde bir karakteri doğrudan yazmadan temsil etmek için kullanılır.
Emoji gibi bazı karakterler neden iki \u dizisine dönüşür?
Temel Çok Dilli Düzlem dışındaki karakterler (çoğu emoji dahil astral karakterler) tek bir 16 bit'lik \uXXXX birimine sığmaz, bu yüzden bir vekil çift olarak temsil edilirler — birlikte tek bir karakteri kodlayan iki \uXXXX dizisi.
"ASCII olmayan" ve "Tüm karakterler" modu arasındaki fark nedir?
"ASCII olmayan" yalnızca temel ASCII aralığı dışındaki karakterleri kaçırır, düz harfleri, rakamları ve noktalama işaretlerini dokunulmadan bırakır. "Tüm karakterler" ASCII dahil her şeyi kaçırır, bu da tam karakter içeriğini görmek için yararlı olabilir.
Bir vekil çift ikiye bölünürse ne olur?
Geçersiz bir "yetim" karakter ortaya çıkar — eşleşmeyen, yalnız kalan bir kod. Çoğu ayrıştırıcı böyle bir dizeyi ya hatayla reddeder ya da yerine "�" karakterini gösterir.
Bir emoji karakteri tek bir \uXXXX ile kodlanabilir mi?
Hayır, emoji temel çok dilli düzlemin dışındaysa (ve günümüz emojilerinin çoğu tam olarak böyledir) — bunun için her zaman iki \uXXXX dizisinden oluşan bir vekil çift gerekir.