Kodowanie
Unicode Escape
Kodowanie i dekodowanie sekwencji Unicode — znaki w formacie \uXXXX i z powrotem.
Najczęstsze pytania
Co oznacza format \uXXXX?
To zapis pojedynczego punktu kodowego Unicode jako czterech cyfr szesnastkowych, używany m.in. w JavaScript, JSON i Javie do reprezentowania znaków spoza podstawowego zestawu ASCII wewnątrz zwykłego łańcucha tekstowego.
Dlaczego emoji i inne znaki spoza BMP zajmują dwie sekwencje \uXXXX?
Znaki spoza Podstawowej Płaszczyzny Wielojęzycznej (BMP), takie jak większość emoji, mają punkty kodowe powyżej U+FFFF i nie mieszczą się w jednej 16-bitowej jednostce. W UTF-16 zapisuje się je jako parę surogatów — dwie sekwencje \uXXXX razem tworzące jeden znak.
Czym różnią się tryby Nie-ASCII i Wszystkie znaki?
Tryb Nie-ASCII zamienia na sekwencje \uXXXX tylko znaki spoza standardowego ASCII, zachowując litery, cyfry i podstawową interpunkcję w oryginalnej postaci. Tryb Wszystkie znaki koduje w ten sposób każdy znak wejścia, także zwykłe litery łacińskie.