Kodowanie

Unicode Escape

Kodowanie i dekodowanie sekwencji Unicode — znaki w formacie \uXXXX i z powrotem.

Najczęstsze pytania

Co oznacza format \uXXXX?

To zapis pojedynczego punktu kodowego Unicode jako czterech cyfr szesnastkowych, używany m.in. w JavaScript, JSON i Javie do reprezentowania znaków spoza podstawowego zestawu ASCII wewnątrz zwykłego łańcucha tekstowego.

Dlaczego emoji i inne znaki spoza BMP zajmują dwie sekwencje \uXXXX?

Znaki spoza Podstawowej Płaszczyzny Wielojęzycznej (BMP), takie jak większość emoji, mają punkty kodowe powyżej U+FFFF i nie mieszczą się w jednej 16-bitowej jednostce. W UTF-16 zapisuje się je jako parę surogatów — dwie sekwencje \uXXXX razem tworzące jeden znak.

Czym różnią się tryby Nie-ASCII i Wszystkie znaki?

Tryb Nie-ASCII zamienia na sekwencje \uXXXX tylko znaki spoza standardowego ASCII, zachowując litery, cyfry i podstawową interpunkcję w oryginalnej postaci. Tryb Wszystkie znaki koduje w ten sposób każdy znak wejścia, także zwykłe litery łacińskie.