Enkode

Unicode Escape

Encode dan decode urutan Unicode — karakter dalam format \uXXXX dan sebaliknya.

A Unicode escape sequence (\uXXXX) writes a character as its code point instead of the character itself — so a string literal in code can contain any Unicode character while the source file itself stays plain ASCII.

How to use it

Common uses

Things to keep in mind

\uXXXX encodes exactly one 16-bit UTF-16 unit, not one visible character — characters outside the Basic Multilingual Plane (most emoji) need two such sequences together (a surrogate pair).

JSON only requires escaping for control characters and a few special characters — escaping every character as \uXXXX isn't required, though it is valid.

Artikel tentang alat ini: Unicode Escape: arti urutan \uXXXX

Pertanyaan yang sering diajukan

Apa itu format escape \uXXXX?

Format \uXXXX menuliskan sebuah karakter lewat kode heksadesimal code point Unicode-nya, empat digit. Format ini umum dipakai di JSON, JavaScript, dan bahasa pemrograman lain saat karakter tidak bisa atau tidak nyaman ditulis langsung.

Kenapa emoji atau karakter tertentu di-encode jadi dua urutan \uXXXX?

Karakter di luar Basic Multilingual Plane (BMP), seperti sebagian besar emoji, tidak muat dalam satu unit \uXXXX 16-bit. Karakter ini direpresentasikan sebagai pasangan surrogate (surrogate pair), yaitu dua urutan \uXXXX yang harus dibaca bersama sebagai satu karakter.

Apa bedanya mode Non-ASCII dan Semua karakter?

Mode Non-ASCII hanya meng-escape karakter di luar rentang ASCII dasar, sehingga huruf dan simbol umum tetap terbaca apa adanya. Mode Semua karakter meng-escape setiap karakter, termasuk huruf ASCII biasa, menjadi bentuk \uXXXX.

Apa yang terjadi jika surrogate pair terpecah menjadi dua?

Hasilnya adalah karakter "yatim" yang tidak valid — sebuah kode sendirian tanpa pasangannya. Sebagian besar parser akan menolak string tersebut dengan error, atau menampilkan karakter pengganti "�".

Bisakah karakter emoji di-encode dengan satu \uXXXX saja?

Tidak, jika emoji tersebut berada di luar Basic Multilingual Plane (dan sebagian besar emoji modern memang demikian) — untuk itu selalu dibutuhkan surrogate pair dari dua urutan \uXXXX.

Artikel: Enkode

Base64: untuk apa enkode dan bagaimana cara kerjanya

Bagaimana Base64 mengubah data biner menjadi teks ASCII dan kapan ini benar-benar diperlukan.

Base32: bedanya dengan Base64 dan kapan lebih praktis

Alfabet Base32 yang tidak membedakan huruf besar/kecil, dan kasus di mana ia lebih praktis daripada Base64.

URL Encode/Decode: percent-encoding dalam tautan

Bagaimana karakter khusus dalam alamat dan parameter berubah menjadi urutan %XX.

HTML Entities: cara menampilkan karakter khusus dengan aman

Mengapa karakter < > & perlu di-escape dan bagaimana ini mencegah markup rusak.

JWT: struktur token dan arti "mendekode" JWT

Header, payload, dan signature dari JWT, serta mengapa mendekode bukan hal yang sama dengan memverifikasi tanda tangan.

ROT13 dan sandi Caesar: substitusi karakter sederhana

Mengapa pergeseran 13 huruf membuat ROT13 mengoreksi dirinya sendiri, dan mengapa masih digunakan sekarang.

Punycode: bagaimana domain internasional bekerja di DNS

Bagaimana domain dengan karakter non-Latin menjadi bentuk ASCII dengan awalan xn--.

Kode Morse: bagaimana teks berubah menjadi titik dan garis

Prinsip pengenkodean huruf menjadi titik dan garis, serta di mana kode Morse masih digunakan sekarang.

Data URI: kapan menyematkan gambar langsung ke dalam kode

Bagaimana Data URI menyematkan isi berkas langsung ke HTML atau CSS, dan kapan hal ini sepadan.

Gzip + Base64: mengompresi data untuk dikirim sebagai teks

Mengapa data biner terkompresi juga dienkode Base64 sebelum dimasukkan ke bidang teks.

XML Entities: meng-escape karakter dalam dokumen XML

Lima entity XML wajib, tanpanya dokumen rusak saat diuraikan.