Mã hóa
Unicode Escape
Mã hóa và giải mã chuỗi Unicode — ký tự dưới dạng \uXXXX và ngược lại.
A Unicode escape sequence (\uXXXX) writes a character as its code point instead of the character itself — so a string literal in code can contain any Unicode character while the source file itself stays plain ASCII.
How to use it
- Encode: paste text and every non-ASCII character gets replaced with its matching \uXXXX sequence.
- Decode: paste a string containing \uXXXX sequences to get plain, readable text back.
- Characters outside the Basic Multilingual Plane (most emoji) are encoded as a surrogate pair of two sequences.
Common uses
- Reading JSON or JS code where non-ASCII text was pre-escaped into \uXXXX for compatibility.
- Inserting a character that's not on the keyboard into code via an explicit Unicode escape.
- Debugging why a string with an emoji shows up as two odd characters — recognizing a surrogate pair.
Things to keep in mind
\uXXXX encodes exactly one 16-bit UTF-16 unit, not one visible character — characters outside the Basic Multilingual Plane (most emoji) need two such sequences together (a surrogate pair).
JSON only requires escaping for control characters and a few special characters — escaping every character as \uXXXX isn't required, though it is valid.
Bài viết về công cụ này: Unicode Escape: chuỗi \uXXXX nghĩa là gì
Câu hỏi thường gặp
Chuỗi thoát \uXXXX đại diện cho điều gì?
Đó là một điểm mã Unicode viết dưới dạng bốn chữ số thập lục phân, dùng trong JSON, chuỗi JavaScript và các định dạng tương tự để biểu diễn một ký tự mà không cần gõ trực tiếp.
Vì sao một số ký tự như emoji lại biến thành hai chuỗi \u?
Các ký tự ngoài Mặt phẳng Đa ngôn ngữ Cơ bản (ký tự astral, gồm hầu hết emoji) không vừa trong một đơn vị \uXXXX 16-bit, nên được biểu diễn dưới dạng cặp thay thế — hai chuỗi \uXXXX cùng nhau mã hóa một ký tự.
Sự khác biệt giữa chế độ "Ngoài ASCII" và "Tất cả ký tự" là gì?
"Ngoài ASCII" chỉ thoát các ký tự ngoài phạm vi ASCII cơ bản, giữ nguyên chữ cái, chữ số và dấu câu thông thường. "Tất cả ký tự" thoát mọi thứ, kể cả ASCII, hữu ích để xem chính xác nội dung ký tự.
Điều gì xảy ra nếu một cặp thay thế bị tách đôi?
Kết quả là một ký tự "mồ côi" không hợp lệ — một mã đơn độc không có cặp đi kèm. Hầu hết trình phân tích sẽ từ chối chuỗi đó kèm lỗi, hoặc hiển thị ký tự thay thế "�".
Có thể mã hóa một ký tự emoji chỉ bằng một \uXXXX không?
Không, nếu emoji đó nằm ngoài Mặt phẳng Đa ngôn ngữ Cơ bản (và phần lớn emoji hiện đại đều như vậy) — nó luôn cần một cặp thay thế gồm hai chuỗi \uXXXX.