एन्कोडिंग

Unicode Escape

Unicode सीक्वेंस एन्कोडिंग और डिकोडिंग — कैरेक्टर्स को \uXXXX फ़ॉर्मेट में और वापस।

A Unicode escape sequence (\uXXXX) writes a character as its code point instead of the character itself — so a string literal in code can contain any Unicode character while the source file itself stays plain ASCII.

How to use it

Common uses

Things to keep in mind

\uXXXX encodes exactly one 16-bit UTF-16 unit, not one visible character — characters outside the Basic Multilingual Plane (most emoji) need two such sequences together (a surrogate pair).

JSON only requires escaping for control characters and a few special characters — escaping every character as \uXXXX isn't required, though it is valid.

इस टूल के बारे में लेख: Unicode Escape: \uXXXX अनुक्रमों का क्या मतलब है

अक्सर पूछे जाने वाले प्रश्न

\uXXXX फ़ॉर्मेट का मतलब क्या है?

यह किसी कैरेक्टर के यूनिकोड कोड पॉइंट को 4 हेक्साडेसिमल अंकों में दिखाता है, जैसे \u00e9 अक्षर é के लिए — यह JavaScript, JSON और कई और भाषाओं में इस्तेमाल होने वाला स्टैंडर्ड एस्केप फ़ॉर्मेट है।

इमोजी जैसे कैरेक्टर्स एन्कोड करने पर दो \u कोड क्यों दिखते हैं?

BMP से बाहर के कैरेक्टर्स (जैसे ज़्यादातर इमोजी) को एक \uXXXX से नहीं दिखाया जा सकता, इसलिए इन्हें UTF-16 सरोगेट पेयर के तौर पर दो जुड़े हुए \uXXXX कोड्स में एन्कोड किया जाता है।

क्या मेरा टेक्स्ट कहीं सर्वर पर भेजा जाता है?

नहीं, यह टूल पूरी तरह ब्राउज़र में काम करता है, कोई डेटा अपलोड नहीं होता।

सरोगेट पेयर को बीच में तोड़ दिया जाए तो क्या होगा?

नतीजा एक अमान्य "अनाथ" कैरेक्टर होगा — बिना जोड़ी वाला अकेला कोड। ज़्यादातर पार्सर या तो ऐसी स्ट्रिंग को एरर देकर अस्वीकार कर देंगे, या रिप्लेसमेंट कैरेक्टर "�" दिखाएँगे।

क्या इमोजी कैरेक्टर को एक ही \uXXXX से एन्कोड किया जा सकता है?

नहीं, अगर इमोजी बेसिक मल्टीलिंगुअल प्लेन से बाहर है (और आज के ज़्यादातर इमोजी ऐसे ही हैं) — इसके लिए हमेशा दो \uXXXX सीक्वेंस वाली सरोगेट पेयर चाहिए होती है।

लेख: एन्कोडिंग

Base64: एन्कोडिंग किस लिए है और यह कैसे काम करता है

Base64 बाइनरी डेटा को ASCII टेक्स्ट में कैसे बदलता है और यह वास्तव में कब ज़रूरी होता है।

Base32: यह Base64 से कैसे अलग है और कब ज़्यादा सुविधाजनक है

Base32 की केस-असंवेदनशील वर्णमाला और वे मामले जहाँ यह Base64 से ज़्यादा सुविधाजनक है।

URL Encode/Decode: लिंक में percent-encoding

पतों और पैरामीटर में विशेष वर्ण %XX अनुक्रमों में कैसे बदलते हैं।

HTML Entities: विशेष वर्णों को सुरक्षित रूप से कैसे दिखाएँ

< > & वर्णों को एस्केप करना क्यों ज़रूरी है और यह मार्कअप को टूटने से कैसे बचाता है।

JWT: टोकन की संरचना और JWT को "डिकोड" करने का क्या मतलब है

JWT के header, payload और signature, और डिकोड करना सिग्नेचर सत्यापन जैसा क्यों नहीं है।

ROT13 और सीज़र सिफर: वर्णों की सरल अदला-बदली

13 अक्षरों का शिफ्ट ROT13 को स्व-व्युत्क्रम क्यों बनाता है, और आज इसे क्यों इस्तेमाल किया जाता है।

Punycode: DNS में अंतरराष्ट्रीय डोमेन कैसे काम करते हैं

गैर-लैटिन वर्णों वाला डोमेन xn-- उपसर्ग वाले ASCII रूप में कैसे बदलता है।

मोर्स कोड: टेक्स्ट बिंदुओं और डैश में कैसे बदलता है

अक्षरों को बिंदुओं और डैश में एन्कोड करने का सिद्धांत, और आज मोर्स कोड कहाँ इस्तेमाल होता है।

Data URI: छवियों को सीधे कोड में कब एम्बेड करें

Data URI किसी फ़ाइल की सामग्री को सीधे HTML या CSS में कैसे एम्बेड करता है, और यह कब उचित है।

Gzip + Base64: डेटा को टेक्स्ट के रूप में भेजने के लिए संपीड़न

संपीड़ित बाइनरी डेटा को टेक्स्ट फ़ील्ड में डालने से पहले Base64 में क्यों एन्कोड किया जाता है।

XML Entities: XML दस्तावेज़ों में वर्णों को एस्केप करना

पाँच अनिवार्य XML एंटिटी, जिनके बिना दस्तावेज़ पार्सिंग के दौरान टूट जाता है।