Кодування

Unicode Escape

Кодування та декодування Unicode-послідовностей — символи у вигляді \uXXXX і назад.

Часті запитання

Що таке послідовність \uXXXX?

Це запис символу через його код у Unicode у шістнадцятковій формі — рівно 4 цифри після \u. Такий формат використовують у JavaScript-рядках, JSON та багатьох мовах програмування для представлення символів, які незручно чи неможливо вставити напряму.

Чому емодзі кодуються двома \uXXXX-послідовностями?

Формат \uXXXX вміщує лише 4 шістнадцяткові цифри, тобто символи з базової багатомовної площини (BMP). Символи поза нею — багато емодзі, рідкісні ієрогліфи — представляють через сурогатну пару: дві послідовності \uXXXX, які разом кодують один символ.

Чим "Не-ASCII" відрізняється від "Усіх символів" у режимі Encode?

Режим "Не-ASCII" залишає латиницю, цифри й базову пунктуацію без змін і екранує лише символи поза ASCII. Режим "Усі символи" перетворює на \uXXXX геть усі символи, включно з латинськими літерами.