معظم الحروف العربية تقع ضمن المستوى الأساسي متعدد اللغات في يونيكود (النطاق U+0600–U+06FF)، لذا يتحول كل حرف عربي عادةً إلى كود هروب واحد فقط مثل \u0645، دون الحاجة إلى زوج بديل كما يحدث مع أغلب الرموز التعبيرية.
علامات التشكيل: نقاط رمز منفصلة عن الحرف
علامات التشكيل العربية — الفتحة والضمة والكسرة والسكون وغيرها — ليست جزءًا من الحرف الذي تعلوه، بل نقاط رمز يونيكود مستقلة تمامًا توضع بعد الحرف. هذا يعني أن كلمة مشكَّلة بالكامل تولّد عدد أكواد هروب أكبر بكثير من عدد الحروف الظاهرة للعين، لأن كل علامة تشكيل تُهرَب بشكل منفصل عن الحرف الذي تصاحبه.
JSON وتسلسلات الهروب
تسمح مواصفات JSON بالهروب من أي حرف في سلسلة نصية كـ \uXXXX. يحدث هذا كثيرًا عندما تُولَّد البيانات برمجيًا ويتجنب المُسلسِل عمدًا الأحرف خارج ASCII للتوافق — فكلمة عربية بسيطة مثل "مرحبا" قد تظهر في JSON كسلسلة من عدة أكواد هروب متتالية.
متى نحتاج ذلك
- قراءة النص المختبئ خلف تسلسلات الهروب في استجابة JSON من واجهة برمجة تطبيقات بلغة واضحة.
- إعداد سلسلة نصية لبيئة لا تقبل الأحرف خارج ASCII.
- تشخيص مشاكل الترميز عند التعامل مع بيانات خارجية، خصوصًا عند فقدان علامات تشكيل أثناء المعالجة.
الأحرف خارج المستوى الأساسي (الرموز التعبيرية)
هناك استثناء نادر: بعض الرموز الرياضية العربية المتخصصة تقع في مستوى تكميلي (بدءًا من U+1EE00) وتحتاج، مثل الرموز التعبيرية، إلى زوج بديل عند التمثيل في جافاسكريبت — لكن هذا لا يحدث تقريبًا مع النص العربي العادي، الذي يبقى ضمن المستوى الأساسي بأكواد هروب مفردة.