كلمة "استخدام" قد تُكتب بألف بسيطة ا أو بألف مهموزة أ في بداية بعض الكلمات، وكلاهما شائع في الاستخدام الفعلي رغم اختلاف قواعد الإملاء الرسمية. من منظور إزالة التكرار، هاتان الكلمتان مختلفتان تمامًا — رمزان يونيكود مختلفان — رغم أن القارئ العربي يراهما الكلمة نفسها تمامًا.
الفرز الأبجدي مقابل العددي
يقارن الفرز الأبجدي (المعجمي) السلاسل حرفًا بحرف، كأنها نص. لهذا السبب، تنتهي السلسلة "10" قبل "9"، لأن الحرف "1" أصغر معجميًا من "9" — الفرز "لا يفهم" أن هذا رقم. الفرز العددي، بالمقابل، يحلّل السلسلة كرقم قبل المقارنة، فينتج الترتيب المتوقع 9، 10، 11.
لا وجود لحالة الأحرف في العربية
على عكس اللاتينية أو السيريلية، لا تملك الأبجدية العربية تمييزًا بين حرف كبير وحرف صغير أصلًا، لذا خيار "غير حساس لحالة الأحرف" لا يغيّر شيئًا في نص عربي خالص. لكنه يصبح مهمًا فورًا في الملفات ثنائية اللغة التي تخلط أسطرًا عربية بأخرى لاتينية، حيث يؤثر الخيار على الجزء اللاتيني فقط.
إزالة التكرار
إزالة التكرار تحذف الأسطر المتكررة بمقارنتها حرفًا بحرف، لا بمعناها. الفارق الدقيق المهم هو الحساسية لحالة الأحرف والمسافات، وفي النصوص العربية تحديدًا اختلافات الهمزة: سطران متطابقان بصريًا تقريبًا قد يظلّان منفصلين في النتيجة إذا اختلفا في رمز واحد فقط لحرف الألف.
لماذا نحتاج هذا
- حذف الإدخالات المتكررة من قائمة عناوين بريد إلكتروني أو روابط قبل الاستيراد.
- فرز قائمة إصدارات أو معرّفات عدديًا لا كنص.
- مقارنة مجموعتي بيانات بسرعة عبر تحويل كلتا القائمتين إلى نفس الشكل المرتّب.
الفرز الطبيعي (natural sort)
الفرز الطبيعي حل وسط بين النهجين الأبجدي والعددي: يتعرف على سلاسل الأرقام داخل السطر كأرقام، بينما يقارن بقية الأحرف كنص. بفضل ذلك، تسبق file2.txt السطر file10.txt، رغم أنها شكليًا سلاسل نصية لا أرقام مستقلة — مفيد لأسماء الملفات أو الإصدارات ذات البادئة النصية.