Chữ "ề" trong tiếng Việt có thể được lưu trữ theo hai cách hoàn toàn khác nhau trong Unicode: dạng dựng sẵn NFC (một điểm mã duy nhất cho "ề") hoặc dạng tổ hợp NFD ("e" cộng dấu huyền cộng dấu mũ, ba điểm mã riêng biệt). Hai chuỗi này hiển thị giống hệt nhau trên màn hình nhưng khác nhau ở cấp byte — nên hai dòng trông "giống hệt nhau" vẫn có thể không được nhận diện là trùng lặp nếu chúng được gõ hoặc lưu bằng hai chuẩn hóa khác nhau.
Sắp xếp theo bảng chữ cái so với theo số
Sắp xếp theo bảng chữ cái (từ điển) so sánh chuỗi từng ký tự như văn bản. Vì vậy chuỗi "10" cuối cùng đứng trước "9", vì ký tự "1" nhỏ hơn theo thứ tự từ điển so với "9" — việc sắp xếp không "hiểu" đây là số. Ngược lại, sắp xếp theo số phân tích chuỗi thành số trước khi so sánh, cho ra thứ tự mong đợi 9, 10, 11.
Phân biệt chữ hoa/thường khi sắp xếp
Trong hầu hết các hệ thống, chữ hoa đứng trước chữ thường theo thứ tự từ điển (do cách mã hóa ký tự), vì vậy "Zebra" có thể đứng trước "apple" trong sắp xếp phân biệt chữ hoa/thường. Sắp xếp không phân biệt chữ hoa/thường trước tiên chuẩn hóa các chuỗi về cùng kiểu chữ để so sánh, nhưng vẫn giữ nguyên kiểu chữ gốc trong kết quả.
Loại bỏ trùng lặp
Loại bỏ trùng lặp xóa các dòng lặp lại bằng cách so sánh từng ký tự, không theo nghĩa. Với văn bản tiếng Việt, vấn đề chuẩn hóa Unicode (NFC so với NFD) khiến hai dòng có dấu thanh giống hệt về mặt hiển thị vẫn có thể bị coi là hai dòng khác nhau, vì công cụ so sánh từng byte chứ không "nhìn" chữ như con người.
Vì sao cần đến điều này
- Loại bỏ các mục lặp lại khỏi danh sách địa chỉ email hoặc URL trước khi nhập.
- Sắp xếp danh sách phiên bản hoặc ID theo số thay vì theo văn bản.
- Nhanh chóng so sánh hai bộ dữ liệu bằng cách đưa cả hai danh sách về cùng dạng đã sắp xếp.
Sắp xếp tự nhiên (natural sort)
Sắp xếp tự nhiên là sự thỏa hiệp giữa cách tiếp cận theo bảng chữ cái và theo số: nó nhận diện các chuỗi chữ số bên trong một dòng như những con số, còn phần còn lại của ký tự vẫn so sánh như văn bản. Nhờ đó file2.txt sẽ đứng trước file10.txt, dù về mặt hình thức đây là chuỗi chứ không phải số độc lập — tiện lợi cho tên tệp hoặc phiên bản có tiền tố là văn bản.