Đếm ký tự và từ nghe có vẻ đơn giản, nhưng tiếng Việt có một đặc điểm khiến việc đếm "từ" theo khoảng trắng gần như vô nghĩa: khoảng trắng ở đây phân tách âm tiết, không phải từ.
Khoảng trắng ngăn cách âm tiết, không phải từ
Không giống tiếng Anh, nơi mỗi từ thường là một cụm ký tự liền mạch giữa hai khoảng trắng, tiếng Việt viết mỗi âm tiết cách nhau bằng khoảng trắng ngay cả khi nhiều âm tiết ghép lại tạo thành một từ duy nhất. "Đất nước" là một từ (nghĩa là "quốc gia") gồm hai âm tiết cách nhau bằng khoảng trắng; một bộ đếm "từ" dựa trên khoảng trắng sẽ báo đây là hai từ, dù về mặt ngôn ngữ học đó là một từ ghép duy nhất.
Vì sao con số "số từ" cần được hiểu đúng
Vì lý do trên, con số mà công cụ đếm từ trả về cho văn bản tiếng Việt thực chất gần với "số âm tiết" hơn là "số từ" theo nghĩa ngôn ngữ học. Điều này không sai — đó vẫn là cách đo lường hữu ích và nhất quán — nhưng khi so sánh độ dài văn bản tiếng Việt với văn bản tiếng Anh cùng nội dung, con số "số từ" hai bên không phản ánh cùng một đơn vị đo.
Dấu thanh và số điểm mã Unicode
Một ký tự có dấu như "ế" có thể được mã hóa bằng một điểm mã duy nhất đã dựng sẵn, hoặc bằng nhiều điểm mã kết hợp riêng biệt (chữ cái gốc, dấu mũ, dấu sắc). Cùng một chữ hiển thị giống hệt nhau nhưng số điểm mã có thể khác nhau tùy vào cách văn bản gốc được mã hóa, điều này từng gây ra lỗi hiển thị phổ biến khi chuyển đổi giữa các bảng mã tiếng Việt cũ như VNI hay TCVN3 sang Unicode.
Vì sao cần đến điều này
- Kiểm tra văn bản theo giới hạn ký tự (một tweet, một tin nhắn SMS, một trường biểu mẫu).
- Ước tính thời gian đọc gần đúng của một bài viết từ số lượng âm tiết/từ.
- Hiểu vì sao số "từ" của văn bản tiếng Việt không thể so sánh trực tiếp với số từ của bản dịch tiếng Anh.
Đếm từ trong các ngôn ngữ không có khoảng trắng
Trong tiếng Trung, tiếng Nhật hay tiếng Thái, các từ hoàn toàn không được phân tách bằng khoảng trắng — ranh giới giữa các từ do ngữ pháp và ngữ cảnh quyết định. Đây là một bước còn xa hơn tiếng Việt: trong khi tiếng Việt ít nhất còn dùng khoảng trắng (dù là giữa âm tiết), các ngôn ngữ này không có bất kỳ dấu phân cách trực quan nào giữa các đơn vị nghĩa, nên đòi hỏi thuật toán phân đoạn văn bản chuyên biệt.