Văn bản

Word/Character Frequency Counter

Phân tích tần suất văn bản: mỗi từ hoặc ký tự xuất hiện bao nhiêu lần, sắp xếp theo số lượng.


                        
                    

This tool counts how many times each word or character appears in a text and sorts the result by count — something that's practically impossible to tally by hand in a long piece of text.

How to use it

Common uses

Things to keep in mind

Frequency analysis is case-sensitive by default in many implementations — "Word" and "word" can count as different entries unless the text is normalized to one case first.

Classical substitution ciphers (ROT13, the Caesar cipher) don't change the frequency distribution of letters, only the mapping — which is exactly why frequency analysis is the classic way to break them without trying every key.

Bài viết về công cụ này: Phân tích tần suất văn bản: vì sao cần đếm số lần từ lặp lại

Câu hỏi thường gặp

Sự khác biệt giữa chế độ Từ và Ký tự là gì?

Chế độ Từ đếm số lần mỗi từ xuất hiện trong văn bản, trong khi chế độ Ký tự đếm số lần xuất hiện của từng ký tự riêng lẻ, bao gồm cả dấu câu.

Tùy chọn "Không phân biệt chữ hoa/thường" và "Bỏ qua khoảng trắng" làm gì?

"Không phân biệt chữ hoa/thường" gộp các lần xuất hiện chỉ khác nhau về chữ hoa/thường, và "Bỏ qua khoảng trắng" loại trừ khoảng trắng khỏi việc đếm trong chế độ ký tự; kết quả sau đó được sắp xếp theo số lần xuất hiện giảm dần.

Văn bản được phân tích có được gửi đến máy chủ không?

Không, phân tích tần suất chạy hoàn toàn trong trình duyệt của bạn bằng JavaScript — không có gì được truyền trực tuyến.

Định luật Zipf là gì?

Trong các ngôn ngữ tự nhiên, tần suất của một từ tỷ lệ nghịch với thứ hạng của nó theo tần suất: từ phổ biến nhất xuất hiện gần gấp đôi từ phổ biến thứ hai, gấp ba từ phổ biến thứ ba, v.v. Độ lệch đáng kể so với quy luật này là tín hiệu cho thấy văn bản có thể được tạo ra một cách nhân tạo hoặc bị nhồi nhét từ khóa.

Có thể dùng phân tích tần suất để phá một mật mã đơn giản không?

Có, đối với các mật mã thay thế cổ điển (như ROT13 hay mật mã Caesar) không thay đổi phân bố tần suất chữ cái, mà chỉ sắp xếp lại sự tương ứng. So sánh phân bố tần suất của văn bản mã hóa với phân bố đã biết của ngôn ngữ gốc cho phép khôi phục ánh xạ ký tự mà không cần thử mọi khóa.

Bài viết: Văn bản

Case Converter: vì sao có các kiểu đặt tên khác nhau

Vì sao trong một dự án, biến được viết camelCase nhưng tệp lại kebab-case, và những quy tắc này đến từ đâu.

Text Diff: thuật toán tìm sự khác biệt giữa hai văn bản như thế nào

Thuật toán diff tìm tập hợp thay đổi tối thiểu giữa hai phiên bản văn bản như thế nào.

Biểu thức chính quy: cú pháp cơ bản và các mẫu thường gặp

Cách đọc một biểu thức chính quy, và khớp tham lam khác khớp lười ra sao.

Sắp xếp và loại bỏ dòng trùng lặp: dùng để làm gì

Vì sao sắp xếp theo số đặt "10" trước "9" là một lỗi, và cách tránh điều đó.

String Escape: vì sao cùng một văn bản cần escape khác nhau

Vì sao cùng một dấu ngoặc kép lại được escape khác nhau trong chuỗi JS, JSON và lệnh shell.

CRLF so với LF: vì sao ký tự cuối dòng vẫn còn quan trọng

Vì sao một tệp được viết trên Windows có thể hiển thị là "toàn bộ đã thay đổi" trong git trên Linux.

Đếm ký tự và từ: vì sao không phải lúc nào cũng đơn giản

Vì sao một emoji hoặc chữ có dấu có thể được tính là nhiều ký tự cùng lúc.

Lorem Ipsum: văn bản giữ chỗ đến từ đâu và dùng để làm gì

Vì sao các nhà thiết kế cố tình dùng văn bản "vô nghĩa" thay vì nội dung thật trong bản phác thảo.

Slugify: cách biến bất kỳ văn bản nào thành URL

Một tiêu đề như "Xin chào, Thế giới! Bạn khỏe không?" biến thành chuỗi tương thích URL như xin-chao-the-gioi-ban-khoe-khong ra sao.

Markdown: vì sao cú pháp văn bản đơn giản đánh bại trình soạn thảo phức tạp

Vì sao lập trình viên chọn viết tài liệu bằng Markdown thay vì trình soạn thảo văn bản định dạng phong phú.

Khoảng trắng và ký tự vô hình: nguyên nhân ẩn giấu của các lỗi kỳ lạ

Vì sao hai chuỗi trông giống hệt nhau có thể không khớp do một ký tự vô hình.

Text Reverse: vì sao "đảo ngược văn bản" khó hơn tưởng tượng

Vì sao đảo ngược chuỗi ngây thơ có thể biến một emoji thành các byte không sử dụng được.