Текст
Word/Character Frequency Counter
Частотний аналіз тексту: скільки разів трапляється кожне слово чи символ, відсортовано за кількістю.
Інструмент рахує, скільки разів кожне слово чи символ трапляється в тексті, і сортує результат за кількістю входжень — те, що вручну порахувати в довгому тексті практично неможливо.
Як користуватися
- Оберіть, що аналізувати — слова чи окремі символи.
- Вставте текст — таблиця частот з’являється одразу, відсортована від найчастіших до найрідших.
- Зручно для миттєвого визначення найпоширенішого слова чи символу у великому масиві тексту.
Типові сценарії
- Пошук ключових слів у тексті статті чи документа для базового SEO-аналізу без спеціалізованих інструментів.
- Навчальний приклад частотного аналізу при вивченні основ криптографії чи обробки природної мови.
- Перевірка тексту на надмірне повторення певних слів перед публікацією.
Що варто памʼятати
Частотний аналіз чутливий до регістру за замовчуванням у багатьох реалізаціях — «Слово» і «слово» можуть рахуватися як різні входження, якщо текст не приведений до одного регістру заздалегідь.
Класичні шифри підстановки (ROT13, шифр Цезаря) не змінюють розподіл частот літер, лише переставляють відповідність — тому частотний аналіз є класичним методом їх злому без перебору ключів.
Стаття про цей інструмент: Частотний аналіз тексту: навіщо рахувати повторення слів
Часті запитання
Чим відрізняються режими "Слова" та "Символи"?
Режим "Слова" рахує, скільки разів кожне слово з'являється в тексті, тоді як режим "Символи" рахує входження кожного окремого символу, включно з пунктуацією.
Що роблять опції "Без урахування регістру" і "Ігнорувати пробіли"?
"Без урахування регістру" об'єднує входження, що відрізняються лише регістром, а "Ігнорувати пробіли" виключає пробіли з підрахунку в режимі символів; результати потім сортуються за спаданням кількості входжень.
Чи надсилається аналізований текст на сервер?
Ні, аналіз частоти повністю виконується у вашому браузері на JavaScript — нічого не передається онлайн.
Що таке закон Ципфа?
У природних мовах частота слова обернено пропорційна його рангу за частотою: найчастіше слово трапляється приблизно вдвічі частіше за друге, утричі частіше за третє тощо. Суттєве відхилення від цієї закономірності — сигнал, що текст може бути штучно згенерованим чи спамним за ключовими словами.
Чи можна використати частотний аналіз для злому простого шифру?
Так, для класичних шифрів підстановки (як ROT13 чи шифр Цезаря), які не змінюють розподіл частот літер, а лише переставляють відповідність. Порівнявши частотний розподіл зашифрованого тексту з відомим розподілом мови оригіналу, можна відновити відповідність символів без перебору всіх ключів.