Текст

Word/Character Frequency Counter

Частотний аналіз тексту: скільки разів трапляється кожне слово чи символ, відсортовано за кількістю.


                        
                    

Інструмент рахує, скільки разів кожне слово чи символ трапляється в тексті, і сортує результат за кількістю входжень — те, що вручну порахувати в довгому тексті практично неможливо.

Як користуватися

Типові сценарії

Що варто памʼятати

Частотний аналіз чутливий до регістру за замовчуванням у багатьох реалізаціях — «Слово» і «слово» можуть рахуватися як різні входження, якщо текст не приведений до одного регістру заздалегідь.

Класичні шифри підстановки (ROT13, шифр Цезаря) не змінюють розподіл частот літер, лише переставляють відповідність — тому частотний аналіз є класичним методом їх злому без перебору ключів.

Стаття про цей інструмент: Частотний аналіз тексту: навіщо рахувати повторення слів

Часті запитання

Чим відрізняються режими "Слова" та "Символи"?

Режим "Слова" рахує, скільки разів кожне слово з'являється в тексті, тоді як режим "Символи" рахує входження кожного окремого символу, включно з пунктуацією.

Що роблять опції "Без урахування регістру" і "Ігнорувати пробіли"?

"Без урахування регістру" об'єднує входження, що відрізняються лише регістром, а "Ігнорувати пробіли" виключає пробіли з підрахунку в режимі символів; результати потім сортуються за спаданням кількості входжень.

Чи надсилається аналізований текст на сервер?

Ні, аналіз частоти повністю виконується у вашому браузері на JavaScript — нічого не передається онлайн.

Що таке закон Ципфа?

У природних мовах частота слова обернено пропорційна його рангу за частотою: найчастіше слово трапляється приблизно вдвічі частіше за друге, утричі частіше за третє тощо. Суттєве відхилення від цієї закономірності — сигнал, що текст може бути штучно згенерованим чи спамним за ключовими словами.

Чи можна використати частотний аналіз для злому простого шифру?

Так, для класичних шифрів підстановки (як ROT13 чи шифр Цезаря), які не змінюють розподіл частот літер, а лише переставляють відповідність. Порівнявши частотний розподіл зашифрованого тексту з відомим розподілом мови оригіналу, можна відновити відповідність символів без перебору всіх ключів.

Статті: Текст

Case Converter: навіщо потрібні різні стилі написання

Чому в одному проєкті змінні пишуть camelCase, а файли — kebab-case, і звідки взялись ці правила.

Text Diff: як алгоритми знаходять різницю між текстами

Як diff-алгоритм знаходить мінімальний набір змін між двома версіями тексту.

Регулярні вирази: основний синтаксис і типові патерни

Як читати регулярний вираз і чим жадібний пошук відрізняється від лінивого.

Сортування та видалення дублікатів рядків: навіщо це потрібно

Чому числове сортування «10» перед «9» — це помилка, і як цього уникнути.

String Escape: чому той самий текст треба екранувати по-різному

Чому той самий символ лапок екранується по-різному в JS-рядку, JSON і shell-команді.

CRLF проти LF: чому символи кінця рядка досі мають значення

Чому файл, написаний у Windows, може показувати «змінений увесь файл» у git на Linux.

Підрахунок символів і слів: чому це не завжди тривіально

Чому емодзі чи символи з діакритикою можуть рахуватись як кілька символів одразу.

Lorem Ipsum: звідки взявся текст-заповнювач і навіщо він потрібен

Чому дизайнери навмисно використовують «безглуздий» текст замість реального контенту в макетах.

Slugify: як перетворити довільний текст на URL-адресу

Як заголовок «Привіт, Світ!» перетворюється на URL-сумісний рядок вигляду pryvit-svit.

Markdown: чому простий текстовий синтаксис переміг складні редактори

Чому розробники обирають писати документацію в Markdown, а не в форматованому текстовому редакторі.

Пробіли та невидимі символи: прихована причина дивних багів

Чому два на вигляд однакові рядки можуть не збігатися при порівнянні через невидимий символ.

Text Reverse: чому «перевернути текст» складніше, ніж здається

Чому наївний реверс рядка може перетворити емодзі на непридатні для показу байти.