Текст

Character & Word Counter

Статистика тексту в реальному часі: символи (з пробілами й без), слова, рядки, речення, абзаци та розмір у байтах (UTF-8).

0 Символів (з пробілами)
0 Символів (без пробілів)
0 Слів
0 Рядків
0 Речень
0 Абзаців
0 Байтів (UTF-8)

Інструмент рахує символи, слова, рядки, речення й абзаци тексту в реальному часі, поки ви друкуєте чи вставляєте текст, а також показує розмір у байтах при кодуванні UTF-8.

Що саме рахується

Типові сценарії

Що варто памʼятати

Один візуально «символ» (наприклад, емодзі з модифікатором тону шкіри чи прапор країни) в Unicode може складатися з кількох кодових точок і рахуватися по-різному залежно від методу підрахунку.

Ліміти соцмереж і форм інколи рахують не символи, а байти чи «графемні кластери» — за потреби звіряйте з байтовим лічильником у цьому інструменті.

Стаття про цей інструмент: Підрахунок символів і слів: чому це не завжди тривіально

Часті запитання

Які саме статистичні дані обчислюються?

Інструмент рахує символи з пробілами й без, слова, рядки, речення, абзаци та розмір тексту в байтах у кодуванні UTF-8.

Чому кількість байтів відрізняється від кількості символів?

У UTF-8 простий латинський символ займає один байт, але кириличний символ, літера з діакритикою чи емодзі можуть займати від двох до чотирьох байтів, тож текст із багатьма багатобайтовими символами матиме кількість байтів помітно більшу за кількість символів.

Чи надсилається мій текст на сервер для аналізу?

Ні, усі обчислення відбуваються в реальному часі у вашому браузері на JavaScript, нічого не передається онлайн.

Чому підрахунок слів неточний для мов без пробілів?

У китайській, японській чи тайській мовах слова традиційно не розділяються пробілами — межу визначає граматика й контекст. Підрахунок за пробілами для таких мов дає або одне «слово» на весь текст, або втрачає сенс — потрібен окремий алгоритм сегментації.

Чому один емодзі іноді рахується як кілька символів?

Емодзі з модифікатором тону шкіри чи прапори країн у Unicode складаються з кількох кодових точок, об’єднаних в один видимий графемний кластер. Наївний підрахунок за кодовими точками може порахувати такий візуально єдиний символ як два, три чи більше.

Статті: Текст

Case Converter: навіщо потрібні різні стилі написання

Чому в одному проєкті змінні пишуть camelCase, а файли — kebab-case, і звідки взялись ці правила.

Text Diff: як алгоритми знаходять різницю між текстами

Як diff-алгоритм знаходить мінімальний набір змін між двома версіями тексту.

Регулярні вирази: основний синтаксис і типові патерни

Як читати регулярний вираз і чим жадібний пошук відрізняється від лінивого.

Сортування та видалення дублікатів рядків: навіщо це потрібно

Чому числове сортування «10» перед «9» — це помилка, і як цього уникнути.

String Escape: чому той самий текст треба екранувати по-різному

Чому той самий символ лапок екранується по-різному в JS-рядку, JSON і shell-команді.

CRLF проти LF: чому символи кінця рядка досі мають значення

Чому файл, написаний у Windows, може показувати «змінений увесь файл» у git на Linux.

Lorem Ipsum: звідки взявся текст-заповнювач і навіщо він потрібен

Чому дизайнери навмисно використовують «безглуздий» текст замість реального контенту в макетах.

Slugify: як перетворити довільний текст на URL-адресу

Як заголовок «Привіт, Світ!» перетворюється на URL-сумісний рядок вигляду pryvit-svit.

Markdown: чому простий текстовий синтаксис переміг складні редактори

Чому розробники обирають писати документацію в Markdown, а не в форматованому текстовому редакторі.

Пробіли та невидимі символи: прихована причина дивних багів

Чому два на вигляд однакові рядки можуть не збігатися при порівнянні через невидимий символ.

Text Reverse: чому «перевернути текст» складніше, ніж здається

Чому наївний реверс рядка може перетворити емодзі на непридатні для показу байти.

Частотний аналіз тексту: навіщо рахувати повторення слів

Як частота літер у зашифрованому тексті допомагає зламати найпростіші шифри підстановки.