Текст
Character & Word Counter
Статистика тексту в реальному часі: символи (з пробілами й без), слова, рядки, речення, абзаци та розмір у байтах (UTF-8).
Інструмент рахує символи, слова, рядки, речення й абзаци тексту в реальному часі, поки ви друкуєте чи вставляєте текст, а також показує розмір у байтах при кодуванні UTF-8.
Що саме рахується
- Символи з пробілами й без — окремо, щоб бачити обидва варіанти під ліміти на кшталт meta description чи твітів.
- Слова — за пробілами й розділовими знаками між ними.
- Речення й абзаци — за розділовими знаками (. ! ?) і порожніми рядками відповідно.
- Розмір у байтах UTF-8 — корисно, коли ліміт вимірюється саме в байтах, а не символах (кирилиця й емодзі займають більше одного байта).
Типові сценарії
- Перевірка довжини meta description чи title перед публікацією, щоб уміститися в ліміт пошукової видачі.
- Контроль обсягу тексту для завдання з лімітом символів (есе, підпис, опис товару).
- Швидка статистика тексту без відкриття текстового редактора з панеллю підрахунку слів.
Що варто памʼятати
Один візуально «символ» (наприклад, емодзі з модифікатором тону шкіри чи прапор країни) в Unicode може складатися з кількох кодових точок і рахуватися по-різному залежно від методу підрахунку.
Ліміти соцмереж і форм інколи рахують не символи, а байти чи «графемні кластери» — за потреби звіряйте з байтовим лічильником у цьому інструменті.
Стаття про цей інструмент: Підрахунок символів і слів: чому це не завжди тривіально
Часті запитання
Які саме статистичні дані обчислюються?
Інструмент рахує символи з пробілами й без, слова, рядки, речення, абзаци та розмір тексту в байтах у кодуванні UTF-8.
Чому кількість байтів відрізняється від кількості символів?
У UTF-8 простий латинський символ займає один байт, але кириличний символ, літера з діакритикою чи емодзі можуть займати від двох до чотирьох байтів, тож текст із багатьма багатобайтовими символами матиме кількість байтів помітно більшу за кількість символів.
Чи надсилається мій текст на сервер для аналізу?
Ні, усі обчислення відбуваються в реальному часі у вашому браузері на JavaScript, нічого не передається онлайн.
Чому підрахунок слів неточний для мов без пробілів?
У китайській, японській чи тайській мовах слова традиційно не розділяються пробілами — межу визначає граматика й контекст. Підрахунок за пробілами для таких мов дає або одне «слово» на весь текст, або втрачає сенс — потрібен окремий алгоритм сегментації.
Чому один емодзі іноді рахується як кілька символів?
Емодзі з модифікатором тону шкіри чи прапори країн у Unicode складаються з кількох кодових точок, об’єднаних в один видимий графемний кластер. Наївний підрахунок за кодовими точками може порахувати такий візуально єдиний символ як два, три чи більше.