Частотный анализ текста: уникальные слова с числом повторений и долей, стоп-слова, минимальная длина слова, сортировка по частоте, алфавиту или длине, топ-N и выгрузка в CSV. Всё считается в браузере.
Слова по отдельности или строки целиком
По длине — от длинных значений к коротким
1 — не отсекать ничего
Пусто — все строки. В CSV уходит вся таблица, ограничение на неё не действует
Вставьте текст в поле выше — таблица частот заполнится сама.
Частотный анализ отвечает на простой вопрос: что именно повторяется в тексте. При чтении глаз пропускает повторы — автор видит смысл, а не количество, — и в статье легко получить одно и то же слово в каждом абзаце. Таблица частот показывает это числом: сколько раз встретилось слово и какую долю от всех слов оно занимает. По ней правят переспам в тексте для сайта, находят повторяющиеся мысли в черновике, смотрят, на что чаще жалуются в отзывах, и проверяют, какие слова ещё не встречались в учебном материале.
Верх таблицы предсказуем: предлоги, союзы, местоимения и частицы. Их убирает флажок «Пропускать стоп-слова» со встроенным списком, а свои слова — название компании, бренд, служебную метку — можно дописать рядом. Короткие слова отсекает минимальная длина, а сортировка переключает таблицу на нужный разрез: по частоте видно главное, по алфавиту — соседние формы одного слова, по длине — самые длинные слова текста. Сколько строк показывать, задаётся отдельно: длинную таблицу удобнее читать по частям, а выгрузка в CSV всегда содержит её целиком.
Режим «Строки целиком» переключает инструмент на списки: он считает повторы строк, а не слов, — это то, что нужно для выгрузок городов, доменов или артикулов. Текст не отправляется на сервер и не сохраняется: подсчёт, сортировка и выгрузка идут в браузере.
Это подсчёт, сколько раз каждое слово встретилось в тексте. Таблица сразу показывает, о чём текст и что в нём повторяется: в статье для сайта видно перебор с одним и тем же словом и нехватку синонимов, в отзывах — на что жалуются чаще всего, в учебном тексте — какие слова ещё не запомнились. Для SEO это способ проверить переспам и понять, каких слов не хватает по сравнению с конкурентами, а для редактуры — найти повторы, которые при чтении пропускает глаз. Слова и их повторы здесь считаются, но не оцениваются: инструмент не делит слова на «нужные» и «лишние», это решение автора.
Словом считается последовательность букв и цифр; дефис и апостроф допустимы внутри, поэтому «интернет-магазин» и «Ivan's» остаются одним словом, а не двумя. Точки, запятые, слэши и кавычки слово разделяют. Стоп-лист — это предлоги, союзы, местоимения и частицы: «и», «в», «не», «это». Они занимают верх любой таблицы частот и закрывают собой содержательные слова, поэтому флажок «Пропускать стоп-слова» включён по умолчанию. Свои слова дописываются в поле «Свои стоп-слова» через запятую или с новой строки: так убирают название компании или бренд, который встречается в каждом абзаце.
Регистр по умолчанию не учитывается: «Слово» и «слово» — одна строка таблицы, а стоит в ней та форма, которая встретилась в тексте первой. Если регистр важен, например при подсчёте аббревиатур, включите флажок «Учитывать регистр» — тогда «ИТ» и «ит» станут разными строками. Формы слова не объединяются: «заказ», «заказа» и «заказы» — три отдельные строки, лемматизации здесь нет. Чтобы свести формы, отсортируйте таблицу по алфавиту: однокоренные слова встанут рядом, и их можно посчитать вместе.
Доля считается от всех учтённых слов и округляется в каждой строке до двух знаков, поэтому 33,33 + 33,33 + 33,33 даёт 99,99. Кроме того, в знаменатель не попадают слова, отсечённые стоп-листом и минимальной длиной, а на экране по умолчанию видны только первые N строк: сумма долей видимых строк тем меньше 100, чем больше строк скрыто ограничением. В CSV уходит таблица целиком, поэтому по файлу сумму можно проверить — она сойдётся с точностью до округления.
В этом режиме текст не разбирается на слова: строки сравниваются как есть, у каждой отбрасываются пробелы по краям, пустые строки пропускаются, а повторы считаются по одинаковым строкам. Флажок «Учитывать регистр» работает и здесь, а минимальная длина относится уже к длине строки, а не слова. Стоп-слова к строкам не применяются — это список слов, и в режиме строк флажок отключён. Режим нужен для списков: городов, доменов, артикулов, ответов из формы — там важно не разобрать строку на части, а посчитать, сколько раз она повторяется.
Да, размер текста не ограничен: проход по тексту один, а всё считается в браузере, поэтому на несколько сотен тысяч знаков уходят доли секунды. Предел только у отзывчивости интерфейса — пересчёт идёт на каждый ввод, и на тексте в несколько мегабайт набор в поле может подтормаживать. Такой текст лучше вставить целиком и дальше менять только настройки: они пересчитывают ту же таблицу уже без правки текста. Ничего не отправляется на сервер и не сохраняется, поэтому размер выгрузки ничем не ограничен.
Цифры входят в слово наравне с буквами, поэтому «2024» или «55» попадут в таблицу. Знаки внутри числа — точка, косая черта, знак номера — делят его на части: «05.05.2024» даст три отдельные строки. Отдельного флажка «не считать числа» здесь нет: в текстах про цены, товары и статистику числа обычно и есть то, что нужно посчитать, а отсеять их можно минимальной длиной (например, длина 5 уберёт «55» и «2024») или своими стоп-словами.