Как работает энтропия Шеннона: баланс между переспамом и пустотой
Энтропия Шеннона (в отчётах и таблицах Descore — SE или shannon_entropy) — это объективная метрика разнообразия и естественности авторского словаря. Она помогает найти баланс между переспамом и водянистой пустотой, оценить реальную глубину раскрытия темы и сопоставить посадочную страницу с эталоном лидеров выдачи. Проверить распределение слов и значение энтропии для своего текста можно в онлайн-инструменте SEO-анализ текста.
Интуиция: почему без интриги нет информации
Представьте, что вы открыли детектив, а на первой же странице автор буднично сообщает: «Убийца — дворецкий».
Всё. Интриги больше нет. Вы уже знаете развязку, тайна испарилась, и читать оставшиеся триста страниц нет никакого смысла — они не несут ровным счётом никакой новой информации. Каждая следующая глава предсказуема, вам скучно.
А теперь представьте обратный сценарий: сыщик триста страниц расследует кражу фамильных драгоценностей, опрашивает свидетелей, сопоставляет улики, а в финале выясняется, что виноват летающий утюг из параллельной вселенной, о котором в книге не было ни намёка. Неожиданно? Несомненно. Но это не гениальный сюжетный поворот, а бессмысленный хаос, ломающий всю логику повествования.
Американский математик и инженер Клод Шеннон ещё в 1948 году сформулировал фундаментальный принцип теории информации: информация ценна только тогда, когда в ней есть неожиданность.
- Если результат известен заранее — информации ноль.
- Если в сообщении сплошной случайный шум — пользы тоже ноль.
- Настоящая польза лежит посередине: в последовательном, связном и живом раскрытии темы.
В прикладной статье, в отличие от художественного детектива, дать краткую выжимку или прямой ответ прямо в первом абзаце — это стандартная и правильная практика. Но дальше вступает правило Шеннона: развивает ли автор тему вглубь, добавляя в каждый следующий раздел новые детали, условия, параметры и сценарии — или он высказал одну мысль на три строки, а остальные две тысячи слов просто наматывает круги, перефразируя её одними и теми же словами?
Что такое энтропия Шеннона простыми словами
В теории информации энтропия Шеннона используется как мера неопределённости и информационной насыщенности. Применительно к тексту она отвечает на один практический вопрос: «Насколько разнообразно и сбалансировано автор использует словарный запас, чтобы передать смысл?»
- Энтропия равна нулю (H = 0): если весь текст состоит из повторения одного-единственного слова:
«Окна окна окна окна». Здесь нет выбора, нет интриги, вероятность слова равна 100%. Информационная ёмкость такого текста нулевая. - Энтропия максимальна (H = Hmax): если каждое слово в документе уникально и встречается строго по одному разу, как в орфографическом словаре.
- Естественный живой текст: находится в комфортном коридоре — опорные термины темы повторяются умеренно, а мысль развивается через детали, характеристики, примеры и смежную лексику.
Математика формулы Шеннона
Классическая формула Клода Шеннона определяет среднее количество информации, приходящееся на каждое слово документа:
- wᵢ — уникальное слово (лемма) в тексте.
- p(wᵢ) — вероятность встретить слово (частота слова, делённая на общее количество слов в документе).
- log₂(p(wᵢ)) — двоичный логарифм вероятности: мера «неожиданности» слова в битах. Чем реже слово встречается в анализируемом документе, тем выше его индивидуальный информационный вес.
- -∑ — сумма со знаком минус: объединяет вклад всех слов документа и рассчитывает среднее количество бит информации на одно слово.
Суть математики: редкие содержательные термины имеют высокий индивидуальный вес, но встречаются нечасто; частые связующие слова появляются постоянно, но несут мало неожиданности. Формула Шеннона находит баланс, объективно измеряя общее богатство словарного распределения. Теоретический максимум ограничен величиной Hmax = log₂(V), где V — количество уникальных слов. Масштаб текста задаёт естественный физический потолок метрики, поэтому сопоставлять документ корректно только с конкурентами аналогичного типа из реальной выдачи.
Как энтропию рассчитывает Descore
Внутри Descore расчёт энтропии выполняется напрямую по тексту документа:
- 1. Извлечение и лемматизация body-текста: анализируется основной текстовый контент страницы за вычетом служебной HTML-разметки. Слова приводятся к нормальной форме (начальной словарной лемме), чтобы словоформы с разными окончаниями («окна», «окнами», «окно») считались одним и тем же термином. Расчёт ведётся по полному лемматизированному потоку слов.
- 2. Подсчёт вероятностей p(w): вычисляется частота каждого уникального слова и его доля от общего количества слов в документе.
- 3. Расчёт H(X): по формуле Шеннона вычисляется точная сумма энтропии документа и округляется до сотых.
- 4. Сопоставление с ТОП-10: полученное значение сравнивается с актуальным срезом конкурентов из выдачи по вашему кластеру, показывая коридор нормы и медиану ниши.
Примеры из практики: почему в разных тематиках свои диапазоны
Значения энтропии не берутся из абстрактных формул. В Descore система рассчитывает индивидуальный SERP-слепок под каждый конкретный кластер ваших запросов, оценивая реальных конкурентов в выдаче.
Ниже приведены реальные замеры по трём разным кластерам в Descore — исключительно для наглядной иллюстрации того, как специфика тематики и тип страниц естественным образом формируют свой коридор значений:
| Тематика и кластер (пример) | Тип страниц в ТОПе | Фактический срез ТОПа | Почему в примере сложился такой диапазон |
|---|---|---|---|
ТЭНы для водонагревателей | Коммерция / Запчасти | 5.87 – 8.06 медиана 7.53 | Много повторяющихся параметров: ватты, вольты, диаметр резьбы, медь, нержавейка, бренды Thermex и Ariston. Каталогу запчастей не нужна беллетристика — покупателю нужны точные артикулы и совместимость. |
Напольная акустика | Сложная техника | 6.76 – 8.49 медиана 7.64 | Смешанная выдача: краткие витрины интернет-магазинов дают значения ближе к 6.7 – 7.2, а экспертные обзоры аудиофилов (звуковая сцена, фазоинверторы, басы, сценарии прогрева) доходят до 8.3 – 8.49. |
Женская тематика / Гороскопы | Информационный лонгрид | 7.83 – 9.46 медиана 8.69 | Текст — основной продукт: конкуренты с шаблонными выжимками дают около 7.8 – 8.2. Подробный материал с разбором сфер жизни (карьера, финансы, отношения, здоровье), декад и советов естественно поднимается до 9.46. |
Эти числа — не догма и не застывший стандарт: в модуле SEO-анализ SERP Descore рассчитывает индивидуальный коридор нормы под каждый кластер через робастный Z-score (Robust Z-Score), отсекая случайные аномалии выдачи. Примеры выше лишь показывают логику: то, что в каталоге запчастей считается нормой (5.87–8.06 с медианой 7.53), для глубокой информационной статьи окажется поверхностным текстом, и наоборот.
Что означает отклонение от медианы ТОПа
В отчётах Descore вы регулярно будете видеть сопоставление вашей страницы с медианой выдачи: например, медиана ТОПа = 8.69, а у вашей посадочной страницы — 9.46 или 7.26.
Медиана ТОП-10 — это статистический центр распределения текущей поисковой выдачи по конкретному кластеру запросов. В SEO нет универсального правила, что энтропия всегда должна быть выше медианы. Отклонение в любую сторону — это не автоматическая победа и не автоматическая ошибка, а сигнал, который нужно оценивать через тип страницы и интент:
- Энтропия заметно ниже нормы ТОПа: словарь страницы зациклен. Автор навязчиво крутит одни и те же прямые ключи в каждом абзаце, не раскрывает свойства и технические параметры, заменяя фактуру общими штампами. Для поисковых систем это прямой маркер текстового переспама и низкой информационной ценности.
- Энтропия заметно выше нормы ТОПа на коммерческих страницах (листинги, каталоги): это чаще минус, а не преимущество. Покупателю запчастей, станков или бытовой техники нужны точные артикулы, бренды, совместимость, параметры и цены — там терминология естественно повторяется. Аномально высокая энтропия на коммерческой странице обычно означает размытие коммерческого интента — например, попытку внедрить длинную околотематическую «SEO-портянку» текста на страницу каталога. Поисковые алгоритмы ждут каталожные сущности и фильтры, а посторонний словарный шум лишь снижает релевантность.
- Энтропия выше нормы ТОПа в информационных лонгридах и обзорах: это оправдано только тогда, когда богатый словарь обеспечен реальной глубиной раскрытия темы (разбором подтем, конкретных сценариев, условий и нюансов). Если же автор просто добавил водянистых рассуждений, исторических экскурсов или смешал в одной статье несвязанные темы, высокий показатель станет симптомом смыслового расфокуса.
| Градация текста | Пример фрагмента | Что происходит со словарём |
|---|---|---|
1. Прямой переспам (зацикленный ключ) | «Купить пластиковые окна в Москве с установкой. Наши пластиковые окна в Москве — это лучшие пластиковые окна от производителя. Заказывайте окна пластиковые недорого с гарантией.» | Словарь заблокирован: пара ключевых слов забирает 50% объёма. Энтропия падает на минимум. Прямой риск фильтра за текстовый спам. |
2. «Вода» и штампы (низкая энтропия) | «Наша компания предлагает клиентам решения для бизнеса. Мы заботимся о клиентах, потому что наша компания — надежная компания, предлагающая лучшие решения и безупречное качество для каждого клиента.» | Зацикленные штампы: прямого переспама целевым ключом нет, но автор навязчиво крутит по кругу ограниченный набор дежурных слов («компания», «клиент», «решение»). Ноль параметров, ноль сущностей. Скудный повторяющийся словарь и слабая энтропия. |
3. Норма ТОПа (сбалансированный текст) | «Устанавливаем двухкамерные стеклопакеты Rehau с профилем 70 мм и немецкой фурнитурой Roto. В стоимость входит демонтаж старой рамы, подоконник из ПВХ, отлив и тёплые откосы из сэндвич-панелей.» | Естественный баланс: опорный термин раскрыт через параметры: марки, толщину профиля, материалы и этапы монтажа. Словарь богат, интент закрыт точно. |
4. Аномальная энтропия (расфокус / «бред») | «Сквозь призму веков архитектурная мысль человечества стремилась к обузданию сквозняков, начиная от слюдяных оконниц Древней Руси до полимерных молекулярных цепочек в современном мегаполисе...» | Искусственная вариативность: почти каждое слово уникальное и редкое. Формально энтропия максимальна, но прикладной интент страницы полностью уничтожен. |
Задача оптимизации — не накручивать абстрактное число, а попасть в естественный коридор своей тематики и максимально точно закрыть поисковый интент читателя.
Как работать с показателем: практические советы
Если показатель страницы заметно ниже нормы ТОПа (текст «зажат»):
- Сократите прямые повторы ключевика: уберите навязчивое вкручивание главного ключа в каждое предложение. Замените его местоимениями или контекстными связками.
- Добавьте предметную конкретику: разберите реальные свойства, технические параметры, варианты применения, сценарии или частые ошибки вместо пустых фраз вроде «высокое качество по доступным ценам».
- Пишите предметным языком: используйте точные существительные и глаголы темы вместо общих оценочных слов.
Если показатель аномально высок:
- Для коммерческих страниц: проверьте, не перегружен ли листинг или товарная страница искусственными SEO-текстами. Уберите длинные околотематические описания — сфокусируйтесь на характеристиках, ценах и удобстве выбора.
- Для информационных статей: проверьте чистоту интента. Убедитесь, что разнообразие словаря вызвано детальным разбором темы, а не водянистым оффтопом и уходом в посторонние рассуждения.
- Держите фокус на ключевых сущностях темы: базовые термины должны оставаться чёткими и узнаваемыми, а не растворяться в потоке разрозненных слов.
Чек-лист перед публикацией материала
- Развивается ли тема по ходу текста? Даже если в первом абзаце дана краткая суть или ответ, приносит ли каждый следующий раздел новые детали, практические сценарии и нюансы, а не просто перефразирует вводную мысль?
- Не провалилась ли энтропия ниже нормы ТОПа? Если да — проверьте текст на тавтологию и переспам ключами.
- Если энтропия сильно отклоняется от медианы ТОПа: для коммерческой страницы — не размыт ли интент лишними текстами в ущерб каталожной структуре; для информационной статьи — не вызвано ли завышение оффтопом и водой?
- Равномерно ли распределены детали и термины по странице? Присутствует ли конкретика в списках, таблицах и подзаголовках по всему документу, а не только в одном блоке?
Главное о показателе
Энтропия Шеннона (SE) в Descore — это объективный индикатор распределения и естественности авторского словаря страницы в сравнении с конкурентами по конкретному кластеру.
Универсального идеального числа не существует: для каждого кластера ориентиром служит реальная выдача. Текст должен держаться в естественном коридоре своей ниши, не скатываясь ни в серый заспамленный повтор, ни в водянистый оффтоп.
Вопросы и ответы
Можно ли оптимизировать только энтропию в отрыве от остальных показателей текста?
Нет. Энтропия Шеннона показывает общее богатство и разнообразие словаря, но она не заменяет смысловую релевантность. Высокая энтропия полезна только тогда, когда текст плотно держит интент запроса и раскрывает тему по существу, а не уходит в посторонние рассуждения.
Почему в коротком тексте энтропия обычно ниже, чем в длинной статье?
Теоретический максимум энтропии напрямую зависит от количества уникальных слов в словаре документа. В короткой заметке на 150 слов физически не может быть тысячи уникальных лемм. Именно поэтому Descore сравнивает посадочную страницу не с абстрактным числом, а с конкурентами аналогичного типа из реальной выдачи.
Что делать, если в моей нише у всех конкурентов в топе низкая энтропия?
В узких коммерческих каталогах (например, запчасти или радиодетали) низкая энтропия в топе естественна: страницы насыщены повторяющимися артикулами, вольтами и параметрами. Не нужно пытаться искусственно «надуть» там показатель добавлением длинных околотематических статей — это лишь размоет коммерческий интент. Если же это информационная выдача, где в топе висят поверхностные тексты, аккуратная проработка деталей и условий даст естественный прирост качества без потери фокуса.
Связанные руководства
- Справочник 49 SEO-метрик анализа — подробные формулы расчёта, веса, Z-отклонения, закон Ципфа, MATTR, тошнота и зоны документа.
- Кластеризация — формирование SERP-слепков топа, сила группировки и генерация структуры групп.
- Руководство пользователя Descore — оглавление инструкций, разбор интерфейса и сценарии работы.