Descore

Как работает энтропия Шеннона: баланс между переспамом и пустотой

Энтропия Шеннона (в отчётах и таблицах Descore — SE или shannon_entropy) — это объективная метрика разнообразия и естественности авторского словаря. Она помогает найти баланс между переспамом и водянистой пустотой, оценить реальную глубину раскрытия темы и сопоставить посадочную страницу с эталоном лидеров выдачи. Проверить распределение слов и значение энтропии для своего текста можно в онлайн-инструменте SEO-анализ текста.

Интуиция: почему без интриги нет информации

Представьте, что вы открыли детектив, а на первой же странице автор буднично сообщает: «Убийца — дворецкий».

Всё. Интриги больше нет. Вы уже знаете развязку, тайна испарилась, и читать оставшиеся триста страниц нет никакого смысла — они не несут ровным счётом никакой новой информации. Каждая следующая глава предсказуема, вам скучно.

А теперь представьте обратный сценарий: сыщик триста страниц расследует кражу фамильных драгоценностей, опрашивает свидетелей, сопоставляет улики, а в финале выясняется, что виноват летающий утюг из параллельной вселенной, о котором в книге не было ни намёка. Неожиданно? Несомненно. Но это не гениальный сюжетный поворот, а бессмысленный хаос, ломающий всю логику повествования.

Американский математик и инженер Клод Шеннон ещё в 1948 году сформулировал фундаментальный принцип теории информации: информация ценна только тогда, когда в ней есть неожиданность.

  • Если результат известен заранее — информации ноль.
  • Если в сообщении сплошной случайный шум — пользы тоже ноль.
  • Настоящая польза лежит посередине: в последовательном, связном и живом раскрытии темы.

В прикладной статье, в отличие от художественного детектива, дать краткую выжимку или прямой ответ прямо в первом абзаце — это стандартная и правильная практика. Но дальше вступает правило Шеннона: развивает ли автор тему вглубь, добавляя в каждый следующий раздел новые детали, условия, параметры и сценарии — или он высказал одну мысль на три строки, а остальные две тысячи слов просто наматывает круги, перефразируя её одними и теми же словами?

Что такое энтропия Шеннона простыми словами

В теории информации энтропия Шеннона используется как мера неопределённости и информационной насыщенности. Применительно к тексту она отвечает на один практический вопрос: «Насколько разнообразно и сбалансировано автор использует словарный запас, чтобы передать смысл?»

  • Энтропия равна нулю (H = 0): если весь текст состоит из повторения одного-единственного слова: «Окна окна окна окна». Здесь нет выбора, нет интриги, вероятность слова равна 100%. Информационная ёмкость такого текста нулевая.
  • Энтропия максимальна (H = Hmax): если каждое слово в документе уникально и встречается строго по одному разу, как в орфографическом словаре.
  • Естественный живой текст: находится в комфортном коридоре — опорные термины темы повторяются умеренно, а мысль развивается через детали, характеристики, примеры и смежную лексику.

Математика формулы Шеннона

Классическая формула Клода Шеннона определяет среднее количество информации, приходящееся на каждое слово документа:

H(X)=−∑i=1np(wi)log⁡2p(wi)H(X) = - \sum_{i=1}^{n} p(w_i) \log_2 p(w_i)
  • wᵢ — уникальное слово (лемма) в тексте.
  • p(wᵢ) — вероятность встретить слово (частота слова, делённая на общее количество слов в документе).
  • log₂(p(wᵢ)) — двоичный логарифм вероятности: мера «неожиданности» слова в битах. Чем реже слово встречается в анализируемом документе, тем выше его индивидуальный информационный вес.
  • -∑ — сумма со знаком минус: объединяет вклад всех слов документа и рассчитывает среднее количество бит информации на одно слово.

Суть математики: редкие содержательные термины имеют высокий индивидуальный вес, но встречаются нечасто; частые связующие слова появляются постоянно, но несут мало неожиданности. Формула Шеннона находит баланс, объективно измеряя общее богатство словарного распределения. Теоретический максимум ограничен величиной Hmax = log₂(V), где V — количество уникальных слов. Масштаб текста задаёт естественный физический потолок метрики, поэтому сопоставлять документ корректно только с конкурентами аналогичного типа из реальной выдачи.

Как энтропию рассчитывает Descore

Внутри Descore расчёт энтропии выполняется напрямую по тексту документа:

  • 1. Извлечение и лемматизация body-текста: анализируется основной текстовый контент страницы за вычетом служебной HTML-разметки. Слова приводятся к нормальной форме (начальной словарной лемме), чтобы словоформы с разными окончаниями («окна», «окнами», «окно») считались одним и тем же термином. Расчёт ведётся по полному лемматизированному потоку слов.
  • 2. Подсчёт вероятностей p(w): вычисляется частота каждого уникального слова и его доля от общего количества слов в документе.
  • 3. Расчёт H(X): по формуле Шеннона вычисляется точная сумма энтропии документа и округляется до сотых.
  • 4. Сопоставление с ТОП-10: полученное значение сравнивается с актуальным срезом конкурентов из выдачи по вашему кластеру, показывая коридор нормы и медиану ниши.

Примеры из практики: почему в разных тематиках свои диапазоны

Значения энтропии не берутся из абстрактных формул. В Descore система рассчитывает индивидуальный SERP-слепок под каждый конкретный кластер ваших запросов, оценивая реальных конкурентов в выдаче.

Ниже приведены реальные замеры по трём разным кластерам в Descore — исключительно для наглядной иллюстрации того, как специфика тематики и тип страниц естественным образом формируют свой коридор значений:

Тематика и кластер (пример)Тип страниц в ТОПеФактический срез ТОПаПочему в примере сложился такой диапазон

ТЭНы для водонагревателей

Коммерция / Запчасти

5.87 – 8.06

медиана 7.53

Много повторяющихся параметров: ватты, вольты, диаметр резьбы, медь, нержавейка, бренды Thermex и Ariston. Каталогу запчастей не нужна беллетристика — покупателю нужны точные артикулы и совместимость.

Напольная акустика

Сложная техника

6.76 – 8.49

медиана 7.64

Смешанная выдача: краткие витрины интернет-магазинов дают значения ближе к 6.7 – 7.2, а экспертные обзоры аудиофилов (звуковая сцена, фазоинверторы, басы, сценарии прогрева) доходят до 8.3 – 8.49.

Женская тематика / Гороскопы

Информационный лонгрид

7.83 – 9.46

медиана 8.69

Текст — основной продукт: конкуренты с шаблонными выжимками дают около 7.8 – 8.2. Подробный материал с разбором сфер жизни (карьера, финансы, отношения, здоровье), декад и советов естественно поднимается до 9.46.

Эти числа — не догма и не застывший стандарт: в модуле SEO-анализ SERP Descore рассчитывает индивидуальный коридор нормы под каждый кластер через робастный Z-score (Robust Z-Score), отсекая случайные аномалии выдачи. Примеры выше лишь показывают логику: то, что в каталоге запчастей считается нормой (5.87–8.06 с медианой 7.53), для глубокой информационной статьи окажется поверхностным текстом, и наоборот.

Что означает отклонение от медианы ТОПа

В отчётах Descore вы регулярно будете видеть сопоставление вашей страницы с медианой выдачи: например, медиана ТОПа = 8.69, а у вашей посадочной страницы — 9.46 или 7.26.

Медиана ТОП-10 — это статистический центр распределения текущей поисковой выдачи по конкретному кластеру запросов. В SEO нет универсального правила, что энтропия всегда должна быть выше медианы. Отклонение в любую сторону — это не автоматическая победа и не автоматическая ошибка, а сигнал, который нужно оценивать через тип страницы и интент:

  • Энтропия заметно ниже нормы ТОПа: словарь страницы зациклен. Автор навязчиво крутит одни и те же прямые ключи в каждом абзаце, не раскрывает свойства и технические параметры, заменяя фактуру общими штампами. Для поисковых систем это прямой маркер текстового переспама и низкой информационной ценности.
  • Энтропия заметно выше нормы ТОПа на коммерческих страницах (листинги, каталоги): это чаще минус, а не преимущество. Покупателю запчастей, станков или бытовой техники нужны точные артикулы, бренды, совместимость, параметры и цены — там терминология естественно повторяется. Аномально высокая энтропия на коммерческой странице обычно означает размытие коммерческого интента — например, попытку внедрить длинную околотематическую «SEO-портянку» текста на страницу каталога. Поисковые алгоритмы ждут каталожные сущности и фильтры, а посторонний словарный шум лишь снижает релевантность.
  • Энтропия выше нормы ТОПа в информационных лонгридах и обзорах: это оправдано только тогда, когда богатый словарь обеспечен реальной глубиной раскрытия темы (разбором подтем, конкретных сценариев, условий и нюансов). Если же автор просто добавил водянистых рассуждений, исторических экскурсов или смешал в одной статье несвязанные темы, высокий показатель станет симптомом смыслового расфокуса.
Градация текстаПример фрагментаЧто происходит со словарём

1. Прямой переспам

(зацикленный ключ)

«Купить пластиковые окна в Москве с установкой. Наши пластиковые окна в Москве — это лучшие пластиковые окна от производителя. Заказывайте окна пластиковые недорого с гарантией.»

Словарь заблокирован: пара ключевых слов забирает 50% объёма. Энтропия падает на минимум. Прямой риск фильтра за текстовый спам.

2. «Вода» и штампы

(низкая энтропия)

«Наша компания предлагает клиентам решения для бизнеса. Мы заботимся о клиентах, потому что наша компания — надежная компания, предлагающая лучшие решения и безупречное качество для каждого клиента.»

Зацикленные штампы: прямого переспама целевым ключом нет, но автор навязчиво крутит по кругу ограниченный набор дежурных слов («компания», «клиент», «решение»). Ноль параметров, ноль сущностей. Скудный повторяющийся словарь и слабая энтропия.

3. Норма ТОПа

(сбалансированный текст)

«Устанавливаем двухкамерные стеклопакеты Rehau с профилем 70 мм и немецкой фурнитурой Roto. В стоимость входит демонтаж старой рамы, подоконник из ПВХ, отлив и тёплые откосы из сэндвич-панелей.»

Естественный баланс: опорный термин раскрыт через параметры: марки, толщину профиля, материалы и этапы монтажа. Словарь богат, интент закрыт точно.

4. Аномальная энтропия

(расфокус / «бред»)

«Сквозь призму веков архитектурная мысль человечества стремилась к обузданию сквозняков, начиная от слюдяных оконниц Древней Руси до полимерных молекулярных цепочек в современном мегаполисе...»

Искусственная вариативность: почти каждое слово уникальное и редкое. Формально энтропия максимальна, но прикладной интент страницы полностью уничтожен.

Задача оптимизации — не накручивать абстрактное число, а попасть в естественный коридор своей тематики и максимально точно закрыть поисковый интент читателя.

Как работать с показателем: практические советы

Если показатель страницы заметно ниже нормы ТОПа (текст «зажат»):

  • Сократите прямые повторы ключевика: уберите навязчивое вкручивание главного ключа в каждое предложение. Замените его местоимениями или контекстными связками.
  • Добавьте предметную конкретику: разберите реальные свойства, технические параметры, варианты применения, сценарии или частые ошибки вместо пустых фраз вроде «высокое качество по доступным ценам».
  • Пишите предметным языком: используйте точные существительные и глаголы темы вместо общих оценочных слов.

Если показатель аномально высок:

  • Для коммерческих страниц: проверьте, не перегружен ли листинг или товарная страница искусственными SEO-текстами. Уберите длинные околотематические описания — сфокусируйтесь на характеристиках, ценах и удобстве выбора.
  • Для информационных статей: проверьте чистоту интента. Убедитесь, что разнообразие словаря вызвано детальным разбором темы, а не водянистым оффтопом и уходом в посторонние рассуждения.
  • Держите фокус на ключевых сущностях темы: базовые термины должны оставаться чёткими и узнаваемыми, а не растворяться в потоке разрозненных слов.

Чек-лист перед публикацией материала

  • Развивается ли тема по ходу текста? Даже если в первом абзаце дана краткая суть или ответ, приносит ли каждый следующий раздел новые детали, практические сценарии и нюансы, а не просто перефразирует вводную мысль?
  • Не провалилась ли энтропия ниже нормы ТОПа? Если да — проверьте текст на тавтологию и переспам ключами.
  • Если энтропия сильно отклоняется от медианы ТОПа: для коммерческой страницы — не размыт ли интент лишними текстами в ущерб каталожной структуре; для информационной статьи — не вызвано ли завышение оффтопом и водой?
  • Равномерно ли распределены детали и термины по странице? Присутствует ли конкретика в списках, таблицах и подзаголовках по всему документу, а не только в одном блоке?

Главное о показателе

Энтропия Шеннона (SE) в Descore — это объективный индикатор распределения и естественности авторского словаря страницы в сравнении с конкурентами по конкретному кластеру.

Универсального идеального числа не существует: для каждого кластера ориентиром служит реальная выдача. Текст должен держаться в естественном коридоре своей ниши, не скатываясь ни в серый заспамленный повтор, ни в водянистый оффтоп.

Вопросы и ответы

Можно ли оптимизировать только энтропию в отрыве от остальных показателей текста?

Нет. Энтропия Шеннона показывает общее богатство и разнообразие словаря, но она не заменяет смысловую релевантность. Высокая энтропия полезна только тогда, когда текст плотно держит интент запроса и раскрывает тему по существу, а не уходит в посторонние рассуждения.

Почему в коротком тексте энтропия обычно ниже, чем в длинной статье?

Теоретический максимум энтропии напрямую зависит от количества уникальных слов в словаре документа. В короткой заметке на 150 слов физически не может быть тысячи уникальных лемм. Именно поэтому Descore сравнивает посадочную страницу не с абстрактным числом, а с конкурентами аналогичного типа из реальной выдачи.

Что делать, если в моей нише у всех конкурентов в топе низкая энтропия?

В узких коммерческих каталогах (например, запчасти или радиодетали) низкая энтропия в топе естественна: страницы насыщены повторяющимися артикулами, вольтами и параметрами. Не нужно пытаться искусственно «надуть» там показатель добавлением длинных околотематических статей — это лишь размоет коммерческий интент. Если же это информационная выдача, где в топе висят поверхностные тексты, аккуратная проработка деталей и условий даст естественный прирост качества без потери фокуса.

Связанные руководства