Descore

N-граммы: устойчивые фразы топа и лендинга

Раздел «N-граммы» раскрывает фразовый профиль поисковой выдачи: показывает двухсловные (биграммы) и трёхсловные (триграммы) словосочетания, характерные для сайтов из топа, и сопоставляет их с текстом вашей посадочной страницы.

В отличие от анализа отдельных слов, N-граммы позволяют выявить реальные коллокации ниши — устойчивые конструкции, профессиональные термины и товарные формулировки, которые формируют контекстную релевантность документа.

Где находится блок N-грамм

В меню проекта откройте «Анализ», перейдите на вкладку «Общий анализ» и кликните по названию кластера. В детальном отчёте прокрутите страницу ниже Zipf-кривых до раздела «N-граммы».

Блок включает три взаимосвязанных представления: сводную агрегированную таблицу «Биграммы топа», параллельные таблицы биграмм и триграмм вашей посадочной страницы, а также разворачиваемый постраничный инспектор N-грамм по каждому документу конкурентов.

Как Descore извлекает N-граммы: пайплайн очистки и нормализации

Перед построением N-грамм текст проходит лингвистическую подготовку: изоляцию синтаксических блоков, лемматизацию, удаление стоп-слов и алфавитную нормализацию. Это исключает склейку фраз через границы предложений, устраняет шум предлогов и группирует перестановки слов в единые устойчивые коллокации ниши.

  • 1. Сегментация по предложениям и DOM-блокам — текст делится на изолированные синтаксические сегменты. При этом алгоритм защищает точки в адресах («ул.», «г.», «д.»), единицах измерений («руб.», «шт.») и инициалах от ложного разрезания. Границы предложений и независимых DOM-блоков изолированы: слова из соседних фрагментов не склеиваются в N-граммы.
  • 2. Токенизация и морфологическая лемматизация — слова приводятся к нижнему регистру и нормальной словарной форме (лемме) через морфологический анализатор. Например, формы «купил» и «купили» приводятся к лемме «купить», а сложные артикулы и марки оборудования (например, «rtx-4090» или «iphone-15») сохраняются без искажения дефисов.
  • 3. Удаление стоп-слов и контактное сближение — из цепочки токенов исключаются предлоги («в», «на», «для», «под», «со»), союзы («и», «а»), частицы и междометия. Благодаря этому зависимые термины сближаются в контактное окно: например, фраза «стойка под акустику в Москве» превращается в плотную цепочку лемм [стойка, акустика, москва].
  • 4. Скользящее окно размера N — внутри каждого очищенного предложения окно шириной в 2 слова (биграмма) или 3 слова (триграмма) движется с шагом в одно слово, формируя все возможные непрерывные фразовые связки.
  • 5. Каноническая алфавитная сортировка — слова внутри каждой полученной биграммы и триграммы сортируются по алфавиту (механика Unordered Bag-of-Words). Например, фразы «купить акустику» и «акустику купить» объединяются в общую биграмму «акустика купить», а триграммы приводятся к канонической связке (например,[вч-динамика, диаметр, мм]). Это объединяет частоту устойчивой фразы независимо от порядка слов в предложении.

Пошаговый пример обработки текста

Наглядный пример того, как заголовок или текстовый фрагмент коммерческой страницы преобразуется в канонические биграммы:

Этап конвейераСостояние данныхЧто делает алгоритм

Исходный текст

«Купить напольную стойку под акустику в Москве!»

Сырой текстовый фрагмент документа

1. Сегментация

["Купить напольную стойку под акустику в Москве!"]

Выделяет границы предложений; предотвращает склейку со следующим блоком

2. Лемматизация

[купить, напольный, стойка, под, акустика, в, москва]

Приводит каждое слово к словарной форме (лемме) в нижнем регистре

3. Очистка предлогов

[купить, напольный, стойка, акустика, москва]

Удаляет стоп-слова («под», «в»); смысловые термины сближаются в контактную цепочку

4. Скользящее окно (N=2)

(купить, напольный), (напольный, стойка), (стойка, акустика), (акустика, москва)

Формирует последовательные пары контактных лемм

5. Каноническая нормализация

купить напольный, напольный стойка, акустика стойка, акустика москва

Сортирует леммы внутри пары по алфавиту: пара «(стойка, акустика)» сохраняется как «акустика стойка»

Агрегированная таблица «Биграммы топа»

Основная таблица объединяет наиболее значимые двухсловные фразы, встречающиеся в сохранённой выдаче, и сравнивает плотность их употребления в топе с показателями вашей страницы.

Агрегированная таблица Биграммы топа и параллельные таблицы Лендинг — биграммы и Лендинг — триграммы
Таблица «Биграммы топа» с метриками охвата, медианы и SEO-важности, а ниже — профиль N-грамм посадочной страницы.
  • 1 Таблица «Биграммы топа» — ключевые двухсловные сочетания ниши, отсортированные по показателю SEO-важности. Поддерживается выбор отображения по 10, 20 или 40 строк и пагинация страниц. Колонки таблицы:
    • Биграммы топа — список двухсловных фраз, выявленных в текстах документов выдачи.
    • Сайтов — количество сайтов из анализируемого топа, на которых найдена биграмма (охват ниши). Чем выше охват, тем обязательнее фраза для включения в контент.
    • Медиана и Среднее — типичное и среднеарифметическое число употреблений биграммы на тех страницах выдачи, где она найдена.
    • У нас — фактическое количество вхождений данной биграммы на вашей посадочной странице (значение 0 указывает на контентный пробел).
    • SEO важность — интегральный показатель приоритета фразы, объединяющий медианную плотность и охват сайтов выдачи.
  • 2 Таблица «Лендинг — биграммы» — топ-10 двухсловных фраз посадочной страницы. Колонка «Процент» рассчитывается как доля всех слов документа, занятых этой связкой: (частота × 2) / total_words × 100%.
  • 3 Таблица «Лендинг — триграммы» — топ-10 трёхсловных фраз страницы с долей занятых слов в контенте: (частота × 3) / total_words × 100%.

Формула показателя «SEO важность»

Ранжирование фраз в таблице «Биграммы топа» строится не по простой суммарной частотности, которая поощряет искусственный переспам, а по сбалансированному показателю SEO-важности. Формула объединяет логарифмическую медианную плотность фразы и её охват среди сайтов выдачи:

SEO Score=K⋅ln⁡(1+Median)⋅(SitesTotal)γ\text{SEO Score} = K \cdot \ln(1 + \text{Median}) \cdot \left(\frac{\text{Sites}}{\text{Total}}\right)^\gamma

Если словосочетание встречается менее чем на 10% сайтов выдачи (охват ≤ 10%), оценка принудительно обнуляется, что исключает случайный лексический шум единичных страниц.

КомпонентЗначение в DescoreСмысл в SEO и влияние на ранжирование

K (score_scale)

24.0

Масштабирующий коэффициент для оценки в баллах. Итоговое значение может превышать 100.

ln(1 + Median)

math.log1p(median_freq)

Медианное число употреблений фразы среди сайтов, где она найдена. Логарифм задаёт убывающую отдачу: первые вхождения дают основной прирост скора, а накрутка частоты на одной странице не даёт аномального преимущества.

(Sites / Total)^γ

γ = 1.3 (coverage_gamma)

Охват ниши. Доля сайтов выдачи, использующих фразу, возводится в степень 1.3: благодаря этому широта охвата доминирует над голой частотой. Фраза, встретившаяся у 10 конкурентов по 2 раза, ранжируется выше фразы с одного сайта с 20 повторами.

Фильтр шума

coverage > 10%

Автоматическое отсечение редких и узкоспецифичных фраз, не отражающих консенсус поисковой выдачи.

Анализ фраз посадочной страницы

Две параллельные таблицы под основной сводкой фиксируют собственный профиль устойчивых словосочетаний вашей страницы. Они решают две ключевые задачи:

  • Обнаружение шаблонного мусора — если верхние строчки занимают сервисные конструкции интернет-магазина («корзина купить», «быстрый просмотр», повторы названий брендов), страница перегружена техническим текстом или содержит недостаточно полезного описательного контента.
  • Проверка целевых словосочетаний — анализ триграмм позволяет увидеть, в каких именно связках используются ключевые слова (например, «стойка под акустику», «комплект акустических стоек»), и выявить тавтологии или неестественные повторы.

Инспектор N-грамм документов топа

Ниже основных таблиц расположен сворачиваемый блок «🧩 N-граммы всех документов топа». Он позволяет детально исследовать текстовую структуру любого отдельного конкурента из выдачи.

Инспектор N-грамм всех документов топа: переключение страниц выдачи и таблицы биграмм и триграмм конкурента
Инспектор документов топа в раскрытом виде. Открыт документ на позиции #3 с персональными таблицами биграмм и триграмм.
  • 1 Спойлер «🧩 N-граммы всех документов топа» — клик по заголовку разворачивает панель инспектора.
  • 2 Пагинатор документов — кнопки переключения страниц (1 2 3 ... 10) листают конкурентов по одному сайту на страницу в порядке их позиций в выдаче (страница 1 — позиция #1 или лидер сохранённого топа, страница 2 — следующий документ).
  • 3 Таблица «Биграммы» — топ-10 двухсловных фраз выбранного конкурента с указанием их абсолютной частоты и процента на странице.
  • 4 Таблица «Триграммы» — топ-10 трёхсловных фраз выбранного сайта с их частотой и процентной долей в тексте документа.

Методика работы: gap-анализ и ТЗ

Использование блока N-грамм позволяет составить точечный план доработки текстового содержания страницы:

  • Шаг 1. Поиск упущенных фраз (Gap Analysis) — в таблице «Биграммы топа» отберите фразы с высоким показателем SEO-важности и охватом от 60–70% сайтов, у которых в столбце «У нас» стоит значение 0. Это наиболее приоритетные кандидаты для добавления в текст.
  • Шаг 2. Анализ медианного ориентира — для каждой упущенной биграммы ориентируйтесь на значение из колонки «Медиана». Не стоит многократно повторять фразу: достаточно включить её столько раз, сколько в среднем используют сайты топа (обычно 2–5 вхождений).
  • Шаг 3. Заимствование триграмм для структуры — изучите триграммы лидеров выдачи (например, первого документа на позиции #3) через инспектор документов. Трёхсловные конструкции отлично подходят для формулирования тематических подзаголовков H2/H3, названий таблиц характеристик и списков преимуществ.
  • Шаг 4. Контроль переспама — сопоставьте собственные биграммы с топом. Если у вас фраза встречается 15–20 раз, а медиана топа составляет всего 3–4, снизьте плотность повторов во избежание текстовых санкций за переоптимизацию.

Частые вопросы

Что такое N-граммы и чем они отличаются от отдельных ключевых слов?

N-грамма — это непрерывная цепочка из N слов в тексте документа: биграмма состоит из 2 слов («акустическая система», «купить стойку»), а триграмма — из 3 слов («стойка под акустику», «напольная акустическая система»). В Descore перед построением N-грамм текст очищается от предлогов и союзов, а слова приводятся к леммам и упорядочиваются по алфавиту: благодаря этому фразы объединяются в устойчивые коллокации (например, «акустика напольный», «корзина купить»), не распыляя статистику из-за перестановок слов или падежей. Поисковые алгоритмы оценивают не только вхождения отдельных слов, но и естественную фразовую связность контента.

Как рассчитывается показатель «SEO важность» в таблице биграмм?

Показатель рассчитывается по формуле насыщения и охвата: K · ln(1 + медиана) · (охват)^gamma. Охват сайтов ниши доминирует над голой частотой, а фразы с присутствием менее чем на 10% сайтов отсекаются как шум. Полная формула с интерактивным разбором параметров приведена в отдельном разделе выше.

Что делать, если в колонке «У нас» стоит 0 при высокой SEO-важности?

Это прямой признак контентного пробела (content gap). Если устойчивое словосочетание встречается у 7–9 из 10 лидеров выдачи, но полностью отсутствует на вашей странице, поисковая система может счесть документ недостаточно релевантным или неполным. Рекомендуется внедрить данную фразу в основной текст, подзаголовки H2/H3 или карточки товаров в количестве, близком к медиане топа.

Почему в таблицах лендинга встречаются фразы вроде «корзина купить» или «быстрый просмотр»?

Алгоритм анализирует весь текстовый контент страницы, включая сквозные интерфейсные блоки интернет-магазина (кнопки заказа, корзина, меню). Предлоги отсекаются стоп-листом, слова приводятся к леммам и сортируются внутри пары: например, «добавить в корзину» даёт биграмму «добавить корзина», а соседние леммы «купить» и «корзина» — «корзина купить». Если такие технические фразы занимают верхние строчки по проценту вхождения, это повод проверить соотношение полезного описательного текста и шаблонного интерфейсного мусора.

Можно ли скопировать N-граммы конкурентов для составления ТЗ копирайтеру?

Да. Вы можете использовать инспектор конкурентов под спойлером для детального анализа лидеров выдачи или воспользоваться встроенным инструментом «Генерация ТЗ», который автоматически включает ключевые биграммы и триграммы с рекомендуемым числом вхождений в готовое задание.

Сколько всего биграмм анализируется для одного кластера?

В агрегированную таблицу топа попадает до 40 наиболее значимых биграмм, отранжированных по убыванию SEO-важности. В инспекторе конкретных документов отображаются персональные топ-10 биграмм и топ-10 триграмм выбранной страницы.