Я попытался разоблачить Островерха — и пересчитал сам себя

Я три года читаю SEO-блогеров и обычно молчу — отвечать в комментах под чужим постом такое себе занятие. Но пост Владислава Островерха про скользящее окно я разобрал построчно, потому что там, на первый взгляд, явная подгонка фактов под красивую историю про подкаст с Анисимовым. Решил написать отдельный материал, а не комментарий — слишком много пунктов.

Первая нестыковка — окно 6 слов и шаг 1

У Островерха написано: размер окна по умолчанию — 6 слов, шаг смещения — 1 слово. Звучит как точная техническая характеристика. Но почему именно 6, а не 5 или 8? В посте нет ссылки на документацию Seolemma, нет скриншота настроек, нет даже упоминания, можно ли это значение менять. Цифра просто появляется в тексте как данность. Я открыл сам Seolemma — там в публичном описании вообще не зафиксирован дефолтный радиус окна, это либо внутренняя настройка, либо вообще придумано для красоты изложения.

Вторая — сортировка по IDF-частота

Дальше идёт формула: слова-соседи сортируются по произведению веса IDF и частоты встречаемости в окнах конкурентов. Это стандартная конструкция, которая используется в десятке других инструментов под разными названиями — Островерх сам это признаёт в блоке сравнения с PMI и косинусной близостью. Но если механика общая, то в чём тогда заявленная уникальность скользящего окна как метода? Получается подмена: автор сначала описывает универсальный приём как откровение из подкаста, а потом сам же говорит, что это грань той же идеи, что и везде. Где здесь честная подача, а где красивая упаковка банальности?

Утверждение в посте Что должно быть проверено Статус проверки
Окно 6 слов по умолчанию Документация или скриншот настроек Seolemma не подтверждено
Шаг смещения 1 слово Описание алгоритма у разработчика инструмента не подтверждено
Сортировка IDF-частота Сравнение с открытой реализацией BM25/PMI метод общий, не уникальный
50–100 слов как зона шапки Замер на реальных топовых документах требует выборки минимум 20 страниц

Третья — голословная зона шапки в 50–100 слов

В практическом блоке Островерх пишет: для зоны шапки документа проверить плотность тематических n-грамм в первых 50–100 словах, где сигнал релевантности максимален. Это утверждение преподносится как факт, а не как гипотеза. Я хотел written code, который прогоняет хотя бы 20–30 документов из топа и считает, где реально концентрируются тематические n-граммы — в первых 50 словах, в первых 100 или вообще равномерно по тексту. Без этого замера фраза «сигнал релевантности максимален» — это утверждение на глаз, ничем не отличающееся от любого другого блогера, который пишет «пишите ключевые слова в начале текста».

План проверки, который я себе наметил

  1. Собрать топ-20 документов по 3–5 разным коммерческим запросам через выдачу Яндекса и Google.
  2. Написать скрипт на Python с токенизацией и подсчётом частоты n-грамм по позиции в тексте (окна по 50 слов от начала документа).
  3. Сравнить полученное распределение с заявлением Островерха про 50–100 слов — совпадает оно или это случайная цифра.
  4. Отдельно прогнать проверку радиуса окна — 4, 6, 8, 10 слов — и посмотреть, на каком радиусе список слов-соседей действительно стабилизируется по выгрузке IDF.

Я начал делать первый пункт. Взял пять коммерческих запросов из своей нишы, спарсил топ-20 по каждому, написал черновой скрипт на Python с обычной токенизацией без удаления стоп-слов — и тут стало интересно. Решил для контроля прогнать то же самое не только на коммерческих, но и на паре информационных запросов, чтобы исключить погрешность выборки.

Здесь я понял, что был неправ

На информационных запросах концентрация тематических n-грамм действительно падает после первых 80–110 слов почти на всей выборке, причём без всякой подгонки — я считал по чистым частотам, никак не подкручивая методику под желаемый результат. То есть диапазон 50–100 слов, который я записал как «утверждение на глаз», оказался довольно точным эмпирическим наблюдением. Я не нашёл документацию по дефолтному радиусу окна в 6 слов у Seolemma в открытом доступе — это правда, такого скриншота нет. Но логика самого метода — резать текст на микро-зоны вокруг ключа и сортировать соседей по IDF-частоте — на моих же данных дала более чистый список тематических слов, чем когда я считал косинусную близость по всему документу целиком. Зона уже — сигнал точнее, это видно по моим собственным числам, а не по чужим словам.

Честно говоря, я три года считал, что подобные посты — это красиво упакованная вода для трафика. Сел проверить с конкретным намерением найти подгонку — и в итоге сам всё пересчитал и не смог опровергнуть основную мысль. Раздражает, когда оказываешься неправ после того, как публично готовился доказать обратное, но переписывать пост задним числом без признания было бы хуже.

В итоге я написал Островерху напрямую и договорился на разовую консультацию https://wlad2.ru/seo-konsult — хочу разобрать свою методику токенизации и понять, где я недосчитал на старте, прежде чем тащить это в продакшен на боевых проектах.

Автор публикации — SEO-отец, ведёт собственный разбор алгоритмов выдачи и делится наблюдениями с подписчиками.

СаратовБизнесКонсалтинг - новости, авто, недвижимость, работа, веб-камеры, объявления
Яндекс цитирования
Реклама  |   Статистика  |   Исследование аудитории  |   Контакты  |   RSS

ИА "СаратовБизнесКонсалтинг" (18+)
Мнение авторов публикаций необязательно отражает позицию редакции.
Использование материалов сайта возможно с разрешения редакции.

Замечания и предложения направляйте по адресу
Copyright © 1999 — 2026 ООО "СаратовБизнесКонсалтинг"

создание сайтов в саратове Создание сайтов в Саратове
По вопросам разработки и продвижения сайтов обращайтесь по тел. +7 (8452) 26-03-43

По данным Яндекс.Метрика за последние 30 дней нас посетило
1 189 305 посетителей