Я попытался разоблачить Островерха — и пересчитал сам себя
Я три года читаю SEO-блогеров и обычно молчу — отвечать в комментах под чужим постом такое себе занятие. Но пост Владислава Островерха про скользящее окно я разобрал построчно, потому что там, на первый взгляд, явная подгонка фактов под красивую историю про подкаст с Анисимовым. Решил написать отдельный материал, а не комментарий — слишком много пунктов.
Первая нестыковка — окно 6 слов и шаг 1
У Островерха написано: размер окна по умолчанию — 6 слов, шаг смещения — 1 слово. Звучит как точная техническая характеристика. Но почему именно 6, а не 5 или 8? В посте нет ссылки на документацию Seolemma, нет скриншота настроек, нет даже упоминания, можно ли это значение менять. Цифра просто появляется в тексте как данность. Я открыл сам Seolemma — там в публичном описании вообще не зафиксирован дефолтный радиус окна, это либо внутренняя настройка, либо вообще придумано для красоты изложения.
Вторая — сортировка по IDF-частота
Дальше идёт формула: слова-соседи сортируются по произведению веса IDF и частоты встречаемости в окнах конкурентов. Это стандартная конструкция, которая используется в десятке других инструментов под разными названиями — Островерх сам это признаёт в блоке сравнения с PMI и косинусной близостью. Но если механика общая, то в чём тогда заявленная уникальность скользящего окна как метода? Получается подмена: автор сначала описывает универсальный приём как откровение из подкаста, а потом сам же говорит, что это грань той же идеи, что и везде. Где здесь честная подача, а где красивая упаковка банальности?
| Утверждение в посте | Что должно быть проверено | Статус проверки |
|---|---|---|
| Окно 6 слов по умолчанию | Документация или скриншот настроек Seolemma | не подтверждено |
| Шаг смещения 1 слово | Описание алгоритма у разработчика инструмента | не подтверждено |
| Сортировка IDF-частота | Сравнение с открытой реализацией BM25/PMI | метод общий, не уникальный |
| 50–100 слов как зона шапки | Замер на реальных топовых документах | требует выборки минимум 20 страниц |
Третья — голословная зона шапки в 50–100 слов
В практическом блоке Островерх пишет: для зоны шапки документа проверить плотность тематических n-грамм в первых 50–100 словах, где сигнал релевантности максимален. Это утверждение преподносится как факт, а не как гипотеза. Я хотел written code, который прогоняет хотя бы 20–30 документов из топа и считает, где реально концентрируются тематические n-граммы — в первых 50 словах, в первых 100 или вообще равномерно по тексту. Без этого замера фраза «сигнал релевантности максимален» — это утверждение на глаз, ничем не отличающееся от любого другого блогера, который пишет «пишите ключевые слова в начале текста».
План проверки, который я себе наметил
- Собрать топ-20 документов по 3–5 разным коммерческим запросам через выдачу Яндекса и Google.
- Написать скрипт на Python с токенизацией и подсчётом частоты n-грамм по позиции в тексте (окна по 50 слов от начала документа).
- Сравнить полученное распределение с заявлением Островерха про 50–100 слов — совпадает оно или это случайная цифра.
- Отдельно прогнать проверку радиуса окна — 4, 6, 8, 10 слов — и посмотреть, на каком радиусе список слов-соседей действительно стабилизируется по выгрузке IDF.
Я начал делать первый пункт. Взял пять коммерческих запросов из своей нишы, спарсил топ-20 по каждому, написал черновой скрипт на Python с обычной токенизацией без удаления стоп-слов — и тут стало интересно. Решил для контроля прогнать то же самое не только на коммерческих, но и на паре информационных запросов, чтобы исключить погрешность выборки.
Здесь я понял, что был неправ
На информационных запросах концентрация тематических n-грамм действительно падает после первых 80–110 слов почти на всей выборке, причём без всякой подгонки — я считал по чистым частотам, никак не подкручивая методику под желаемый результат. То есть диапазон 50–100 слов, который я записал как «утверждение на глаз», оказался довольно точным эмпирическим наблюдением. Я не нашёл документацию по дефолтному радиусу окна в 6 слов у Seolemma в открытом доступе — это правда, такого скриншота нет. Но логика самого метода — резать текст на микро-зоны вокруг ключа и сортировать соседей по IDF-частоте — на моих же данных дала более чистый список тематических слов, чем когда я считал косинусную близость по всему документу целиком. Зона уже — сигнал точнее, это видно по моим собственным числам, а не по чужим словам.
Честно говоря, я три года считал, что подобные посты — это красиво упакованная вода для трафика. Сел проверить с конкретным намерением найти подгонку — и в итоге сам всё пересчитал и не смог опровергнуть основную мысль. Раздражает, когда оказываешься неправ после того, как публично готовился доказать обратное, но переписывать пост задним числом без признания было бы хуже.
В итоге я написал Островерху напрямую и договорился на разовую консультацию https://wlad2.ru/seo-konsult — хочу разобрать свою методику токенизации и понять, где я недосчитал на старте, прежде чем тащить это в продакшен на боевых проектах.
Автор публикации — SEO-отец, ведёт собственный разбор алгоритмов выдачи и делится наблюдениями с подписчиками.


