Ты собрал ядро — тысячу запросов в столбик. Теперь их надо разложить по страницам: какие фразы живут на одной странице, а какие требуют отдельной. Это и есть кластеризация. Способов сгруппировать три, и они отвечают на вопрос «а похожи ли эти два запроса» по-разному.
Разберём все три на одном примере: запросы «купить велосипед», «велосипед купить недорого», «как выбрать велосипед взрослому».
- Смотрит, какие сайты уже в топ-10
- «купить» и «как выбрать» → разные сайты → разные кластеры
- Точно по интенту, дороже и медленнее
Метод 1. По выдаче (SERP-based): Hard, Middle, Soft
Самый надёжный способ. Логика простая: если два запроса и правда об одном, поисковик уже показывает по ним одни и те же страницы. Значит, берём топ-10 по каждому запросу и смотрим, сколько URL совпадает. Много общих ссылок — один кластер. Мало — разные.
Порог пересечения (сколько общих URL нужно, обычно 3–5) задаёт строгость. А вот как именно запросы связывают в группу — этим отличаются три режима.
Hard — строгий
Все запросы в кластере должны пересекаться каждый с каждым. Один выпал по порогу — в кластер не попал. Итог: мелкие, чистые группы, где ошибиться почти невозможно. Минус — много «одиночек», которые никуда не приклеились.
Middle — средний
Компромисс: связь считается через «мостики». Запрос попадает в кластер, если он пересекается с ядром группы, даже если не бьётся с каждым её членом. Кластеры крупнее, чистота чуть ниже. Рабочий режим по умолчанию для большинства проектов.
Soft — мягкий
Достаточно связи хотя бы с одним запросом группы (цепочкой). Кластеры получаются большими, ловят весь хвост, но внутрь могут затесаться фразы с чужим интентом. Годится для черновой прикидки структуры, не для финала.
Правило по памяти: Hard — когда важна чистота (коммерция, деньги на кону), Soft — когда важна полнота (большой контентный проект, черновик), Middle — когда не хочешь думать.
Цена метода: чтобы сравнить выдачу, её надо сначала собрать — по каждому запросу снять топ-10. Это парсинг поисковика, он медленный и стоит денег. Зато результат максимально совпадает с реальностью.
Метод 2. Семантический — по смыслу слов
Здесь выдачу не трогаем. Метод смотрит на сами слова: приводит их к начальной форме (лемме), видит синонимы и близкие по смыслу фразы, группирует похожие.
«купить велосипед» и «велосипед купить недорого» он уверенно сложит вместе — слова те же. А вот «как выбрать велосипед» он тоже может подтянуть в ту же группу, потому что общее слово «велосипед» перевешивает. И это ошибка: интент-то разный (купить против разобраться).
Плюс — мгновенно и бесплатно, не нужен парсинг выдачи. Минус — не чувствует интент, потому что не видит, что поисковик по этим фразам показывает разные страницы.
Метод 3. На эмбеддингах — по смыслу, но умнее
Продвинутая версия семантического. Каждый запрос превращается в вектор — набор чисел, который кодирует смысл фразы (эмбеддинг). Дальше запросы группируются по близости этих векторов (алгоритмами вроде DBSCAN).
Разница с обычной семантикой в том, что вектор улавливает смысл целиком, а не отдельные слова. Модель понимает, что «двухколёсный транспорт для города» и «городской велосипед» — про одно, даже без общих слов. И что «купить» и «как выбрать» — про разное, хотя слово «велосипед» общее.
Плюс — тоньше всех ловит смысл, работает на любом языке, не требует парсинга выдачи. Минус — считать эмбеддинги стоит денег (обращение к AI-модели), и на чисто коммерческих запросах он всё равно уступает методу по выдаче: намерение «купить» лучше всего виден именно в топе.
Что выбрать под свою задачу
- Большое информационное ядро, блог, вики
- Нужна быстрая черновая группировка
- Запросы на разных языках
Рабочая связка на практике: сначала прогони ядро по смыслу или на эмбеддингах — получишь черновые группы за секунды и бесплатно. Потом спорные и денежные кластеры перепроверь по выдаче. Так ты платишь за дорогой метод только там, где цена ошибки высокая.
Попробуй на своих запросах
Наш бесплатный кластеризатор группирует список фраз по смыслу через AI — это метод из третьей
категории, без парсинга выдачи и без ожидания. Вставь свои запросы в /free/cluster,
посмотри, как они разложатся по группам, и прикинь, сколько страниц тебе понадобится.
Частые вопросы
Какой метод самый точный?
Почему нельзя всё кластеризовать только по выдаче, раз он точный?
Что за порог 3, 4, 5?
Дальше — о том, как из готовых кластеров собрать техническое задание копирайтеру, чтобы каждая страница закрывала свой кластер целиком.