Поиск после LLM: почему классической SEO-модели уже недостаточно
Эта тема не про "SEO умерло". Классические методы по‑прежнему дают результат: индексация, техничка, структура, скорость, ссылки и релевантность никуда не исчезли. Проблема в другом: сам поиск усложнился до такой степени, что привычная схема "проиндексировали → отсортировали → получили клик" больше не описывает реальность. Поверх старой логики появился новый слой - AI‑ответы на базе больших языковых моделей, и он живёт по собственным правилам.
Как работал поиск десятилетиями - и почему этого стало мало
Долгое время веб‑поиск действительно выглядел относительно прямолинейно: робот нашёл страницу, добавил в индекс, алгоритм ранжирования определил порядок выдачи, пользователь кликнул. Под это построили почти все SEO‑практики: оптимизировали возможность индексации, перелинковку, релевантность документа запросу, коммерческие и поведенческие сигналы, техническое качество страницы.
С приходом LLM эта архитектура не исчезла. Но поверх неё появился дополнительный этап - извлечение источников и сбор ответа. Если упростить, современный AI‑поиск всё чаще выглядит так: система сначала выбирает набор материалов, затем извлекает из них фрагменты, после чего LLM собирает итоговый ответ. И вот здесь кроется ключевой сдвиг: даже "первая позиция" в привычной выдаче больше не гарантирует, что именно ваш материал станет основой ответа. Потому что важен не только порядок в списке - важен отбор источников для генерации.
Retrieval не равен Ranking: разные вопросы, разные критерии качества
Ранжирование исторически отвечало на вопрос: какой документ показать пользователю первым. Retrieval отвечает на другой: какие документы (и какие фрагменты) взять, чтобы построить ответ. Это две разные задачи и два разных "поля оптимизации".
Внутри retrieval‑слоя могут сочетаться разные механики: классический BM25, плотное (dense) извлечение, гибридные подходы, векторный поиск и embedding‑поиск, схемы RAG, внутренние графы знаний, а иногда и подключение внешних поисковых индексов. При этом сама LLM не обязана "искать" напрямую - ей могут передать уже подготовленный пул источников, из которых она будет собирать ответ.
Иными словами, традиционная SEO‑задача "попасть в топ" остаётся важной, но появляется параллельная: стать удобным источником для retrieval‑системы.
Документ перестаёт быть минимальной единицей конкуренции
Классический поиск работал с документами: страница - это объект, который ранжируется. LLM‑ориентированные системы всё чаще работают с фрагментами знаний: определениями, таблицами, краткими инструкциями, статистикой, процедурами, сравнениями, чёткими тезисами и цитатами. Конкурируют не только страницы - конкурируют смысловые блоки.
Если смотреть на сильные публикации глазами retrieval‑системы, хороший материал всё меньше похож на "полотно текста" и всё больше - на набор независимых knowledge units. Такой контент проще индексировать, легче делить на чанки, удобнее эмбеддить, быстрее извлекать и безопаснее цитировать.
Что может происходить внутри Retrieval: от "нашли страницу" до "взяли именно этот фрагмент"
Когда система формирует ответ, ей важно не просто найти релевантный URL. Ей нужно:
- быстро понять, где в тексте находится нужная мысль;
- убедиться, что фрагмент самодостаточен и не требует контекста на полстраницы;
- извлечь определение или шаги без двусмысленности;
- выбрать источники, которым "удобно доверять" (по качеству структуры, ясности, плотности сущностей, проверяемости формулировок).
Поэтому выигрывает не обязательно самый длинный материал и не обязательно тот, что выше в выдаче. Выигрывает тот, чей контент проще превратить в корректный кусок ответа.
Почему стандартные SEO-аудиты начинают "не видеть" половину задачи
Большинство аудитов и чек‑листов до сих пор отвечают на классические вопросы: индексируется ли документ, корректны ли canonical и robots, каковы Core Web Vitals, релевантны ли Title и H1, нет ли дублей. Это нужно - но этого уже недостаточно.
Становятся важнее вопросы другого типа:
- насколько хорошо материал разбивается на retrieval‑chunks;
- какие сущности (entities) содержит текст и насколько они выражены;
- легко ли вытащить определения и правила;
- самодостаточен ли каждый смысловой блок;
- какие части страницы можно использовать в ответе без "всего остального".
Именно на эти пункты сегодня почти не смотрят системно, хотя они напрямую связаны с тем, попадёт ли ваш контент в AI‑ответ.
Возможная новая архитектура контента: писать не "страницы", а наборы знаний
Тренд постепенно подталкивает к другой модели: не одна статья на 15 минут чтения, а материал, который одновременно читается человеком и "понимается" системой извлечения. Это не значит "писать сухо". Это значит - строить текст так, чтобы в нём были:
- короткие определения рядом с термином;
- списки шагов там, где процедура;
- таблицы там, где сравнение;
- точные формулировки для ключевых утверждений;
- понятные границы смысловых блоков.
Такой подход повышает вероятность, что система возьмёт именно ваш фрагмент как строительный блок ответа.
---
Что можно исследовать уже сегодня: 5 направлений, которые становятся новым ядром оптимизации
1) Chunk Architecture (архитектура чанков)
Неочевидный вопрос: какой размер и форма смыслового блока оптимальны, чтобы он извлекался и цитировался. Слишком длинно - теряется точность. Слишком коротко - не хватает контекста и определений. Практически полезная стратегия - проектировать блоки так, чтобы каждый мог существовать автономно: тезис → пояснение → ограничение/условия → мини‑пример.
2) Entity Density (плотность сущностей)
Чем яснее в тексте представлены сущности (продукты, технологии, методы, стандарты, метрики, роли, этапы), тем проще retrieval‑системе сопоставить запрос с вашим фрагментом. Важно не "набить ключей", а структурировать знание: назвать сущность, дать определение, связать с соседними понятиями и привести конкретику.
3) Citation Probability (вероятность цитирования)
AI‑ответы часто тянут формулировки, которые удобно вставить в ответ без риска исказить смысл. На цитируемость влияют: чёткие определения, отсутствие воды, однозначные формулировки, списки, аккуратные оговорки ("в большинстве случаев", "при условии"), а также отсутствие "маркетингового тумана", который сложно корректно пересказать.
4) Retrieval Score (оценка извлечения)
Позиция в выдаче - это один сигнал. Но стоит думать о том, можно ли измерять "извлекаемость" отдельно: как быстро система находит нужный кусок, сколько шума вокруг него, есть ли повторения, нет ли противоречий в разных частях страницы. Контент с высокой "извлекаемостью" часто выигрывает даже при равной видимости.
5) Cross‑LLM Consistency (согласованность между моделями)
Разные модели и разные AI‑поиски могут предпочитать разные источники. Отсюда полезная задача: понять, насколько стабильно ваш контент используется в разных средах. Если один и тот же материал регулярно "подхватывается" несколькими системами, значит вы попали в правильную форму представления знания: она ясна, точна и удобна для извлечения.
---
Дополнительные практические выводы: что делать авторам и SEO уже сейчас
1) Делайте смысловые блоки автономными. Если читатель (и модель) вырвали абзац из статьи, он должен оставаться понятным. Добавляйте мини‑контекст: что это, где применяется, какие ограничения.
2) Перепроверьте "определения" и "первые предложения". Во многих темах именно первые 1-2 строки раздела становятся тем, что извлекают в ответ. Они должны быть точными, без метафор и расплывчатости.
3) Используйте форматирование как семантические маркеры. Подзаголовки, списки, таблицы и короткие блоки "вопрос-ответ" помогают не только читателю, но и механизму извлечения.
4) Убирайте противоречия и дубли. Когда один и тот же тезис написан по‑разному в разных местах, retrieval может вытащить менее удачную версию. Единая формулировка ключевых мыслей повышает предсказуемость.
5) Давайте измеримые факты там, где это возможно. Чёткие параметры, критерии, шаги, условия и исключения повышают доверие и цитируемость - и людям, и системам.
6) Проектируйте контент как "базу знаний", а не как "статью ради статьи". Это меняет подход к структуре: меньше повествования, больше полезных узлов, которые легко переиспользовать.
7) Расширяйте понимание SEO. Появившиеся аббревиатуры вроде AEO, GEO, LLMO описывают отдельные грани одного процесса: оптимизация уже не только про поисковую выдачу, а про распространение знаний в цифровой среде - через извлечение, пересказ, компоновку и цитирование.
Почему появляется новая задача - и как её можно назвать
Мы постепенно переходим от "оптимизации страницы под ранжирование" к более широкой дисциплине: исследованию того, как знание упаковывается, извлекается и используется в ответах. Уместно думать об этом как о Search Intelligence - не в смысле ярлыка, а как о стыке информационного поиска, NLP, LLM, архитектуры информации и управления знаниями.
Правила ещё не зацементировались: индустрия только учится понимать, почему система выбирает один источник, а другой игнорирует, как именно формируются подборки документов и какие признаки повышают вероятность извлечения. Но уже очевидно главное: описывать поиск исключительно через индексацию и ранжирование теперь недостаточно. В мире LLM выигрывает не просто тот, кто "в топе", а тот, чьи знания проще и надёжнее извлечь и встроить в ответ.


