Robots.txt управляет обходом, sitemap помогает сообщить поисковикам о важных канонических URL, а rel=canonical указывает предпочтительную версию среди дублей. Один механизм не заменяет другой: закрытая robots страница, неправильный canonical и мусорный sitemap создают разные проблемы.
Robots.txt: управляет доступом робота, а не «удаляет из индекса»
Robots.txt полезен для ограничения обхода технических разделов, но его нельзя использовать как универсальный способ удалить уже известный URL из поиска. Если робот не может зайти на страницу, он может не увидеть meta noindex и другие сигналы.
Поэтому правила должны быть минимальными и осмысленными. CSS/JS, необходимые для рендеринга важных страниц, не стоит блокировать без причины.
Sitemap.xml: карта целевых URL, а не список всего, что существует
В sitemap включают canonical, индексируемые, реальные страницы с HTTP 200. Не нужно добавлять 404, redirects, noindex, служебные параметры и дубли.
Sitemap особенно полезен после появления новых статей и посадочных, но он не заменяет внутренние ссылки. URL, который есть только в sitemap, всё ещё плохо встроен в архитектуру.
Canonical: сигнал о предпочтительной версии
Canonical нужен при дублях и близких версиях URL, но не должен использоваться как костыль вместо нормальной архитектуры. Self-referencing canonical на обычных индексируемых страницах помогает явно фиксировать основную версию.
Проверьте согласованность: internal links, sitemap, redirects и canonical должны указывать на одну и ту же финальную версию. Конфликтующие сигналы усложняют выбор поисковой системе.
Быстрая проверка согласованности
Возьмите важную страницу услуги. Она должна отдавать 200, быть разрешена к обходу, иметь index/follow, self-canonical, присутствовать в sitemap и получать обычные внутренние ссылки. Если хотя бы один слой указывает на другой URL, причина должна быть осознанной.
После миграций и массовых изменений такую проверку лучше автоматизировать по всему списку целевых страниц.
Как согласовать robots, sitemap и canonical без конфликтов
Эта таблица не заменяет диагностику, но помогает не прыгать между случайными правками. Сначала определите слой проблемы, затем проверяйте конкретные сигналы.
| Слой | Контроль |
|---|---|
| Crawl | robots, href, redirects, глубина |
| Index | canonical, noindex, дубли, sitemap |
| Render/UX | JS, LCP, INP, CLS, mobile |
Когда один неправильный сигнал ломает выбор основной страницы
Материал помогает понять логику задачи, но конкретный сайт всегда имеет собственную историю, структуру и конкурентную выдачу. Если нужно определить не общий принцип, а что именно делать с вашим URL, переходите к техническое seo. Для соседних задач могут понадобиться SEO-аудит сайта · Комплексное SEO.
SEO повышает вероятность роста при правильном интенте, качестве, технической доступности и конкурентоспособности страницы, но конкретное место в выдаче заранее гарантировать нельзя.