Настройка и проверка robots.txt для закрытия технических дублей
Хочу себе такие же кнопкиЧто вы получите от этого урока
Вы узнаете, как правильно настроить файл robots.txt, чтобы закрывать технические дубли страниц, какие правила писать, как проверять их работу и какие подводные камни могут подстерегать вас в процессе. После урока вы сможете быстро решить проблему «мусорных» URL‑ов, которые размывают вес вашего сайта в поиске и мешают выйти в топ по запросу «услуги в Конаково».
1. Почему robots.txt важен для борьбы с дублями
- Технические дубли – это разные URL, ведущие на один и тот же контент (например,
example.com/?utm_source=mailиexample.com/). Поисковые роботы могут индексировать их все, и каждый дубль «разбивает» вес страницы. robots.txt– это простой текстовый файл, который размещается в корне сайта (https://example.com/robots.txt). Он говорит поисковикам, какие части сайта следует обходить, а какие можно сканировать.- Аналогия: представьте, что ваш сайт – это библиотека, а
robots.txt– это карта, где отмечено, какие полки закрыты для читателей. Если закрыть полки с копиями книг, читатели (роботы) будут тратить время только на оригиналы.
2. Основные директивы robots.txt
| Директива | Описание | Пример |
|---|---|---|
| User-agent | Указывает, к какому роботу относится правило. * – все роботы. |
User-agent: * |
| Disallow | Запрещает сканировать указанный путь. | Disallow: /?utm_source= |
| Allow | Разрешает сканировать путь, даже если он попадает под более общее Disallow. |
Allow: /blog/ |
| Sitemap | Указывает расположение карты сайта (Sitemap XML). | Sitemap: https://example.com/sitemap.xml |
Важно:
robots.txtуправляет только сканированием, а не индексированием. Если страница уже попала в индекс, её нужно дополнительно удалить черезnoindexв мета‑теге или в Google Search Console.
3. Какие URL‑ы обычно считаются техническими дублями
| Тип дубля | Пример URL | Почему он дубль | Как закрыть в robots.txt |
|---|---|---|---|
| Параметры сессии | example.com/?PHPSESSID=abcdef |
Содержит идентификатор сессии, контент одинаковый | Disallow: /?PHPSESSID= |
| UTM‑метки | example.com/?utm_source=mail |
Трекинговые параметры, не влияют на контент | Disallow: /?utm_source= |
| Параметры сортировки/фильтрации | example.com/products?sort=price |
Тот же список товаров, только порядок изменён | Disallow: /products?sort= |
| Трейлы слэша | example.com/page и example.com/page/ |
Оба URL ведут на одну страницу | Disallow: /page (если хотите закрыть без слэша) |
| Параметры языка | example.com/?lang=ru |
Дублирование контента на разных языках (если язык задаётся в URL) | Disallow: /?lang= |
4. Пошаговая настройка robots.txt для закрытия дублей
Шаг 1. Составьте список «вредных» параметров
- Откройте Google Search Console → Параметры URL (если у вас уже есть доступ).
- Выполните лог‑анализ в Яндекс.Вебмастере и в Google Analytics, чтобы увидеть, какие параметры часто появляются в запросах.
- Запишите их в таблицу (пример выше).
Шаг 2. Создайте базовый шаблон файла
User-agent: *
Disallow: /?utm_source=
Disallow: /?utm_medium=
Disallow: /?utm_campaign=
Disallow: /?PHPSESSID=
Disallow: /?lang=
Sitemap: https://example.com/sitemap.xml
Подсказка: если у вас несколько параметров, их можно перечислять в отдельных строках
Disallow. Поисковые роботы обрабатывают их независимо.
Шаг 3. Тестируйте правила в режиме «песочницы»
- Google Search Console → Проверка robots.txt. Вставьте ваш файл и нажмите «Тестировать».
- Yandex.Webmaster → Проверка robots.txt.
Обратите внимание на сообщения «Allowed» и «Disallowed». Если нужный URL попадает в «Allowed», значит правило не сработало – проверьте точность пути.
Шаг 4. Разместите файл на сервере
- Сохраните текст в файле
robots.txt. - Загрузите его в корневой каталог сайта (
/public_html/robots.txtили/var/www/html/robots.txt). - Убедитесь, что файл доступен по адресу
https://example.com/robots.txt.
Шаг 5. Поставьте «проверку» в Google Search Console
- В разделе Проверка URL введите один из закрытых URL‑ов. Если всё настроено правильно, вы увидите сообщение «Blocked by robots.txt».
Шаг 6. Удалите уже проиндексированные дубли (по желанию)
- Добавьте мета‑тег
noindexв шаблон страниц, где параметры всё ещё могут попасть в индекс, и подайте URL‑удаление в GSC.
5. Частые ошибки и как их избежать
| Ошибка | Почему возникает | Как исправить |
|---|---|---|
| Неправильный слеш | Disallow: /?utm_source= vs Disallow: ?utm_source= |
Всегда начинайте путь со слеша (/). |
| Пробелы в начале строки | Поисковый робот воспринимает пробел как часть пути. | Удаляйте все ведущие пробелы. |
| Закрытие важного контента | Случайно запретили /blog/ и все подпапки. |
Добавьте Allow: /blog/ после общего Disallow. |
Отсутствие Sitemap |
Поисковики могут не находить карту сайта. | Добавьте строку Sitemap: https://example.com/sitemap.xml. |
| Кеширование старой версии | Сервер отдаёт старый robots.txt из кэша. |
Очистите кэш CDN и проверьте заголовок Cache-Control. |
6. Как проверять «живой» статус robots.txt
- cURL:
curl -I https://example.com/robots.txt– смотрим код 200 и содержимое. - Онлайн‑инструменты (например,
https://www.robotstxt.org/robotstxt.html) – вставляем URL и получаем разбор. - Браузер: просто откройте
https://example.com/robots.txtи убедитесь, что в файле нет лишних символов (BOM, скрытых пробелов).
7. Пример «полного» robots.txt для сайта‑услуги в Конаково
# Общие правила для всех роботов
User-agent: *
Disallow: /?utm_source=
Disallow: /?utm_medium=
Disallow: /?utm_campaign=
Disallow: /?utm_term=
Disallow: /?utm_content=
Disallow: /?PHPSESSID=
Disallow: /?lang=
Disallow: /?sort=
Disallow: /?filter=
# Разрешаем доступ к публичным разделам
Allow: /services/
Allow: /about/
Allow: /contact/
Allow: /blog/
# Карта сайта
Sitemap: https://konakovo-services.ru/sitemap.xml
Почему так?
- Все рекламные и сессионные параметры закрыты.
- Основные разделы, важные для SEO, явно разрешены, чтобы не возникло конфликтов между
DisallowиAllow.- Карта сайта помогает роботам быстро находить нужные страницы.
Практика для закрепления
-
Список параметров
Составьте таблицу из пяти параметров, которые часто появляются в URL вашего сайта (например,ref,session,page,category,sort). Для каждого укажите, будет ли он закрыт вrobots.txtи почему. -
Написание правила
На основе таблицы из пункта 1 напишите корректный блокDisallowдля каждого параметра. Убедитесь, что каждый путь начинается со слеша. -
Тестирование
Воспользуйтесь бесплатным онлайн‑тестеромrobots.txt(поиск «robots.txt tester»). Вставьте ваш файл и проверьте, что URLhttps://example.com/?ref=partnerпомечен как Blocked, аhttps://example.com/services/– как Allowed. -
Проверка в реальном времени
Опубликуйте вашrobots.txtна тестовом домене (можно использовать поддоменtest.example.com). С помощьюcurl -I https://test.example.com/robots.txtубедитесь, что сервер отдает правильный файл и заголовокContent-Type: text/plain. -
Аудит уже проиндексированных дублей
Откройте Google Search Console → Покрытие → Отфильтровать по «Дубли». Составьте список из трех URL‑ов, которые уже проиндексированы, и предложите, как их удалить (мета‑тегnoindex, удаление через GSC и т.п.).
Итоги
robots.txt– ваш первый щит против технических дублей.- Пишете чёткие
Disallowдля всех «мусорных» параметров, оставляя открытыми важные разделы. - Проверяете работу файла в консольных и веб‑инструментах, а при необходимости фиксируете уже проиндексированные дубли.
С этими навыками ваш сайт будет быстро сканироваться, а вес страниц сосредоточится только на оригинальном контенте – именно то, что нужно, чтобы выйти в топ по запросу «услуги в Конаково» без бюджета на контекстную рекламу. Удачной оптимизации!
БЕСПЛАТНЫЙ КУРС: «КАК СОЗДАТЬ ЦИФРОВОЙ СЕЙФ ЗА 1 ВЕЧЕР»
Бесплатный курс: Оптимизация Битрикс на VDSina шаг за шагом
Чат онлайн с функцией стикеров
Чат-встреча
Fashion-байинг: ключевые этапы создания сезонной коллекции
ИП или ООО: как выбрать форму бизнеса в Москве
Как правильно настроить robots.txt для SEO
Как правильно размещать стрелки с подписями
Конвертер Азбуки Морзе в Аудио
Коттеджный поселок "Дуслык" — вблизи Уфы
Онлайн общение Екатеринбург
Онлайн рулетка с поддержкой мобильных устройств
Основы SEO: понимание Google Analytics и Google Search Console
От нуля до поездки: самостоятельный туризм
Платформы для оплаты ИИ
Подготовка к ОГЭ: справочные материалы
Решение проблем с индексированием сайта
РФ 2026, Европа, РКН, Adsense: $3000/мес без потери аккаунта
Сбои AutoCAD при загрузке - как избежать
Стальные фитинги и трубы для промышленности
Только слух, без текста: 5 минут ежедневного погружения
Видео чат случайный
