robots.txt и sitemap: зачем они нужны, если объяснять на пальцах
robots.txt говорит поисковику, куда на сайте ходить не надо. sitemap.xml, наоборот, показывает полный список страниц, которые вы хотите видеть в поиске. Оба файла лежат в корне сайта, весят копейки, и без них сайт работает — просто поисковый робот будет тратить время не на то и находить новые страницы медленнее.
Что делает robots.txt
Представьте, что к вам в офис пришёл курьер и вы даёте ему записку: «переговорка — можно, бухгалтерия — не надо, серверная — не надо». Курьер вежливый и записку читает. Это и есть robots.txt.
Закрывают обычно три вещи. Служебные адреса: корзина, личный кабинет, страница оформления заказа, админка. Технический мусор: результаты внутреннего поиска, страницы с метками рекламных кампаний, бесконечные комбинации фильтров. И дубли: одна и та же карточка товара, доступная по трём разным адресам.
Зачем это вам. У робота на ваш сайт есть ограниченный бюджет времени. Если он тратит его на 40 000 страниц вида «фильтр цвет+размер+бренд», до новых товаров он доберётся не скоро.
Что делает sitemap.xml
Это простой список адресов с датой последнего изменения каждого. Робот скачивает его и сразу знает, что у вас есть и что поменялось со вчера, вместо того чтобы ходить по ссылкам и угадывать.
Особенно заметно на больших каталогах и на новых сайтах. В магазине «Жук и Плут» карта сайта пересобирается сама при каждом изменении каталога: владелица добавляет позицию в админке — адрес попадает в файл в тот же момент. Отдельного действия «обновить карту» в её работе нет и быть не должно.
Сама по себе карта сайта не поднимает позиции. Она ускоряет попадание в индекс — это разные вещи, и их часто путают.
Что будет, если их нет вообще
Сайт не сломается и из поиска не выпадет. Небольшой лендинг на пять страниц спокойно живёт без обоих файлов: там нечего скрывать и нечего перечислять, робот обойдёт всё по внутренним ссылкам за минуту.
Проблемы начинаются с масштабом. Магазин на две тысячи товаров без карты сайта индексируется дольше и неровнее. Сайт с открытыми служебными адресами рискует получить в выдаче страницу «Спасибо за заказ» вместо страницы услуги.
Ещё один сценарий — обратный. Файл есть, но в него по ошибке попала строка, закрывающая весь сайт целиком. Такое случается после переноса с тестового сервера на боевой: на тесте сайт закрывают от поиска намеренно, а при переезде забывают снять запрет. Симптом узнаваемый: сайт открыт, работает, но в поиске его нет неделями.
Как проверить свои файлы за две минуты
Откройте в браузере ваш-домен.ru/robots.txt и ваш-домен.ru/sitemap.xml. Если оба открылись и в них есть содержимое — базово всё на месте.
В robots.txt найдите строку Disallow: / — одиночный слэш без продолжения означает «весь сайт закрыт». Если она стоит не под отдельным правилом для конкретного робота, а в общем блоке, это авария.
В sitemap.xml проверьте два адреса наугад: они должны открываться и отдавать нормальную страницу, а не ошибку 404. И убедитесь, что там нет адресов вида http, если сайт уже переехал на https.
Кому это можно не трогать
Если у вас одностраничный лендинг, вы не ведёте блог и каталога нет — оба файла роли почти не играют. Время лучше потратить на скорость загрузки и на текст самой страницы.
Если сайт сделан на нормальной платформе, оба файла уже созданы и настроены разумно по умолчанию. Лезть туда руками без причины не нужно: цена ошибки в robots.txt выше, чем польза от «оптимизации».
Отдельный случай — сайт, который вы ещё не запустили. Пока идёт разработка, закрывать его от поиска правильно и нужно. Важно только записать снятие запрета в список дел на день запуска, рядом с переносом домена и подключением аналитики.
Коротко
robots.txt закрывает от робота служебное и мусорное. sitemap.xml перечисляет то, что должно попасть в поиск, и ускоряет индексацию. На маленьком сайте оба файла почти незаметны, на каталоге — экономят недели. Проверять их стоит после каждого переезда сайта: самая частая беда не в отсутствии файла, а в забытой строке, закрывающей весь проект целиком.
Первый разговор — разбор задачи: нужна ли вам система или хватит одной страницы. Без обязательств и без счёта.
Частые вопросы
Их нужно обновлять руками после каждой новой страницы?
Нет. Sitemap должен собираться движком сайта автоматически: добавили товар или статью — файл перегенерировался сам. Если вам предлагают править карту сайта вручную, это признак, что сайт собран криво. robots.txt меняют редко, обычно раз в жизни проекта.
Я закрыл раздел в robots.txt, а он всё равно в поиске. Почему?
robots.txt — это просьба не заходить, а не запрет показывать. Если на страницу ведут ссылки, поисковик может показать её в выдаче даже без содержимого. Чтобы страница гарантированно исчезла, нужен запрет прямо на самой странице, в её коде, а не в robots.txt.
Можно ли скачать чужой robots.txt и подставить себе?
Технически да, файл лежит в открытом виде у любого сайта. Практически это опасно: там перечислены адреса разделов конкретного движка. Чужие правила либо не сработают, либо закроют у вас что-то нужное.
Те, что не помогают, мы переписываем — по этой кнопке и решаем, какие именно.
Ещё по теме
Регламент из шести стадий разработки: что по поиску решается на каждой, кто отвечает и по какому признаку стадия считается закрытой.
тем, кто заказывает SEO против геосервисов: где бизнесу искать клиентовРазбираем, когда нужно выводить сайт в топ поиска, а когда выгоднее сфокусироваться на картах и локальных каталогах.
тем, кто заказывает SEO-агентство продаёт вам позиции, а не деньгиПочему отчёт с зелёными стрелочками может расти год подряд, пока обращений нет, и какие четыре вопроса подрядчику меняют разговор.
тем, кто заказывает