robots.txt
Что сайт разрешает и запрещает обходить. Можно сразу проверить конкретный адрес: закрыт он от индексации или нет.
Как читается robots.txt
Файл лежит строго в корне сайта и состоит из групп. Группа начинается со строки
User-agent и продолжается правилами Disallow и
Allow. Робот выбирает одну группу — свою, если она есть, иначе общую
со звёздочкой, — и правила остальных групп не читает вовсе.
Какое правило побеждает
- Из подходящих правил выигрывает самое длинное совпадение, а не то, что выше.
- При равной длине выигрывает
Allow. - Звёздочка означает любую последовательность знаков, знак доллара — конец адреса.
- Пустой
Disallow:ничего не запрещает, это разрешение.
Чего robots.txt не делает
Он не закрывает страницу от посторонних: файл открыт всем, и перечисленные в нём
«секретные» разделы читаются в первую очередь. Он не убирает страницу из выдачи —
если на неё ведут ссылки, адрес может показаться и без описания; для удаления нужен noindex в мета-теге,
noindex в мета-теге, а страница при этом должна быть открыта
для обхода, иначе робот не увидит запрет.
И отдельно про ошибку сервера: если robots.txt отвечает пятисоткой,
поисковики на время прекращают обход всего сайта — это хуже, чем отсутствие файла.