Canonical и robots.txt — где чаще косяки и чем их вообще отличать?
Народ, всем известно, что и canonical, и robots.txt помогают поисковикам разбираться с дублями и индексированием. Но с какого-то момента видел, что на форумах куча вопросов и ошибок из-за путаницы в этих штуках.
Canonical — это тег, который говорит: «Вот главная страница, остальные — ее копии или варианты». Он нужен, чтобы избежать штрафов за дублированный контент и правильно распределить вес. robots.txt — это файл, который просто запрещает роботам заходить на определённые разделы сайта. Вот тут и начинается путаница: некоторые ставят в robots.txt запрет на страницы с дублирующимся контентом, а потом удивляются, почему эти страницы вообще не индексируются, и вообще потенциальная польза от canonical не раскрывается.
Короче, canonical — это типа метка, ты говоришь поисковику, какая страница главная из похожих, а robots.txt — просто блокировка для роботов, чтоб не лезли куда не надо. Вот и всё, штуки разные, но вместе путают страшно часто.