Дубли архивов в WordPress обычно появляются не из-за одной ошибки, а из-за набора мелких настроек: теги, категории, авторские архивы, архивы дат, пагинация, страницы вложений и результаты поиска. На небольшом сайте это может не бросаться в глаза, но в индексе такие страницы быстро размножаются и начинают конкурировать между собой.
Если задача не в том, чтобы «запретить всё подряд», а в том, чтобы оставить в индексе только полезные страницы, сначала нужно понять, какие архивы реально нужны, а какие создают мусор. Ниже — рабочий сценарий: как диагностировать проблему, что отключить, как проверить результат и где чаще всего ломают SEO случайными правками.
Какие дубли архивов WordPress встречаются чаще всего
Под дублями здесь я имею в виду не только одинаковый контент, но и страницы, которые создают несколько путей к одному и тому же набору записей. Поисковик видит разные URL, а смысл у них почти одинаковый.
Типовые источники дублей
- архивы категорий и тегов, если они выводят один и тот же набор записей;
- архивы автора на сайтах с одним автором;
- архивы по датам, если они не несут самостоятельной ценности;
- страницы вложений с тонким контентом;
- пагинация архивов, которая индексируется без необходимости;
- страницы поиска по сайту, если они попадают в индекс;
- архивы таксономий с пустыми или почти пустыми страницами.
Отдельная история — canonical. Если на архиве он указывает не туда или генерируется несколько canonical одновременно, поисковик получает противоречивые сигналы. Это уже не просто дубль, а причина для просадки индексации.
Диагностика: как понять, что проблема именно в архивах
Начинать лучше не с правок, а с проверки того, что уже проиндексировано. Иначе легко отключить нужные страницы и не заметить, что проблема была в другом месте.
Что проверить в первую очередь
- отчёт по страницам в Google Search Console: какие архивные URL попали в индекс;
- поиск по сайту через
site:example.com category,site:example.com tag,site:example.com author; - исходный код страниц архива: один ли canonical, нет ли конфликтующих meta robots;
- наличие одинаковых заголовков и описаний у разных архивов;
- сколько записей реально выводит архив: если там 2–3 поста, ценность страницы сомнительна.
Если у вас установлен SEO-плагин, проверьте, не дублирует ли он настройки темы. Частая ситуация: тема уже выводит canonical и meta robots, а плагин добавляет свои значения поверх. В итоге в HTML остаются лишние теги или конфликтующие директивы.
Пошаговое решение: что отключать и что оставлять
Универсального рецепта нет, но логика обычно одна: оставить только те архивы, которые помогают навигации и реально полезны пользователю. Остальное — закрыть от индексации или убрать из генерации, если это не ломает структуру сайта.
1. Отключите ненужные архивы в теме или через код
Если сайт на одном авторе, авторский архив часто не нужен. То же самое относится к архивам дат на большинстве корпоративных сайтов. Их можно отключить фильтрацией запросов или перенаправлением на более полезную страницу.
<?php
add_action('template_redirect', function () {
if (is_author() || is_date()) {
wp_safe_redirect(home_url('/'), 301);
exit;
}
});Этот вариант грубый, но понятный. Он подходит, если архивы не используются вообще. Если же архив нужен для навигации, лучше не редиректить, а закрыть от индексации и оставить доступ для пользователей.
2. Закройте архивы от индексации точечно
Для страниц поиска, вложений и некоторых таксономий обычно достаточно noindex,follow. Это не мешает пользователю переходить по сайту, но снижает риск попадания мусорных страниц в индекс.
<?php
add_filter('wp_robots', function ($robots) {
if (is_search() || is_attachment() || is_date()) {
$robots['noindex'] = true;
$robots['follow'] = true;
}
return $robots;
});Если у вас старый SEO-плагин, он может использовать свои фильтры и настройки. Тогда код нужно тестировать на конкретной установке, чтобы не получить два разных блока robots в HTML.
3. Уберите страницы вложений из индекса
Страницы attachment почти всегда создают тонкий дубль: заголовок файла, картинка и минимум текста. Если они уже в индексе, лучше сделать 301-редирект на родительскую запись или сам файл, если это оправдано.
<?php
add_action('template_redirect', function () {
if (is_attachment()) {
$parent = wp_get_post_parent_id(get_queried_object_id());
if ($parent) {
wp_safe_redirect(get_permalink($parent), 301);
exit;
}
wp_safe_redirect(home_url('/'), 301);
exit;
}
});Это безопаснее, чем оставлять пустые страницы вложений в индексе. Но если у вас медиабиблиотека используется как каталог файлов, редирект нужно продумывать отдельно.
4. Настройте canonical для архивов
Canonical должен указывать на саму страницу архива, а не на главную или на первую страницу пагинации без необходимости. Для пагинации важно не смешивать canonical и редиректы: если вы редиректите /page/2/ на первую страницу, вы ломаете навигацию. Если оставляете пагинацию, canonical должен быть консистентным.
Проверяйте это в исходном коде и через инструменты для проверки URL. На практике именно здесь чаще всего всплывают ошибки после установки SEO-плагина или кастомной темы.
Сравнение подходов: плагин, код или robots.txt
| Подход | Когда подходит | Плюсы | Минусы |
|---|---|---|---|
| SEO-плагин | Нужно быстро закрыть архивы без правок темы | Удобно, меньше кода | Легко получить конфликт настроек |
| Код в теме/плагине | Нужна точечная логика для конкретных архивов | Прозрачно, контролируемо | Требует тестирования после обновлений |
| robots.txt | Нужно ограничить обход, но не индексацию как таковую | Просто внедрить | Не решает проблему дубля сам по себе |
Если цель именно убрать дубли из индекса, одного robots.txt обычно недостаточно. Поисковик может увидеть URL по внешним ссылкам или внутренним переходам. Для таких случаев лучше сочетать noindex, canonical и редирект там, где это уместно.
Проверка результата после внедрения
После изменений не ограничивайтесь открытием страницы в браузере. Нужно проверить, что поисковый сигнал стал однозначным.
Чек-лист проверки
- в исходном коде страницы есть один canonical;
- для закрытых архивов стоит
noindex,followили редирект 301; - страницы вложений не открываются как отдельные тонкие страницы;
- в Search Console новые URL не появляются в индексе массово;
- пагинация архивов доступна, если она нужна пользователю;
- нет цепочек редиректов между архивом, canonical и главной.
Полезно сравнить HTML до и после правок. Если вы используете серверный кеш или CDN, очистите его перед проверкой, иначе будете смотреть на старую версию страницы и искать несуществующую проблему.
Частые ошибки и как их исправить
Закрыли архив в robots.txt и ждут удаления из индекса
Это частая ошибка. Если URL уже в индексе, запрет обхода не гарантирует его исчезновение. Нужны noindex, редирект или удаление через инструменты поисковой системы, если речь о действительно лишней странице.
Ставят редирект на все архивы подряд
Так ломают навигацию и внутреннюю перелинковку. Архив категории может быть полезен, а вот архив автора на сайте с одним автором — нет. Разделяйте сценарии, не применяйте одну и ту же логику ко всем архивам.
Оставляют дубли canonical из темы и SEO-плагина
В HTML должен быть один понятный canonical. Если их два, сначала отключайте дублирующую генерацию в теме, а не пытайтесь «перебить» её поверх. Иначе проблема вернётся после обновления.
Закрывают от индексации полезные страницы
Иногда под раздачу попадают категории, которые реально работают как навигационные хабы. Перед закрытием проверьте, есть ли у архива трафик, внешние ссылки и смысл для пользователя. Если да — лучше оптимизировать шаблон архива, а не убирать его из индекса.
Практические советы по безопасности и производительности
Если вы вносите правки кодом, не редактируйте functions.php на живом сайте без бэкапа. Лучше вынести логику в небольшой mu-plugin или в отдельный мини-плагин, чтобы не потерять изменения при обновлении темы.
Для сайтов с большим количеством архивов полезно проверить, не создаёт ли тема лишние запросы в шаблонах архива. Иногда проблема с дублями идёт рядом с проблемой производительности: лишние архивы индексируются, а сами страницы ещё и медленно собираются из-за тяжёлых запросов к базе.
Если нужен более широкий аудит дублей, canonical и технической чистки, имеет смысл смотреть в сторону инструментов вроде Clearfy Pro: он закрывает часть типовых SEO-задач, но всё равно не отменяет ручную проверку конкретной структуры сайта. Автоматические настройки полезны только там, где вы понимаете, что именно они меняют.
Главная идея простая: не пытайтесь лечить все дубли одним переключателем. Сначала определите, какие архивы действительно нужны, затем закройте или перенаправьте лишние, и только после этого проверяйте индекс и canonical. В WordPress это обычно быстрее и надёжнее, чем бороться с последствиями уже после массовой индексации мусорных URL.