Если страница не появляется в Google, причина почти всегда одна из восьми: страница отдаёт noindex, robots.txt запрещает сканирование, тег canonical указывает на другой адрес, страница находится в цепочке редиректов, Google счёл контент недостаточно ценным, на страницу не ведут внутренние ссылки, пустая страница считается ложной ошибкой 404 или сломана настройка hreflang.

Угадывать не нужно: какая из них ваша, покажет десятиминутная проверка. Ниже каждая причина разобрана по порядку: как её подтвердить и как исправить.

Содержание

Сначала диагностика: на каком этапе застряла страница

Google обрабатывает страницу в три этапа: обнаруживает её, сканирует, а затем индексирует. От того, на каком этапе возникла проблема, полностью зависит решение.

Анимация: как Google обнаруживает, сканирует и индексирует страницу и на каком этапе она застревает
Страница проходит эти три этапа по порядку. Статус в инструменте проверки URL показывает, где она застряла.

Быстрее всего этап определяет инструмент проверки URL в Search Console. Вставьте адрес и запишите статус. Ниже названия статусов даны в русском и английском интерфейсе:

Статус Этап Какую причину проверить
URL неизвестен Google (URL is unknown to Google) Не обнаружена 6
Обнаружена, не проиндексирована (Discovered – currently not indexed) Не просканирована 2, 6
Просканирована, но пока не проиндексирована (Crawled – currently not indexed) Просканирована 1, 5
Копия, канонический вариант не выбран пользователем (Duplicate without user-selected canonical) Просканирована 3, 8
Страница с переадресацией (Page with redirect) Просканирована 4
Ложная ошибка 404 (Soft 404) Просканирована 7

У инструмента две вкладки, и их постоянно путают. Вкладка «В индексе Google» показывает страницу такой, какой она была при последнем сканировании, и эти данные могут быть старыми. Проверка на сайте загружает страницу прямо сейчас. Если вы что-то исправили, проверка на сайте будет чистой, а вкладка индекса ещё покажет ошибку. Это нормально и означает, что исправление сработало.

1. Страница отдаёт noindex

Самая частая причина, и её легче всего пропустить. Страница открывается в браузере как обычно, контент виден, никаких предупреждений нет. Но где-то в HTML есть строка, которая говорит Google: «не индексируй меня».

Как проверить:

curl -s https://example.com/page | grep 'name="robots"'

Ожидаемый результат: index, follow. Если вы видите noindex, остальные семь причин можно не проверять: проблема здесь.

Откуда берётся: настройка страницы в SEO-плагине, условие в шаблоне темы, настройка, перенесённая с тестового сайта, или заголовок X-Robots-Tag, который отправляет сервер. Проверьте и заголовок:

curl -sI https://example.com/page | grep -i x-robots-tag

2. robots.txt запрещает сканирование

Здесь важно различие: robots.txt запрещает сканирование, а не индексацию. Если на закрытую страницу ссылается достаточно других сайтов, Google может проиндексировать её только по адресу, так и не увидев содержимого. В результате в поиске появляется запись без описания.

Верно и обратное: если нужно удалить страницу из индекса, закрывать её в robots.txt неправильно. Если Google не может просканировать страницу, он не увидит и тег noindex. Правильно разрешить сканирование и поставить noindex.

Как проверить: сначала убедитесь, что файл существует. robots.txt, который отдаёт 404, встречается чаще, чем кажется.

curl -sI https://example.com/robots.txt | head -1

Затем в отчёте о файле robots.txt в Search Console посмотрите, какое правило какой адрес блокирует.

3. Canonical указывает на другой адрес

Тег canonical сообщает Google, где находится основная версия контента. Настройте его неправильно, и вы сами вытолкнете свою страницу из индекса.

Как проверить:

curl -s https://example.com/page | grep canonical

Адрес в результате должен в точности совпадать с проверяемым, включая слеш в конце, наличие www и разницу между http и https.

Три частые ошибки:

  • Нет ссылки на себя: каждая страница, которая не является копией, должна указывать на собственный адрес.
  • Общий canonical: все страницы указывают на главную. Обычно причина в теге, жёстко прописанном в шаблоне, и из индекса выпадает весь сайт.
  • Петля canonical: страница A указывает на B, а B перенаправляет на A. Google не может выбрать ни одну.
Анимация петли canonical: страница A указывает canonical на B, B перенаправляет на A кодом 307, Googlebot застревает между ними; затем правильная настройка
Когда canonical и редирект указывают друг на друга, Google застревает между двумя адресами. При правильной настройке canonical указывает на основной адрес, который сразу отдаёт 200.

Canonical — это сильная подсказка, а не приказ. Если Google считает страницы действительно разными, он может проигнорировать ваш тег. В этом случае поле «Канонический URL, выбранный Google» в проверке URL будет отличаться от вашего.

4. Страница в цепочке редиректов

Адрес, который перенаправляет, в индекс не попадает, попадает его цель. Проблемы начинаются, когда цель тоже куда-то перенаправляет.

Как проверить:

curl -IL https://example.com/page

Посчитайте строки HTTP/2 30x в выводе. В идеале их ноль или одна. Если один и тот же адрес встречается дважды, это петля, и страница не проиндексируется никогда.

Проверка цепочки редиректов командой curl -IL: цепочка, которая отдаёт 200 после 301 и 302, и чистый адрес, сразу отдающий 200
Первый адрес отдаёт 200 после двух редиректов, второй — сразу. Внутренние ссылки и карта сайта всегда должны вести на конечный адрес.

Важен и код ответа:

Код Значение Когда использовать
301 Постоянный Адрес изменился навсегда
302 Временный Краткосрочное перенаправление
307 Временный, метод сохраняется Уровень сервера или фреймворка
308 Постоянный, метод сохраняется Современный аналог 301

Если использовать 302 для постоянного переезда, передача сигналов задерживается. Если переезд постоянный, ставьте 301 или 308.

5. Просканирована, но не проиндексирована

Это сообщение не техническая ошибка. Google увидел страницу, прочитал её и решил, что добавлять её в индекс не стоит. Неприятно, но диагноз ясен.

Типичные причины: страница почти повторяет другую страницу, контент поверхностный по сравнению с другими результатами по этому запросу или это автоматически созданная страница списка или тега.

Что делать: в коде исправлять нечего. Добавьте на страницу то, чего человек с этим запросом не найдёт в другом месте: собственные данные, собственные измерения, собственные скриншоты. Если это невозможно, объедините страницу с другой или удалите её. Одна сильная страница лучше пяти слабых на ту же тему.

6. Обнаружена, но не просканирована

Google знает адрес, но до сканирования очередь ещё не дошла. Обычно причин две: краулинговый бюджет сайта низкий или на страницу мало ссылок внутри сайта.

Значение краулингового бюджета для небольших сайтов преувеличено. На сайте из нескольких сотен страниц он редко бывает настоящей проблемой. Как правило, дело во внутренней перелинковке: если на страницу никто не ссылается, Google считает её неважной.

Что делать:

  • Добавьте страницу в карту сайта и отправьте карту сайта в Search Console.
  • Поставьте на страницу контекстные ссылки из связанных материалов. Ссылки в меню подвала недостаточно; ссылка из текста с осмысленным анкором гораздо сильнее.
  • Один раз запросите индексирование в инструменте проверки URL. Если технических препятствий нет, обычно это срабатывает в тот же день.

7. Ложная ошибка 404

Страница отдаёт код 200, но Google воспринимает её содержимое как «здесь ничего нет». Чаще всего это категории, в которых ещё нет записей, страницы поиска без результатов и удалённые карточки товаров.

У современных JavaScript-фреймворков есть коварный вариант: фреймворк показывает компонент 404, а HTTP-код остаётся 200. Пользователь видит правильную страницу, а Google получает неправильный сигнал.

Как проверить: придумайте несуществующий адрес и посмотрите на код ответа.

curl -sI https://example.com/takoy-stranitsy-net | head -1

Ожидается 404. Если приходит 200, ваш сайт сообщает Google, что любой придуманный адрес существует.

Что делать: если страницы действительно нет, отдавайте 404. Если она пока пустая, добавьте контент или закройте её через noindex, пока она не заполнится.

8. Сломана настройка hreflang

На многоязычных сайтах hreflang сообщает Google, какую версию показывать посетителю на каком языке. При ошибках в настройке Google считает языковые версии копиями друг друга и часть из них не индексирует.

Четыре правила:

  • Каждый целевой адрес должен сразу отдавать 200. Одна цель с редиректом делает недействительным весь набор на этой странице.
  • Каждая страница должна указывать и на себя.
  • Ссылки должны быть взаимными: если страница A указывает на B, то B должна указывать на A.
  • Задайте x-default: туда попадают посетители, язык которых не совпал ни с одной версией.

Как проверить:

curl -s https://example.com/ | grep -o 'hreflang="[^"]*" href="[^"]*"'

Проверьте каждый адрес из вывода по очереди командой curl -I.

В каком порядке проверять

Порядок важен: проблема выше по списку делает бессмысленными те, что ниже. Внутренние ссылки не помогут странице, которая отдаёт noindex.

Шаг Проверка Ожидается
1 Метатег robots index, follow
2 Доступ в robots.txt 200, без запрета
3 HTTP-код ответа 200
4 Цепочка редиректов 0 или 1 шаг
5 Canonical Указывает на себя
6 Цели hreflang Все отдают 200
7 Внутренние ссылки Хотя бы одна контекстная ссылка
8 Глубина контента Отвечает на запрос

Первые шесть пунктов технические и однозначные: либо верно, либо нет. Последние два требуют оценки и времени.

Вывод

Большинство проблем с индексацией связаны не с контентом, а с тем, что страница сообщает Google. Хорошая новость: каждый из этих сигналов можно измерить отдельно, и большинство исправляется одной строкой.

На практике работает такой подход: сначала пройдите по порядку выше и уберите технические препятствия, затем один раз отправьте страницу на индексирование и поставьте на неё контекстную ссылку с другой страницы сайта. Когда техническое препятствие устранено, Google обычно действует быстро. Месяцами длится само препятствие, а не то, что происходит после его устранения.

Когда техническая сторона в порядке, наступает очередь авторитета. Если Google видит страницу и индексирует её, следующим фактором, от которого зависит её позиция, становится сила ссылок, ведущих на неё.

Частые вопросы

Почему мой сайт не отображается в Google?

Есть восемь распространённых причин: тег noindex, запрет в robots.txt, неверный canonical, цепочка редиректов, контент, который Google счёл недостаточно ценным, отсутствие внутренних ссылок, ложная ошибка 404 и сломанный hreflang. Статус в инструменте проверки URL в Search Console показывает, какая из них ваша.

Сколько времени занимает индексация новой страницы?

Если технических препятствий нет, от нескольких часов до нескольких дней. Если вручную запросить индексирование, это может произойти в тот же день. На сайтах, которые Google сканирует часто, срок короче.

Повышает ли запрос на индексирование позиции?

Нет. Запрос только ставит страницу в очередь на сканирование и на ранжирование не влияет. Повторная отправка той же страницы тоже не продвигает её в очереди.

Чем noindex отличается от запрета в robots.txt?

robots.txt запрещает сканирование, noindex запрещает индексацию. Если хотите удалить страницу из индекса, не закрывайте её в robots.txt: если Google не сможет просканировать страницу, он не увидит тег noindex.

Нужен ли тег canonical на каждой странице?

Да, canonical со ссылкой на саму страницу — стандартная практика. Особенно это важно на сайтах, где могут появляться адреса с параметрами.

Статус «Просканирована, но пока не проиндексирована» — это ошибка?

Это не техническая ошибка. Он означает, что Google увидел страницу и решил, что индексировать её не стоит. Решение — усилить контент или объединить страницу с другой.

Гарантирует ли отправка карты сайта индексацию?

Нет. Карта сайта помогает обнаружению, но индексацию не гарантирует. После сканирования страница всё равно должна быть признана достойной индекса.

Что делать, если страница считается копией?

Сначала проверьте тег canonical и то, указывает ли он на саму страницу. Если проблема остаётся, две страницы, возможно, действительно слишком похожи: объедините их или сделайте одну заметно отличающейся.

Какой язык указывать в x-default на многоязычном сайте?

Версию, которую нужно показывать посетителям, чей язык не совпал ни с одной версией. Обычно это английская версия или страница выбора языка.

Что дальше

Если техническая основа проверена, следующий шаг — наращивание авторитета. Наши пакеты ссылок и цены собраны на странице услуги Hacklink. Если где-то застрянете, напишите нам.