Ответ короткий. Есть ровно два класса причин, и они не смешиваются. Первый — вы сами закрыли страницу: мета-тегом noindex, заголовком X-Robots-Tag, правилом Disallow в robots.txt. Второй — Google страницу открыл, прочитал и не взял: в отчёте это «Страница просканирована, но пока не проиндексирована», «обнаружена, но пока не проиндексирована» или один из статусов про копии. Первый класс лечится правкой шаблона за час. Второй — работой над страницей и сайтом, и повторная отправка тут не помогает.
Разделить два класса можно за десять минут, не отвлекая разработчика. Достаточно инструмента проверки URL в Search Console, терминала с curl и внимательного взгляда на три поля: «Сканирование разрешено?», «Индексирование разрешено?», «Последнее сканирование». Если во всех трёх стоит «Да» и свежая дата, а страницы нет в индексе — это отказ алгоритма. Всё остальное — запрет владельца, и его надо искать в коде.
Ниже — порядок проверок, у каждого шага есть наблюдаемый результат. Не «проверьте noindex», а конкретная команда и строка, которую вы увидите в ответе.
Миф про «уберите noindex, и всё заработает»
Топ выдачи по этому запросу живёт формулой «проверьте robots.txt и noindex, если чисто — улучшайте контент». Формула верна на бумаге и ломается на практике в трёх местах.
Первое. Google читает мета-тег robots не только в <head>. Справка «Метатег robots и заголовок X-Robots-Tag» прямо говорит, что Google не требует размещать метатег в разделе head и учитывает его в <body>. Плагин или виджет, который вставил <meta name="robots" content="noindex"> посреди разметки, закрывает страницу так же надёжно, как правильный тег в шапке. А поиск по <head> его не найдёт.
Второе. Правило Disallow в robots.txt прячет от робота сам noindex. Google пишет об этом в справке «Как заблокировать индексирование»: если файл robots.txt запрещает доступ к странице, робот не сможет обработать её код и не обнаружит правило noindex, поэтому контент по-прежнему может появляться в выдаче. Отсюда парадоксальный статус «Проиндексировано, несмотря на блокировку в файле robots.txt». Два запрета не складываются — они мешают друг другу.
Третье. noindex в исходном HTML отменяет отрисовку. По справке «Основы JavaScript SEO», встретив noindex, Googlebot может пропустить отрисовку страницы и выполнение JavaScript, а попытка убрать тег скриптом «может не привести к желаемым результатам». Значит, «мы снимаем noindex на клиенте после логина» — не решение, а ловушка.
«Чтобы правило noindex работало, файл robots.txt не должен блокировать поисковому роботу доступ к странице». — Справка Google Search Central, «Как заблокировать индексирование с помощью правила noindex».
Из этого следует порядок: сначала снимаем все три запрета и доказываем, что Google их больше не видит. Только потом имеем право говорить про качество.
Восемь проверок от «нет в индексе» до точного диагноза
Шаг 1. Снять показания в инструменте проверки URL.
Откройте Search Console, вставьте полный URL в строку поиска сверху. Сразу смотрите карточку: «URL есть в индексе Google», «URL есть в индексе Google, но есть проблемы» или «URL нет в индексе Google». Разверните блок «Индексирование страниц» и выпишите четыре значения: «Сканирование разрешено?», «Индексирование разрешено?», «Последнее сканирование», «Каноническая страница, выбранная Google». Успех для нашей задачи — не «в индексе», а честная картина: например, «URL нет в индексе Google», сканирование «Да», индексирование «Нет», причина «Индексирование страницы запрещено тегом noindex». Это уже диагноз первого класса, идите к шагам 2–3. Провал — пустое поле «Последнее сканирование»: Google ещё не приходил, и остальные поля ничего не доказывают; тогда проверяйте доступность по шагу 2 и возвращайтесь через семь дней.
Шаг 2. Прочитать HTTP-ответ сервера глазами робота. В терминале:
bash
curl -sI -A "Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.ru/page/
Смотрите первую строку и заголовок x-robots-tag. Успех: HTTP/2 200 и заголовка x-robots-tag нет вовсе (или в нём нет noindex и none). Провал бывает четырёх видов, и каждый ведёт в свою сторону. x-robots-tag: noindex — запрет на уровне сервера, ищите его в конфиге Nginx/Apache, в плагине безопасности или в CDN. HTTP/2 301 или 302 — это не «почти 200»: Google индексирует конечный URL, поэтому повторите команду с флагом -L и проверяйте уже ту страницу, на которую ведёт цепочка. 404, 410 — страницы нет, разговор о noindex бессмыслен. 5xx или таймаут — сервер не отдаёт страницу роботу, и в GSC вы увидите провал в поле «Получение страницы». Мобильный User-Agent в команде не для красоты: роботу и человеку сервер может отвечать по-разному.
Шаг 3. Найти мета-тег по всему документу, а не по шапке. Та же команда без -I, с фильтром:
bash
curl -s -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://example.ru/page/ | grep -i -o -E '<meta[^>]+(name="?(robots|googlebot)"?)[^>]*>'
Успех: вывод пустой либо содержит только разрешающие значения вроде content="index, follow, max-image-preview:large". Провал: любая строка с noindex или none (none равен noindex, nofollow). Обратите внимание на тег googlebot: он закрывает страницу только от Google, и в Яндекс Вебмастере такая страница спокойно висит в «Страницах в поиске» — типичная ситуация, когда «в Яндексе есть, в Google нет». Нашли тег — ищите источник: в WordPress это галочка «Попросить поисковые системы не индексировать сайт» в разделе «Настройки → Чтение» (она выводит <meta name='robots' content='noindex, nofollow' /> на всех страницах) или настройка конкретной записи в SEO-плагине. На Tilda и в Битриксе — переключатель видимости в настройках страницы или раздела.
Шаг 4. Проверить, не прячет ли robots.txt сам noindex.
Откройте https://example.ru/robots.txt в браузере или через curl -s. Найдите блок User-agent: * и User-agent: Googlebot и сверьте каждое Disallow: с адресом вашей страницы. В Search Console раздел «Настройки → robots.txt» покажет, какую версию файла робот скачал последней. Успех: ни одно правило не совпадает с префиксом URL, а поле «Сканирование разрешено?» в шаге 1 стоит «Да». Провал: правило совпало. Тогда noindex из шага 3 Google не видел, и если страница в индексе с пометкой «Проиндексировано, несмотря на блокировку в файле robots.txt» — вы получили тот самый конфликт. Решение одно: открыть путь в robots.txt, оставить noindex, дождаться повторного обхода. Или наоборот, если страница нужна в поиске: убрать и Disallow, и noindex.
Шаг 5. Посмотреть отрисованную версию, а не исходник.
В инструменте проверки URL нажмите «Проверить страницу на сайте», дождитесь результата, откройте «Изучить просканированную страницу». Вкладка «HTML» — это документ после выполнения JavaScript; ищите в нём noindex через поиск по странице. Вкладка «Дополнительная информация» показывает HTTP-ответ, который получил робот, включая заголовки. Успех: в отрисованном HTML нет noindex, в заголовках нет x-robots-tag, скриншот совпадает с тем, что видит пользователь. Провал первого типа: noindex появился только в отрисованном HTML — его вставляет скрипт (так ведут себя некоторые SPA-роутеры на «не найденных» маршрутах и плагины A/B-тестов). Провал второго типа: скриншот пустой или обрезанный — ресурсы закрыты, страница отрисована не до конца, и Google оценивает не тот контент, что вы писали. Живая проверка отвечает «что робот увидит сегодня», карточка из шага 1 — «что он видел в прошлый раз». Это разные ответы.
Шаг 6. Прогнать список URL, если страница не одна.
Когда после релиза выпал раздел или весь сайт, проверять по одной странице — самообман. Соберите URL раздела из sitemap и прогоните пакетно: краулер вроде Screaming Frog покажет столбец Indexability со значением Non-Indexable и причину, а бесплатная проверка noindex по списку URL отдаст, на каких адресах из списка стоит запрет, без установки софта. Успех: ноль запрещённых URL в выгрузке. Провал: запрет нашёлся на части адресов — сгруппируйте их по шаблону страницы (категория, тег, пагинация) и найдите одну настройку, которая закрывает всю группу. Чинить по одному — путь в никуда.
Шаг 7. Признать отказ алгоритма и прочитать его формулировку.
Если шаги 2–5 чисты, а карточка говорит «URL нет в индексе Google», откройте «Индексирование → Страницы» и найдите страницу в списке причин. Формулировка — и есть диагноз. «Страница просканирована, но пока не проиндексирована»: Google был, прочитал, не выбрал; справка отчёта отдельно указывает, что заново отправлять запрос на сканирование не нужно. «Страница обнаружена, но пока не проиндексирована»: робот знает URL, но отложил обход — обычно сигнал про нагрузку на сервер или слабую внутреннюю перелинковку. «Страница является копией. Канонический вариант не выбран пользователем» и «Канонические версии не совпадают»: сверьте поле «Каноническая страница, выбранная Google» с вашим rel="canonical" — если они разные, Google считает страницу дублем и спорить с ним бесполезно, пока контент не отличается заметно. «Ложная ошибка 404»: страница отдаёт 200, но выглядит пустой или как «не найдено». Успех этого шага — не индексация, а точное имя причины. Провал — страницы нет ни в одной причине: значит, Google о ней не знает; добавьте её в sitemap и поставьте внутренние ссылки с индексируемых страниц.
Шаг 8. После правки доказать, что Google видит новую версию.
Сняли noindex, открыли robots.txt — вернитесь в инструмент проверки URL и сравните поле «Последнее сканирование» с датой правки. Если дата старше, GSC показывает старую версию, и статус «запрещено тегом noindex» будет висеть до следующего обхода. Нажмите «Проверить страницу на сайте»; в живой проверке поле «Индексирование разрешено?» должно стать «Да». Затем «Запросить индексирование» — помня, что число запросов на ресурс в сутки ограничено, и для сотен URL Google советует sitemap. Успех: через несколько дней (закладывайте до семи) карточка показывает свежую дату сканирования и «URL есть в индексе Google». Провал: дата обновилась, разрешения стоят «Да», а страница ушла в «просканирована, но пока не проиндексирована» — вы перевели её из первого класса во второй; дальше работает только контент и перелинковка.
Шесть способов проверки и где каждый врёт
| Метод | Кому подходит | Ожидаемая скорость | Риск | Когда НЕ использовать |
|---|---|---|---|---|
| Инструмент проверки URL (карточка) | Владелец сайта с доступом в GSC | Сразу | Показывает прошлый обход, а не текущее состояние | Сразу после правки шаблона — данные устарели |
| «Проверить страницу на сайте» + «Изучить просканированную страницу» | Все, у кого есть GSC | 1–2 минуты на URL | Живой результат не гарантирует индексацию | Для сотен URL — есть суточный лимит проверок |
curl -sI с User-Agent Googlebot | SEO-специалист, разработчик | Секунды | Не выполняет JavaScript, не увидит noindex из скрипта | Если сайт закрыт для чужих User-Agent на уровне WAF |
curl + grep по мета-тегам | Все, кто открыл терминал | Секунды | Пропустит <head>-only проверку — ищите по всему документу | Для контента, который собирается на клиенте |
| Пакетный чекер noindex или краулер | Линкбилдер, редактор с большим разделом | Минуты на тысячи URL | Не различает причины отказа алгоритма | Когда проблема в одной странице — избыточно |
Оператор site: в поиске | Быстрый взгляд без доступа к GSC | Сразу | Неполный и нестабильный — пустой результат не равен «нет в индексе» | Как доказательство в споре с разработчиком |
Вывод из таблицы категоричный: терминал отвечает «что отдал сервер», GSC отвечает «что понял Google». Верить одному без другого нельзя.

Типовые сбои: где диагноз ставят неверно
«Индексирование разрешено? Да» — и уверенность, что дело в техничке. Факт: все три разрешения стоят «Да», дата обхода свежая. Связь: люди продолжают искать скрытый noindex, меняют хостинг, чистят кэш. Утверждение, которое хочется сделать: «Google сломался». Опровержение: это и есть отказ алгоритма, у него в отчёте есть имя. По сути ответ из ветки на Хабре от представителя Google — «мы не обещаем обход и индексацию всего контента» — относится именно к этому классу.
Снял noindex, а GSC ругается вторую неделю. Факт: тег убран, curl чистый. Связь: карточка инструмента показывает последний обход, а не текущее состояние, и без запроса индексирования робот может не спешить. Утверждение: «noindex где-то остался». Опровержение: сверьте «Последнее сканирование» с датой правки, сделайте живую проверку — если там «Да», старый статус просто ещё не перезаписан.
Копия staging попала в прод вместе с галочкой. Факт: после релиза весь сайт выпал. Связь: на тестовом домене стояла галочка «Попросить поисковые системы не индексировать сайт» или X-Robots-Tag: noindex в конфиге, и конфиг уехал в продакшн. Утверждение: «Google наложил санкции». Опровержение: шаг 2 покажет заголовок за секунду, шаг 6 — масштаб. Санкции живут в отчёте «Меры, принятые вручную», и там будет пусто.
Редирект принят за проблему индексации. Факт: в отчёте статус «Страница с переадресацией». Связь: человек проверяет noindex на старом URL. Утверждение: «страница не индексируется». Опровержение: Google по справке индексирует целевой URL перенаправления; проверяйте конечный адрес, а старый в отчёте — норма.
Ложная 404 при коде 200. Факт: сервер отдаёт 200, шаблон рисует «товар не найден» или пустую категорию. Связь: Google определяет такие страницы по содержимому и помечает как «Ложная ошибка 404». Утверждение: «нужно ускорить индексацию». Опровержение: ускорять нечего — отдавайте честный 404/410 либо наполните страницу.
Цифры про долю каждого сбоя здесь намеренно не приводятся: публичной статистики с методологией по русскоязычным сайтам нет, а «по опыту, 60%» — не аргумент.
Вопросы, которые остаются после проверки
В: Почему страница не индексируется в Гугле, если noindex нет и robots.txt открыт? О: Потому что запрет владельца снят, а решение алгоритма — отдельный процесс. Смотрите точную причину в отчёте «Страницы»: «просканирована, но пока не проиндексирована», «обнаружена», «копия» или «ложная 404». У каждой свой следующий шаг, и повторная отправка не входит ни в один из них.
В: Как проверить noindex на странице без доступа к Search Console? О: Двумя командами curl: с флагом -I для заголовка x-robots-tag и без него с grep по <meta name="robots" и <meta name="googlebot" — по всему документу, включая <body>. Для noindex, который ставит JavaScript, без живой проверки в GSC не обойтись.
В: X-Robots-Tag noindex — как проверить и где он обычно прописан? О: curl -sI URL и строка x-robots-tag в ответе. Источник чаще всего — конфиг Nginx или .htaccess (правило для PDF, случайно зацепившее HTML), плагин безопасности, CDN или заголовок со staging.
В: «Страница просканирована, но пока не проиндексирована» — что делать, если техничка чистая? О: Не отправлять повторно — Google в справке отчёта пишет об этом прямо. Проверить, не дубль ли это (поле «Каноническая страница, выбранная Google»), добавить внутренние ссылки с индексируемых страниц, объединить или удалить похожие тонкие страницы, дать роботу повод вернуться.
В: Сколько ждать индексации после удаления noindex? О: Закладывайте до недели после «Запросить индексирование»; это ориентир из справки Google по новым страницам, не гарантия. Признак движения — обновившаяся дата в поле «Последнее сканирование». Нет движения через семь дней — проверьте, что живая проверка показывает «Индексирование разрешено? Да», и что страница есть в sitemap.
В: «Проиндексировано, несмотря на блокировку в файле robots.txt» — это ошибка Google? О: Нет, это ваш конфликт директив. Disallow не даёт роботу прочитать страницу, поэтому он не видит noindex, а ссылки с других сайтов всё равно затаскивают URL в индекс. Хотите закрыть — откройте путь в robots.txt и оставьте noindex.
В: Мета-тег robots в body считается? О: Для Google — да, справка это подтверждает. Поэтому виджет, вставивший noindex посреди страницы, закрывает её полностью. Ищите тег по всему HTML, а не в первых тридцати строках.
План на ближайшие десять минут
Откройте Search Console и вставьте проблемный URL. Выпишите три поля: «Сканирование разрешено?», «Индексирование разрешено?», «Последнее сканирование». Параллельно в терминале выполните curl -sI с User-Agent Googlebot и посмотрите первую строку и x-robots-tag. Затем curl -s | grep по мета-тегам robots и googlebot.
Три «Да» и чистый терминал — открывайте отчёт «Страницы»: ваша проблема названа словами Google, и это слова про контент, дубли или обход. Любое «Нет» — идите по шагам 2–5 к источнику запрета, снимите его, сделайте живую проверку и только потом жмите «Запросить индексирование».
В 2026–2028 годах ждать, что Google смягчит отбор, не стоит — это информированное мнение практиков, не статистика с источником. Умение отличить «закрыл сам» от «не взяли» становится базовым навыком владельца сайта: первое лечится за час, второе — только работой над страницей. Проверьте сами, что у вас. Дальше — официальная справка Google о правиле noindex на случай, если результат проверки вас удивит.