Как находить новые и скрытые страницы любого сайта
Монитор новых и скрытых статей помогает заметить страницу в момент её первого обнаружения, даже если владелец сайта указал старую дату публикации, убрал материал с главной или изменил его позднее.
Обычный просмотр главной страницы не показывает полную картину. Новая статья может появиться только в RSS, Atom или XML-карте сайта. Иногда публикацию сразу размещают глубоко в структуре, закрывают от навигации либо датируют прошлым годом. Поэтому точный контроль строится не вокруг одной даты в тексте, а вокруг нескольких независимых признаков: когда URL впервые найден, где он обнаружен, присутствует ли ссылка на главной и что изменилось со времени предыдущей проверки.
Что считается новой публикацией
Новый URL — это адрес, которого не было в сохранённом снимке во время предыдущего успешного обхода. Chrona отдельно запоминает момент первого появления страницы. Дата, заявленная автором, сохраняется как дополнительный атрибут, но не заменяет дату обнаружения.
Такой подход нужен для материалов, опубликованных задним числом. Например, страницу добавили сегодня, а внутри указали 2020 год. Фильтр «Сегодня» всё равно покажет её как впервые найденную сегодня, а карточка получит отметку «Задним числом». Это позволяет отличить реальное появление URL от даты, которую владелец сайта может изменить вручную.
Какие источники проверяет монитор
Совпадение нескольких источников повышает надёжность результата. Если адрес одновременно найден в ленте и sitemap, это более сильный сигнал, чем одна дата на странице. Если URL есть в карте сайта или RSS, но отсутствует среди ссылок главной, монитор отмечает его как скрытый от главной страницы. Такая отметка не означает нарушение: она описывает только фактическое расположение ссылки.
Как проверить сайт
- Вставьте полный адрес домена в поле «Адрес проверяемого сайта».
- Выберите глубину обхода: 100, 250 или 500 URL.
- Нажмите «Выбрать и проверить» и дождитесь ответа сервера.
- При первом запуске дождитесь сообщения о создании базы: счётчик новых публикаций должен остаться нулевым.
- Запустите повторную проверку позже или включите автоматический интервал.
- Используйте периоды «Сегодня», «2 дня», «3 дня», «7 дней» и другие фильтры по моменту обнаружения.
Для каждого домена история хранится отдельно в браузере пользователя. Можно переключаться между сайтами, не смешивая их снимки. Результат доступен для выгрузки в JSON и CSV, поэтому список удобно сохранять, сортировать или анализировать в других программах.
Значение отметок в результатах
- Новый URL — адрес впервые появился после уже созданного базового снимка.
- Задним числом — страница обнаружена недавно, но авторская дата заметно старше момента обнаружения.
- Скрытый — URL найден через RSS или sitemap, однако ссылка не обнаружена на главной странице.
- Смена даты — заявленная дата отличается от значения, сохранённого при прошлом обходе.
- Текст изменён — цифровой отпечаток содержимого страницы изменился.
- Свежий сигнал, не факт — источник сообщает недавнюю активность, но данных пока недостаточно для категоричного вывода о новой публикации.
Почему старые статьи иногда выглядят новыми
Дата в sitemap может обозначать не публикацию, а техническое обновление шаблона, блока рекомендаций или комментариев. RSS также способен повторно поднять отредактированный материал. Поэтому профессиональный монитор не должен объявлять каждую свежую дату новой статьёй. Chrona разделяет факт первого появления URL, заявленные даты и сигналы изменения контента. Пользователь видит основание отметки и может проверить исходную страницу.
Точность повышается со временем: чем больше успешных снимков сравнивается, тем яснее история конкретного URL. Пустой или заблокированный обход не сохраняется как новая база и не стирает предыдущие данные. Это защищает историю от ложного обнуления, когда сайт временно недоступен или блокирует сервер дата-центра.
Ограничения проверки
Инструмент работает только с публично доступными страницами. Защита от автоматических запросов, обязательная авторизация, CAPTCHA, закрытый robots.txt или отсутствие публичных ссылок могут ограничить результат. В такой ситуации сообщение об отсутствии полученных URL не доказывает, что материалов на сайте нет. Монитор показывает диагностику источников и не подменяет неизвестный результат выдуманными данными.
Для наиболее точного наблюдения выполняйте проверки регулярно, не удаляйте историю браузера и оценивайте сразу несколько признаков. Момент обнаружения отвечает на вопрос «когда монитор впервые увидел URL», а не гарантирует точное время публикации на сервере владельца сайта.
Частые вопросы
Нужна ли регистрация?
Нет. Для использования интерфейса не требуется создавать аккаунт или вводить пользовательский API-ключ.
Будет ли видна статья с датой 2000 года, добавленная сегодня?
Да, если новый URL появился после базового снимка и был получен во время успешного обхода. Он попадёт в период по дате обнаружения и может получить отметку «Задним числом».
Почему первый запуск не показывает всё как новое?
Без предыдущего снимка невозможно доказать, какие страницы добавлены недавно. Поэтому первый обход формирует честную базу для будущего сравнения.
Что делать, если сайт не отдал ни одного URL?
Повторить проверку позднее и изучить диагностику. Нулевой ответ защищённого сервера не считается доказательством отсутствия статей и не заменяет сохранённую базу.
Отзывы пользователей
Ниже опубликованы мнения пользователей, уже взаимодействовавших с данным проектом. Изучите опыт других посетителей или поделитесь собственным отзывом — это поможет принять более взвешенное решение.