Wayback machine для Osint: как находить старые данные и Url домена

OSINT для ленивых: как использовать Wayback Machine для поиска старых данных

Среди инструментов OSINT особое место занимают консольные утилиты, которые помогают исследовать не только текущее состояние веб-ресурсов, но и их прошлые версии. Многие знают, что такое Wayback Machine, однако далеко не все понимают, какую практическую пользу можно извлечь из веб-архива - например, при анализе собственной инфраструктуры, исследовании цифрового следа или работе в рамках bug bounty.

В старых копиях сайтов иногда сохраняются сведения, которые давно исчезли из актуальной версии ресурса:

- прежние API-эндпойнты;
- административные панели и тестовые разделы вроде `/admin`, `/test`, `/debug`;
- резервные копии и конфигурационные файлы с расширениями `.bak`, `.sql`, `.old`;
- забытые каталоги и служебные файлы;
- JavaScript-код со старыми настройками и параметрами;
- устаревшие версии приложений, в которых еще могли присутствовать уже исправленные уязвимости.

Главное преимущество такого подхода - пассивный характер разведки. Запросы направляются не к целевому серверу, а к публичным архивам, поэтому нагрузка на сайт отсутствует, а вероятность обнаружения самого факта поиска минимальна. На практике достаточно знать, как пользоваться Wayback Machine, чтобы начать находить старые URL, страницы и версии файлов.

Waybackurls: простой доступ к истории домена

Waybackurls - консольная утилита на Go, созданная tomnomnom. Она обращается к CDX API сервиса archive.org и получает перечень URL, которые когда-либо попадали в архив по указанному домену. В зависимости от параметров можно учитывать и поддомены.

Инструмент не сканирует сайт напрямую. Он лишь извлекает данные о ранее сохраненных снимках, поэтому целевой сервер не получает запросов от waybackurls. Ограничение очевидно: если нужный период или страница не были заархивированы, получить их с помощью этой программы не получится.

Утилита особенно полезна на этапе первичной разведки. Она способна показать пути, API-методы и страницы, которые отсутствуют в нынешней версии сайта, но раньше были доступны. Дополнительную ценность представляют параметры в URL - например, `id`, `redirect`, `file` и другие. В разрешенных сценариях их можно анализировать на наличие IDOR, открытых перенаправлений, LFI или XSS.

При этом сам перечень адресов не означает наличие уязвимости. Это только материал для последующей проверки, причем любые активные действия допустимы исключительно в пределах разрешенного scope: на собственных ресурсах, в рамках публичной программы bug bounty или по договору на тестирование.

Для работы с waybackurls требуется установленный Go. Утилита хорошо подходит для быстрых пайплайнов, автоматизации и случаев, когда достаточно одного источника - Wayback Machine.

Gau: больше архивов и гибкая фильтрация

Если нужно расширить охват, применяется gau - инструмент, который собирает URL сразу из нескольких публичных баз. В его перечень входят Wayback Machine, Common Crawl, AlienVault OTX и URLScan. Благодаря этому результаты часто оказываются заметно полнее, чем при использовании только одного архива.

Gau также написан на Go и поддерживает передачу домена как аргументом, так и через стандартный ввод. Функциональность инструмента шире: результаты можно фильтровать по расширениям файлов, HTTP-статусам и MIME-типам, а также объединять адреса, различающиеся только значениями параметров.

Полезные параметры включают:

- `--blacklist` - исключение расширений, например `png,jpg,gif`;
- `--fc` - исключение определенных HTTP-статусов;
- `--mc` - вывод только выбранных статусов;
- `--ft` и `--mt` - фильтрация по MIME-типу;
- `--fp` - удаление дублей URL, отличающихся значениями параметров;
- `--from` и `--to` - ограничение временного диапазона в формате `YYYYMM`;
- `--providers` - выбор конкретных источников;
- `--subs` - подключение поддоменов;
- `--json` - вывод в формате JSON;
- `--threads` - настройка количества потоков.

Также предусмотрены параметры `--proxy`, `--timeout`, `--retries` и `--config`. Полный перечень опций отображается командой `gau -h`.

Установить gau можно через Go-модуль, скачав готовый бинарный файл из Releases, собрав программу из исходников или воспользовавшись Docker. Путь `/v2/cmd/gau` в структуре проекта является частью организации модуля, а не ошибкой.

Что выбрать: waybackurls или gau

Waybackurls остается удобным легковесным решением. Он быстро обращается к Wayback Machine, почти не требует настройки и хорошо вписывается в простые сценарии автоматизации. Gau больше подходит для комплексной разведки, когда важна полнота и необходимо сравнить данные сразу из нескольких архивов.

На практике инструменты можно применять последовательно: сначала собрать широкий набор URL через gau, затем отдельно проверить результаты Wayback Machine и отфильтровать потенциально интересные пути. Такой подход помогает сократить количество дублей и уделить внимание наиболее значимым находкам.

Как анализировать результаты

Самая ценная часть работы начинается после получения списка адресов. Сначала имеет смысл сгруппировать URL по путям, расширениям и параметрам. Отдельно стоит изучить административные разделы, файлы резервных копий, конфигурации, старые API и домены третьего уровня.

При анализе JavaScript-файлов полезно сравнивать версии, сохраненные в разные даты. Так можно увидеть удаленные маршруты, названия внутренних сервисов, тестовые функции и забытые переменные окружения. Однако обнаружение ключа или токена в архиве еще не доказывает его актуальность: секрет мог быть отозван, заменен или ограничен по правам.

Архивные данные также полезны для защиты собственного проекта. Регулярный просмотр сохраненных копий позволяет понять, какие служебные страницы и файлы когда-либо были опубликованы, не попали ли в публичный доступ конфигурации и не раскрывает ли старый интерфейс лишнюю информацию. Поэтому архив веб-сайтов Wayback Machine полезен не только исследователям, но и владельцам инфраструктуры.

Важно учитывать неполноту архивов: снимки делаются нерегулярно, часть страниц исключается из индексации, динамический контент может сохраняться некорректно, а robots.txt и ограничения доступа иногда влияют на результат. Поэтому Wayback Machine и другие OSINT инструменты для анализа веб-сайтов следует рассматривать как источники вспомогательной информации, а не как полную копию истории ресурса.

В итоге поиск удалённых страниц через Wayback Machine и связанные с ним сервисы остается одним из наиболее экономных способов расширить область разведки. Он не заменяет проверку актуальной инфраструктуры, но помогает обнаружить забытые URL, понять эволюцию приложения и вовремя закрыть старые точки входа - при условии, что дальнейшее тестирование проводится законно и с разрешения владельца.

Прокрутить вверх