В прошлом году при атрибуции фишингового домена нужно было доказать, что страница-клон банка существовала в конкретную неделю. Сайт давно лежал, whois перезаписан - но единственный снапшот на archive.today сохранил и вёрстку, и скрипт сбора данных карт с точной временной меткой. Вот так - не экспертиза сервера, не логи провайдера, а архивный снимок чужого сервиса. OSINT-расследования по веб-архивам строятся не на удаче, а на знании инструментов и умении их комбинировать. Ниже - разбор сервисов, утилит и пошаговых методов поиска удалённых страниц: от первого запроса до фиксации доказательств.
Wayback Machine для OSINT: восстановление истории сайта
Wayback Machine (web.archive.org) - главный инструмент для восстановления истории сайта. По данным Internet Archive, сервис хранит более 800 миллиардов снапшотов веб-страниц, собранных с 1996 года. Для OSINT-расследований по веб-архивам он полезен в трёх сценариях. Подробнее - в нашем руководстве по osint для специалиста по информационной безопасности.Первый - поиск удалённого контента. Компании, мошенники и госструктуры регулярно убирают страницы. Если краулер Wayback Machine успел сохранить снапшот - содержимое остаётся доступным.
Второй - отслеживание изменений. Календарный вид показывает все даты сохранения. Сравниваешь версии - видишь момент появления или исчезновения конкретного блока текста, скрипта, контактных данных. На практике именно так фиксируют, когда мошенник поменял реквизиты на сайте.
Третий - обнаружение утечек. По данным WebAsha (webasha.com), пентестеры находили в архивных версиях сайтов забытые
.env-файлы, конфиги с паролями и открытые .git-директории, давно удалённые с рабочего сервера. Сайт почистили, а Wayback Machine всё помнит.В терминологии MITRE ATT&CK работа с веб-архивами входит в тактику Reconnaissance: техники Search Open Websites/Domains (T1593), Search Victim-Owned Websites (T1594) и Search Open Technical Databases (T1596) описывают сбор информации из открытых веб-ресурсов, публичных баз и сайтов цели. T1593 и её подтехники (T1593.001 - Social Media, T1593.002 - Search Engines) наиболее точно соответствуют работе с веб-архивами, кэшем поисковиков и соцсетями.
Ограничение, о котором часто забывают: Wayback Machine архивирует только публично доступные страницы. Если сайт закрыл индексацию через
robots.txt с директивой User-agent: ia_archiver / Disallow: / - снапшотов за период блокировки не будет. Это частая причина пробелов в данных, и новички списывают их на «сервис не работает», хотя проблема на стороне цели.Ещё момент про безопасность самого сервиса: в сентябре 2024 года Internet Archive взломали - утечка затронула 31 миллион пользователей (по данным Have I Been Pwned со ссылкой на BleepingComputer, утекли email-адреса, пароли и логины). Если у вас есть аккаунт на archive.org - смените пароль и не дублируйте его на других ресурсах.
Archive.today - расследование с точной фиксацией
Archive.today (он же archive.is, archive.ph) работает принципиально иначе: снапшоты создаются не автоматическим краулером, а вручную - кто-то нажал кнопку «сохранить». Для цифровой форензики архивов это даёт два преимущества.Первое - точная временная метка. Каждый снапшот привязан к моменту сохранения, что удобно для привязки к таймлайну инцидента. Второе - высокая точность рендеринга. Archive.today сохраняет страницу «как есть» - со стилями, изображениями и JavaScript-элементами. Wayback Machine иногда теряет динамический контент (и это раздражает, когда нужен именно JS-код фишинговой формы).
По данным EBU Spotlight (spotlight.ebu.ch), archive.today часто содержит снапшоты удалённых постов из соцсетей, которые автоматический краулер Wayback Machine пропустил - потому что исследователь сохранил страницу до удаления. Тут работает человеческий фактор: кто-то увидел подозрительный пост, нажал «сохранить» - и через полгода этот снапшот становится уликой.
Ограничение: archive.today не предоставляет API для массовых запросов и часто блокирует запросы с IP датацентров, многих VPN и Tor exit-node из-за антибот-фильтров. Успешность доступа зависит от репутации конкретного IP - проверяйте заранее, чтобы не обнаружить блокировку в разгар расследования.
Поиск удалённых страниц сайта: пошаговая инструкция
Конкретный алгоритм - от URL до зафиксированного результата.Шаг 1. Определите URL и временной период. Расследуете фишинг - зафиксируйте домен и примерные даты активности. Восстанавливаете историю - определите интересующий диапазон. Чем точнее рамки, тем меньше мусора в выдаче.
Шаг 2. Проверьте Wayback Machine. Введите URL на web.archive.org. В календаре синие точки - успешные снапшоты, оранжевые - ошибки сервера. Откройте нужную дату и просмотрите архивную версию.
Шаг 3. Примените wildcard-поиск. Чтобы найти все сохранённые страницы домена (включая поддомены и скрытые директории), используйте формат:
Код:
https://web.archive.org/web/*/example.com/*
Шаг 4. Проверьте archive.today. Введите тот же URL - там могут быть снапшоты, отсутствующие в Wayback Machine. Два источника лучше одного, всегда.
Шаг 5. Зафиксируйте находку. Не полагайтесь на скриншоты - они легко оспариваются. Скачайте снапшот через Wayback Machine или сохраните в формате WACZ (Web Archive Collection Zip), пригодном для юридического использования. Сгенерируйте SHA-256 хеш файла - он подтвердит целостность данных после сохранения. Без хеша ваша находка - просто картинка, с хешем - доказательство.
Утилиты для сбора данных из веб-архивов
Для масштабных OSINT-расследований по веб-архивам ручной поиск неэффективен - кликать по календарю на сотне доменов можно до пенсии. CDX API от Internet Archive позволяет автоматизировать запросы через командную строку. Для работы сcurl ничего устанавливать не нужно - он предустановлен в большинстве ОС. Для Python потребуется requests (pip install requests).Пример запроса для получения снапшотов URL за конкретный год:
Код:
curl "https://web.archive.org/cdx/search/cdx?url=example.com&from=20230101&to=20231231&output=json&limit=50"
200, вы отсеиваете редиректы и ошибки - остаются «живые» версии.Инструменты форензики для веб-контента - сравнительная таблица
📚 Часть контента скрыта. Этот материал доступен участникам сообщества с рангом One Level или выше
Получить доступ просто — достаточно зарегистрироваться и проявить активность на форуме
Получить доступ просто — достаточно зарегистрироваться и проявить активность на форуме
Для начала хватит связки Wayback Machine + archive.today вручную. При переходе к систематической работе подключайте CDX API и ArchiveBox для локального хранения. ArchiveBox, кстати, удобен тем, что складывает всё к вам на диск - никакой зависимости от внешних сервисов.
Анализ архивных снимков сайта: цифровая форензика на практике
Собрать снапшоты - полдела. Вторая половина - анализ архивных снимков сайта с выводами, пригодными для отчёта.Сравнение версий. Открываете два снапшота одной страницы за разные даты. Ищете различия: изменённые контактные данные, появившиеся/исчезнувшие скрипты, смену юридической информации. Фиксация момента модификации критична при расследовании мошенничества. В одном кейсе именно так установили, что мошенник поменял ИНН на сайте за два дня до вывода денег.
Проверка HTTP-заголовков. В метаданных снапшота Wayback Machine доступны HTTP-заголовки оригинального ответа. Статус
200 OK подтверждает, что страница была «живой», а не редиректом или заглушкой. По рекомендации EBU Spotlight, результат нужно верифицировать минимум по двум независимым архивным источникам.Цепочка хранения (chain of custody). Для юридически значимых расследований скачайте архив в формате WARC/WACZ, сгенерируйте SHA-256 хеш и запишите дату/время скачивания. Хеш гарантирует, что файл не изменён после сохранения - это ядро цифровой форензики архивов. Без этого шага вся работа может оказаться бесполезной: нашли, но не зафиксировали.
Поиск улик в кэше страниц: что делать, если архивы не помогли
Бывает, что ни Wayback Machine, ни archive.today не сохранили нужную страницу. Сайт блокировал архивацию, или страница существовала слишком мало времени. Поиск улик в кэше страниц из альтернативных источников - последний рубеж.Google Cache. Запрос
cache:example.com/page покажет последнюю кэшированную версию. Хранится недолго - от часов до нескольких дней. Увидели - сразу сохраняйте, завтра может не быть.Common Crawl (commoncrawl.org). Некоммерческий проект с петабайтами веб-данных. Индекс доступен через API, данные - через AWS S3. Покрытие шире Wayback Machine, но интерфейс рассчитан на тех, кто не боится командной строки и JSON.
Кэш социальных сетей. Telegram, Facebook, Twitter/X генерируют превью по Open Graph-тегам и хранят их независимо от оригинала. Удалённый пост мог оставить превью в чьём-то репосте. Иногда этот «огрызок» - единственное, что осталось.
Поисковики Yandex и Bing. Тоже хранят кэшированные версии, хотя срок ограничен.
Если ни один источник не дал результата - зафиксируйте сам факт отсутствия данных. Блокировка архивации через
robots.txt может указывать на намеренное сокрытие информации, и в отчёте по расследованию это тоже улика. «Ничего не нашли» - тоже результат, если правильно задокументирован.За пару лет работы с новичками в OSINT замечаю одну и ту же ошибку: Wayback Machine воспринимается как Google - ввёл URL, получил ответ, закрыл вкладку. На практике один снапшот без контекста ничего не доказывает. Архивный снимок - сырой материал. Доказательством он становится после перекрёстной проверки по двум-трём независимым источникам, фиксации хеша и привязки к таймлайну. Нередко OSINT-расследования по веб-архивам проваливаются не на этапе поиска, а на этапе документирования: аналитик нашёл удалённую страницу, но не зафиксировал цепочку хранения - и находка не принимается ни заказчиком, ни в суде. Веб-архивы - не волшебная кнопка «восстановить удалённое». Если сайт жил три часа и никто не сохранил снапшот - данные потеряны навсегда. Умение работать с архивами включает понимание их границ. Если хочешь не просто кликать по archive.org, а разобраться, как устроена информационная безопасность от фундамента - IB Basics на codeby.school про «как разобраться», не про «запомните терминологию».