Тёмный стол аналитика с ультрашироким монитором: календарь Wayback Machine с отметками снапшотов и терминал с логом CDX API. Тёплый свет лампы и голубоватый отблеск экрана среди густых теней.


В прошлом году при атрибуции фишингового домена нужно было доказать, что страница-клон банка существовала в конкретную неделю. Сайт давно лежал, whois перезаписан - но единственный снапшот на archive.today сохранил и вёрстку, и скрипт сбора данных карт с точной временной меткой. Вот так - не экспертиза сервера, не логи провайдера, а архивный снимок чужого сервиса. OSINT-расследования по веб-архивам строятся не на удаче, а на знании инструментов и умении их комбинировать. Ниже - разбор сервисов, утилит и пошаговых методов поиска удалённых страниц: от первого запроса до фиксации доказательств.

Wayback Machine для OSINT: восстановление истории сайта​

Wayback Machine (web.archive.org) - главный инструмент для восстановления истории сайта. По данным Internet Archive, сервис хранит более 800 миллиардов снапшотов веб-страниц, собранных с 1996 года. Для OSINT-расследований по веб-архивам он полезен в трёх сценариях. Подробнее - в нашем руководстве по osint для специалиста по информационной безопасности.

Первый - поиск удалённого контента. Компании, мошенники и госструктуры регулярно убирают страницы. Если краулер Wayback Machine успел сохранить снапшот - содержимое остаётся доступным.

Второй - отслеживание изменений. Календарный вид показывает все даты сохранения. Сравниваешь версии - видишь момент появления или исчезновения конкретного блока текста, скрипта, контактных данных. На практике именно так фиксируют, когда мошенник поменял реквизиты на сайте.

Третий - обнаружение утечек. По данным WebAsha (webasha.com), пентестеры находили в архивных версиях сайтов забытые .env-файлы, конфиги с паролями и открытые .git-директории, давно удалённые с рабочего сервера. Сайт почистили, а Wayback Machine всё помнит.

В терминологии MITRE ATT&CK работа с веб-архивами входит в тактику Reconnaissance: техники Search Open Websites/Domains (T1593), Search Victim-Owned Websites (T1594) и Search Open Technical Databases (T1596) описывают сбор информации из открытых веб-ресурсов, публичных баз и сайтов цели. T1593 и её подтехники (T1593.001 - Social Media, T1593.002 - Search Engines) наиболее точно соответствуют работе с веб-архивами, кэшем поисковиков и соцсетями.

Ограничение, о котором часто забывают: Wayback Machine архивирует только публично доступные страницы. Если сайт закрыл индексацию через robots.txt с директивой User-agent: ia_archiver / Disallow: / - снапшотов за период блокировки не будет. Это частая причина пробелов в данных, и новички списывают их на «сервис не работает», хотя проблема на стороне цели.

Ещё момент про безопасность самого сервиса: в сентябре 2024 года Internet Archive взломали - утечка затронула 31 миллион пользователей (по данным Have I Been Pwned со ссылкой на BleepingComputer, утекли email-адреса, пароли и логины). Если у вас есть аккаунт на archive.org - смените пароль и не дублируйте его на других ресурсах.

Archive.today - расследование с точной фиксацией​

Archive.today (он же archive.is, archive.ph) работает принципиально иначе: снапшоты создаются не автоматическим краулером, а вручную - кто-то нажал кнопку «сохранить». Для цифровой форензики архивов это даёт два преимущества.

Первое - точная временная метка. Каждый снапшот привязан к моменту сохранения, что удобно для привязки к таймлайну инцидента. Второе - высокая точность рендеринга. Archive.today сохраняет страницу «как есть» - со стилями, изображениями и JavaScript-элементами. Wayback Machine иногда теряет динамический контент (и это раздражает, когда нужен именно JS-код фишинговой формы).

По данным EBU Spotlight (spotlight.ebu.ch), archive.today часто содержит снапшоты удалённых постов из соцсетей, которые автоматический краулер Wayback Machine пропустил - потому что исследователь сохранил страницу до удаления. Тут работает человеческий фактор: кто-то увидел подозрительный пост, нажал «сохранить» - и через полгода этот снапшот становится уликой.

Ограничение: archive.today не предоставляет API для массовых запросов и часто блокирует запросы с IP датацентров, многих VPN и Tor exit-node из-за антибот-фильтров. Успешность доступа зависит от репутации конкретного IP - проверяйте заранее, чтобы не обнаружить блокировку в разгар расследования.

Поиск удалённых страниц сайта: пошаговая инструкция​

Конкретный алгоритм - от URL до зафиксированного результата.

Шаг 1. Определите URL и временной период. Расследуете фишинг - зафиксируйте домен и примерные даты активности. Восстанавливаете историю - определите интересующий диапазон. Чем точнее рамки, тем меньше мусора в выдаче.

Шаг 2. Проверьте Wayback Machine. Введите URL на web.archive.org. В календаре синие точки - успешные снапшоты, оранжевые - ошибки сервера. Откройте нужную дату и просмотрите архивную версию.

Шаг 3. Примените wildcard-поиск. Чтобы найти все сохранённые страницы домена (включая поддомены и скрытые директории), используйте формат:
Код:
https://web.archive.org/web/*/example.com/*
Это покажет полный индекс всех URL, сохранённых для домена. Wildcard-поиск - штука мощная: обнаруживает страницы, о которых вы не знали. Забытые админ-панели, тестовые поддомены, PDF-документы - всё это всплывает как буйком.

Шаг 4. Проверьте archive.today. Введите тот же URL - там могут быть снапшоты, отсутствующие в Wayback Machine. Два источника лучше одного, всегда.

Шаг 5. Зафиксируйте находку. Не полагайтесь на скриншоты - они легко оспариваются. Скачайте снапшот через Wayback Machine или сохраните в формате WACZ (Web Archive Collection Zip), пригодном для юридического использования. Сгенерируйте SHA-256 хеш файла - он подтвердит целостность данных после сохранения. Без хеша ваша находка - просто картинка, с хешем - доказательство.

Утилиты для сбора данных из веб-архивов​

Для масштабных OSINT-расследований по веб-архивам ручной поиск неэффективен - кликать по календарю на сотне доменов можно до пенсии. CDX API от Internet Archive позволяет автоматизировать запросы через командную строку. Для работы с curl ничего устанавливать не нужно - он предустановлен в большинстве ОС. Для Python потребуется requests (pip install requests).

Пример запроса для получения снапшотов URL за конкретный год:
Код:
curl "https://web.archive.org/cdx/search/cdx?url=example.com&from=20230101&to=20231231&output=json&limit=50"
Ответ содержит временные метки, HTTP-статусы и MIME-типы. Фильтруя по статусу 200, вы отсеиваете редиректы и ошибки - остаются «живые» версии.

Инструменты форензики для веб-контента - сравнительная таблица​

📚 Часть контента скрыта. Этот материал доступен участникам сообщества с рангом One Level или выше
Получить доступ просто — достаточно зарегистрироваться и проявить активность на форуме


Для начала хватит связки Wayback Machine + archive.today вручную. При переходе к систематической работе подключайте CDX API и ArchiveBox для локального хранения. ArchiveBox, кстати, удобен тем, что складывает всё к вам на диск - никакой зависимости от внешних сервисов.

Анализ архивных снимков сайта: цифровая форензика на практике​

Собрать снапшоты - полдела. Вторая половина - анализ архивных снимков сайта с выводами, пригодными для отчёта.

Сравнение версий. Открываете два снапшота одной страницы за разные даты. Ищете различия: изменённые контактные данные, появившиеся/исчезнувшие скрипты, смену юридической информации. Фиксация момента модификации критична при расследовании мошенничества. В одном кейсе именно так установили, что мошенник поменял ИНН на сайте за два дня до вывода денег.

Проверка HTTP-заголовков. В метаданных снапшота Wayback Machine доступны HTTP-заголовки оригинального ответа. Статус 200 OK подтверждает, что страница была «живой», а не редиректом или заглушкой. По рекомендации EBU Spotlight, результат нужно верифицировать минимум по двум независимым архивным источникам.

Цепочка хранения (chain of custody). Для юридически значимых расследований скачайте архив в формате WARC/WACZ, сгенерируйте SHA-256 хеш и запишите дату/время скачивания. Хеш гарантирует, что файл не изменён после сохранения - это ядро цифровой форензики архивов. Без этого шага вся работа может оказаться бесполезной: нашли, но не зафиксировали.

Поиск улик в кэше страниц: что делать, если архивы не помогли​

Бывает, что ни Wayback Machine, ни archive.today не сохранили нужную страницу. Сайт блокировал архивацию, или страница существовала слишком мало времени. Поиск улик в кэше страниц из альтернативных источников - последний рубеж.

Google Cache. Запрос cache:example.com/page покажет последнюю кэшированную версию. Хранится недолго - от часов до нескольких дней. Увидели - сразу сохраняйте, завтра может не быть.

Common Crawl (commoncrawl.org). Некоммерческий проект с петабайтами веб-данных. Индекс доступен через API, данные - через AWS S3. Покрытие шире Wayback Machine, но интерфейс рассчитан на тех, кто не боится командной строки и JSON.

Кэш социальных сетей. Telegram, Facebook, Twitter/X генерируют превью по Open Graph-тегам и хранят их независимо от оригинала. Удалённый пост мог оставить превью в чьём-то репосте. Иногда этот «огрызок» - единственное, что осталось.

Поисковики Yandex и Bing. Тоже хранят кэшированные версии, хотя срок ограничен.

Если ни один источник не дал результата - зафиксируйте сам факт отсутствия данных. Блокировка архивации через robots.txt может указывать на намеренное сокрытие информации, и в отчёте по расследованию это тоже улика. «Ничего не нашли» - тоже результат, если правильно задокументирован.

За пару лет работы с новичками в OSINT замечаю одну и ту же ошибку: Wayback Machine воспринимается как Google - ввёл URL, получил ответ, закрыл вкладку. На практике один снапшот без контекста ничего не доказывает. Архивный снимок - сырой материал. Доказательством он становится после перекрёстной проверки по двум-трём независимым источникам, фиксации хеша и привязки к таймлайну. Нередко OSINT-расследования по веб-архивам проваливаются не на этапе поиска, а на этапе документирования: аналитик нашёл удалённую страницу, но не зафиксировал цепочку хранения - и находка не принимается ни заказчиком, ни в суде. Веб-архивы - не волшебная кнопка «восстановить удалённое». Если сайт жил три часа и никто не сохранил снапшот - данные потеряны навсегда. Умение работать с архивами включает понимание их границ. Если хочешь не просто кликать по archive.org, а разобраться, как устроена информационная безопасность от фундамента - IB Basics на codeby.school про «как разобраться», не про «запомните терминологию».
 
Мы в соцсетях:

Взломай свой первый сервер и прокачай скилл — Начни игру на HackerLab

🚀 Первый раз на Codeby?
Гайд для новичков: что делать в первые 15 минут, ключевые разделы, правила
Начать здесь →
🧭 Навигатор · ИБ 2026
Не знаешь, какой трек твой?
5 направлений ИБ, реальные зарплаты и точка входа для каждого — в одном треде.
JuniorSenior+
100K → 600K+ ₽ /мес
Открыть навигатор →
🔴 Свежие CVE, 0-day и инциденты
То, о чём ChatGPT ещё не знает — обсуждаем в реальном времени
Threat Intel →
💼 Вакансии и заказы в ИБ
Pentest, SOC, DevSecOps, bug bounty — работа и проекты от проверенных компаний
Карьера в ИБ →

HackerLab