
Wayback Machine — это веб-архив сайтов на web.archive.org, который ведёт некоммерческая организация Internet Archive: её краулеры периодически сохраняют копии страниц, и любую из них можно открыть по дате. Чтобы посмотреть старую версию сайта, введите адрес в строку поиска на web.archive.org и выберите день в календаре снимков.
Что такое Wayback Machine и чем веб-архив отличается от кэша
Интернет-архив хранит не «сайт целиком», а отдельные снимки (captures) конкретных URL на конкретный момент. Каждый снимок — это HTML страницы и те ресурсы, которые краулер успел забрать: картинки, CSS, скрипты. Если какой-то файл не был сохранён, в снимке он подтягивается из соседней по времени копии или не отображается вовсе. Поэтому старая версия страницы иногда выглядит «собранной из разных лет»: текст от одной даты, а логотип — от другой.
От кэша поисковика архив отличается главным: он хранит историю, а не одну последнюю копию. Кэш показывал, как страница выглядела при последнем обходе, и исчезал вместе с ней; у Google эта функция и вовсе отключена. Снимки в архиве остаются доступны годами, даже когда домен давно сменил владельца.
Кому это нужно на практике:
- владельцу сайта — восстановить удалённый текст, старую структуру URL или вспомнить, что стояло на странице до неудачного релиза;
- SEO-специалисту — собрать список старых адресов для 301-редиректов после переезда;
- покупателю домена — узнать, что на нём было раньше, до того как платить;
- юристу или журналисту — зафиксировать, что и когда было опубликовано (как дополнительный, а не единственный источник).
Как пользоваться Wayback Machine: старая версия сайта за минуту
- Откройте web.archive.org и вставьте в поле поиска адрес: домен (
example.ru) или полный URL страницы. - Над календарём появится полоса по годам: высота столбика показывает, сколько снимков сделано в этот год. Кликните нужный год.
- В календаре дни со снимками отмечены кружками. Цвет кружка — код ответа, который получил краулер: синий — 2xx (страница открылась), зелёный — 3xx (редирект), оранжевый — 4xx (например, 404), красный — 5xx (ошибка сервера).
- Наведите курсор на день и выберите время снимка. Откроется сохранённая копия с панелью Wayback сверху, по которой можно листать соседние снимки.
Ссылки внутри снимка тоже ведут в архив: вы переходите по старому сайту, и Wayback подставляет ближайшую по дате копию каждой страницы. Если нужной копии нет, появится сообщение «Hrm. Wayback Machine has not archived that URL» с предложением сохранить страницу сейчас.
Кроме календаря на странице результатов есть вкладки Collections (из какой коллекции пришёл снимок), Changes (сравнение двух снимков с подсветкой изменений), Summary (типы файлов по годам), Site Map и URLs — список всех сохранённых адресов сайта.
Поиск в веб-архиве по дате и маске URL
Зная адресную схему, в архив можно попадать сразу, без календаря. Метка времени — 14 цифр в формате ГГГГММДДччммсс по UTC, её можно сокращать.
| Адрес | Что откроется |
|---|---|
web.archive.org/web/example.ru | самый свежий снимок главной |
web.archive.org/web/2016/example.ru | снимок, ближайший к указанному году |
web.archive.org/web/20160315120000/example.ru/contacts | копия, ближайшая к 15 марта 2016, 12:00 UTC |
web.archive.org/web/2016*/example.ru | календарь снимков за 2016 год |
web.archive.org/web/*/example.ru/* | список всех сохранённых URL сайта (вкладка URLs) |
web.archive.org/web/*/example.ru/blog/* | только адреса внутри раздела /blog/ |
web.archive.org/web/20160315id_/example.ru | исходный HTML без панели Wayback и без переписанных ссылок |
Маска со звёздочкой в конце показывает все страницы, которые архив видел на домене, с датами первого и последнего снимка. Так находят удалённые статьи, старые PDF-прайсы и страницы, о которых забыли сами владельцы.
Модификатор id_ после метки времени отдаёт «сырую» копию: без встроенной панели, без замены ссылок на архивные. Именно её стоит скачивать, если вы восстанавливаете текст или вёрстку, — иначе в HTML окажутся служебные скрипты архива.
Как проверить наличие снимка из командной строки
У Internet Archive есть открытые API. Availability API отвечает, есть ли снимок рядом с нужной датой:
curl -s "https://archive.org/wayback/available?url=example.ru×tamp=20160101"
В ответе JSON с полем archived_snapshots.closest: адрес снимка, метка времени и HTTP-статус. Пустой объект archived_snapshots означает, что копий нет. В Windows то же самое делается в PowerShell:
Invoke-RestMethod "https://archive.org/wayback/available?url=example.ru" | Select-Object -ExpandProperty archived_snapshots
Для полного списка используется CDX API. Команда ниже выводит уникальные адреса сайта, которые когда-либо отдавали код 200:
curl -s "https://web.archive.org/cdx/search/cdx?url=example.ru/*&fl=original&filter=statuscode:200&collapse=urlkey" > old-urls.txt
Параметр collapse=urlkey схлопывает повторные снимки одного адреса, from=2015&to=2018 ограничивает период, output=json меняет формат. Этот файл — готовое сырьё для карты редиректов после переезда.
Почему страницы нет в веб-архиве
Отсутствие снимка не значит, что страницы не существовало. Типичные причины:
- Краулер туда не дошёл. Архив обходит сеть выборочно: глубокие страницы малоизвестных сайтов, на которые никто не ссылается, могут не попасть в него ни разу. Главная сохраняется чаще, внутренние разделы — реже.
- Контент рисуется JavaScript. Если сайт — одностраничное приложение, которое получает данные через API после загрузки, в снимке окажется пустой каркас или вечный индикатор загрузки.
- Нужна авторизация. Личные кабинеты, закрытые группы, лента VK и большинство страниц за логином в архиве выглядят как форма входа.
- Владелец исключил сайт. По запросу владельца снимки скрываются, и Wayback показывает сообщение, что URL исключён (excluded).
- Сервер отдавал ошибку. Если в день обхода сайт отвечал 403, 503 или блокировал ботов по User-Agent, в календаре будет оранжевая или красная отметка вместо копии.
- Адрес записан иначе. Схему (
http/https) иwwwархив обычно приводит к одному виду, а вот параметры запроса считает частью адреса. Попробуйте маскуexample.ru/*и найдите нужный адрес в списке.
С видео отдельная история. Страницы YouTube в архиве есть, но сам видеопоток, как правило, не сохраняется: плеер в снимке не воспроизводится. Рассчитывать на архив как на способ скачать ролик не стоит.
Как сохранить страницу в веб-архив: Save Page Now
Ждать, пока краулер придёт сам, необязательно. На главной web.archive.org справа есть форма Save Page Now: вставьте URL и нажмите «Save Page». Через несколько секунд или минут появится ссылка на новый снимок. То же самое работает прямой ссылкой:
https://web.archive.org/save/https://example.ru/page
Для вошедших пользователей в форме доступны дополнительные опции: сохранить также страницы, на которые ссылается исходная (outlinks), сохранить страницу даже при ошибке, сделать скриншот. Официальное расширение архива для Chrome, Firefox, Edge и Safari добавляет кнопку сохранения прямо в браузер.
Владельцу сайта стоит сохранять ключевые страницы перед редизайном, сменой цен или правкой оферты и политики конфиденциальности.
Как удалить сайт из Wayback Machine
Владелец может попросить исключить свой сайт или отдельные страницы из публичного доступа. Справочный центр Internet Archive направляет такие запросы на адрес info@archive.org. В письме укажите:
- точные URL или домен целиком и период, который нужно скрыть;
- подтверждение, что вы владелец: письмо с адреса на этом домене, либо готовность разместить на сайте файл или текст, который укажут сотрудники;
- причину — например, утечка персональных данных или устаревшая информация о бывшем сотруднике.
Раньше популярным способом был запрет в robots.txt для бота архива, но политика Internet Archive в отношении robots.txt менялась, и одна строчка в файле не гарантирует, что уже сделанные снимки исчезнут. Надёжный путь — запрос. Учтите и обратную сторону: если вы купили домен с плохой историей, исключение скроет её от любопытных, но не от поисковиков, у которых свои данные. Подробнее о том, какие файлы и бота как ограничивать, — в статье robots.txt: синтаксис и проверка.
Wayback Machine не работает: что проверить
Медленные ответы и временные отказы у бесплатного архива — обычное дело. Прежде чем искать проблему у себя:
- Проверьте, отвечает ли сервер архива вообще:
curl -I https://web.archive.org/. Код 200 или 302 — сервис жив, таймаут или 503 — проблема на его стороне. - Если главная открывается, а конкретный снимок нет — это обычно «тяжёлая» страница: архиву приходится подгружать сотни ресурсов. Откройте ту же копию с модификатором
id_, она легче. - Сообщение «This URL has been excluded from the Wayback Machine» — не сбой, а решение владельца.
- Ошибка при Save Page Now чаще всего означает, что целевой сайт не отдал страницу боту архива: заблокировал его, потребовал капчу или не ответил вовремя.
Если архив не открывается только у вас, а из других сетей работает, причина в провайдере или локальной сети — сверьтесь с DNS-резолвингом и маршрутом.
Как скачать сайт из веб-архива
Для одной страницы достаточно открыть её с id_ и сохранить через браузер или curl:
curl -s -o page.html "https://web.archive.org/web/20160315id_/https://example.ru/about"
Для всего сайта используют связку «список URL из CDX API + загрузка каждой копии с id_». Готовые утилиты этого класса существуют — самая известная, Ruby-гем wayback_machine_downloader, давно не обновлялась в исходном репозитории, поэтому смотрите на поддерживаемые форки. Что важно знать заранее:
- восстановленный сайт — это статический HTML; формы, поиск, корзина и всё, что работало на сервере, вернуть из архива нельзя;
- не спешите: архив ограничивает частоту запросов, и слишком активный скрипт получит отказы;
- тексты и изображения, восстановленные с чужого домена, остаются чужой интеллектуальной собственностью — купленный домен не даёт прав на контент прежнего владельца.
Веб-архив при покупке домена и в SEO
Перед покупкой домена — особенно освобождающегося — история в архиве обязательна. Откройте вкладку URLs и календарь и ищите:
- тематику, далёкую от вашей: казино, фарма, доски объявлений, дорвеи с тысячами сгенерированных страниц;
- периоды «заглушек» регистратора и парковок — они означают, что домен уже освобождался;
- резкую смену языка или страны сайта;
Архив даёт только содержимое. Кто владел доменом, когда он был зарегистрирован и продлевался, показывает WHOIS, а попадание в реестр Роскомнадзора — отдельная проверка. Про поиск владельца подробно — в статье как узнать, кому принадлежит домен, про охоту за дропами — в материале освобождающиеся домены.
В SEO архив решает две задачи. Первая — миграция: CDX API выдаёт все адреса, которые сайт когда-либо имел, и по этому списку проверяют, что каждый старый URL отдаёт 301 на новый, а не 404. Вторая — разбор просадки: сравнив снимки до и после падения трафика во вкладке Changes, видно, что именно поменялось — пропали тексты, сменились title, исчез блок ссылок. Порядок действий при переезде описан в чеклисте миграции сайта.
Альтернативы: archive.today и другие архивы
| Сервис | Как появляются копии | Сильная сторона | Ограничения |
|---|---|---|---|
| Wayback Machine (web.archive.org) | собственные краулеры + Save Page Now | история за много лет, календарь, CDX API, сравнение снимков | не всегда сохраняет JS-контент; снимки могут быть скрыты по запросу владельца |
| archive.today (archive.ph) | только по запросу пользователя | сохраняет отрисованную страницу и скриншот, хорошо справляется с динамическими сайтами | нет автоматического обхода: если страницу никто не сохранил, её нет; нет публичного API уровня CDX |
| Кэш поисковика | последний обход робота | быстро, если ещё доступен | одна копия без истории; у Google функция отключена |
| Своя резервная копия | бэкап хостинга или git | полный сайт с базой и серверной логикой | есть только у владельца и только если её настроили заранее |
archive.today удобно использовать вместе с Wayback: если в интернет-архиве страница сохранилась пустой из-за скриптов, её свежая копия в archive.today часто выглядит так, как её видит пользователь.
Как проверить домен вместе с его историей
Архив отвечает на вопрос «что здесь было». Чтобы понять, что с доменом сейчас, дополните его тремя проверками:
- WHOIS домена — дата регистрации, регистратор, срок оплаты и статусы. Молодая дата регистрации при длинной истории в архиве означает, что домен освобождался и был зарегистрирован заново.
- проверка в реестре Роскомнадзора — был ли домен или его IP в списке блокировок. Для купленного дропа это частая скрытая проблема.
- проверка HTTP-заголовков и доступности — что сайт отдаёт сейчас: код ответа, редиректы, сервер. Удобно сравнить с тем, что видел краулер архива.
Официальные инструкции по сервису — в справочном центре Internet Archive: Using the Wayback Machine и Wayback Machine General Information.
Частые вопросы
Сервис бесплатный?
Да. Просмотр снимков, сохранение страниц через Save Page Now и API бесплатны. Регистрация нужна только для дополнительных опций сохранения.
Как найти официальный сайт Wayback Machine?
Официальный адрес — web.archive.org, он входит в проект archive.org. Похожие домены с другими зонами или дефисами к Internet Archive не относятся.
Как часто архив сохраняет сайты?
Фиксированного расписания нет. Популярные страницы сохраняются часто, малоизвестные — редко или никогда. Если важна конкретная дата, сохраните страницу сами через Save Page Now.
Можно ли посмотреть в архиве старую страницу VK или YouTube?
Часть таких страниц есть, но из-за авторизации и JavaScript снимки нередко показывают форму входа или неработающий плеер. Видео в архиве, как правило, не воспроизводится.
Можно ли удалить из архива страницу чужого сайта?
Запрос рассматривается от владельца сайта или от человека, чьи права или персональные данные затронуты. Пишите на info@archive.org с точными URL и обоснованием.
Как посмотреть все страницы сайта в веб-архиве?
Откройте web.archive.org/web/*/example.ru/* или запросите CDX API с collapse=urlkey — получите список всех адресов, которые архив когда-либо видел на домене.