Skip to content
EN
← Все статьи

Wayback Machine: как пользоваться веб-архивом сайтов

Календарь снимков веб-архива и старая версия сайта в соседней вкладке

Wayback Machine — это веб-архив сайтов на web.archive.org, который ведёт некоммерческая организация Internet Archive: её краулеры периодически сохраняют копии страниц, и любую из них можно открыть по дате. Чтобы посмотреть старую версию сайта, введите адрес в строку поиска на web.archive.org и выберите день в календаре снимков.

Что такое Wayback Machine и чем веб-архив отличается от кэша

Интернет-архив хранит не «сайт целиком», а отдельные снимки (captures) конкретных URL на конкретный момент. Каждый снимок — это HTML страницы и те ресурсы, которые краулер успел забрать: картинки, CSS, скрипты. Если какой-то файл не был сохранён, в снимке он подтягивается из соседней по времени копии или не отображается вовсе. Поэтому старая версия страницы иногда выглядит «собранной из разных лет»: текст от одной даты, а логотип — от другой.

От кэша поисковика архив отличается главным: он хранит историю, а не одну последнюю копию. Кэш показывал, как страница выглядела при последнем обходе, и исчезал вместе с ней; у Google эта функция и вовсе отключена. Снимки в архиве остаются доступны годами, даже когда домен давно сменил владельца.

Кому это нужно на практике:

  • владельцу сайта — восстановить удалённый текст, старую структуру URL или вспомнить, что стояло на странице до неудачного релиза;
  • SEO-специалисту — собрать список старых адресов для 301-редиректов после переезда;
  • покупателю домена — узнать, что на нём было раньше, до того как платить;
  • юристу или журналисту — зафиксировать, что и когда было опубликовано (как дополнительный, а не единственный источник).

Как пользоваться Wayback Machine: старая версия сайта за минуту

  1. Откройте web.archive.org и вставьте в поле поиска адрес: домен (example.ru) или полный URL страницы.
  2. Над календарём появится полоса по годам: высота столбика показывает, сколько снимков сделано в этот год. Кликните нужный год.
  3. В календаре дни со снимками отмечены кружками. Цвет кружка — код ответа, который получил краулер: синий — 2xx (страница открылась), зелёный — 3xx (редирект), оранжевый — 4xx (например, 404), красный — 5xx (ошибка сервера).
  4. Наведите курсор на день и выберите время снимка. Откроется сохранённая копия с панелью Wayback сверху, по которой можно листать соседние снимки.

Ссылки внутри снимка тоже ведут в архив: вы переходите по старому сайту, и Wayback подставляет ближайшую по дате копию каждой страницы. Если нужной копии нет, появится сообщение «Hrm. Wayback Machine has not archived that URL» с предложением сохранить страницу сейчас.

Кроме календаря на странице результатов есть вкладки Collections (из какой коллекции пришёл снимок), Changes (сравнение двух снимков с подсветкой изменений), Summary (типы файлов по годам), Site Map и URLs — список всех сохранённых адресов сайта.

Поиск в веб-архиве по дате и маске URL

Зная адресную схему, в архив можно попадать сразу, без календаря. Метка времени — 14 цифр в формате ГГГГММДДччммсс по UTC, её можно сокращать.

АдресЧто откроется
web.archive.org/web/example.ruсамый свежий снимок главной
web.archive.org/web/2016/example.ruснимок, ближайший к указанному году
web.archive.org/web/20160315120000/example.ru/contactsкопия, ближайшая к 15 марта 2016, 12:00 UTC
web.archive.org/web/2016*/example.ruкалендарь снимков за 2016 год
web.archive.org/web/*/example.ru/*список всех сохранённых URL сайта (вкладка URLs)
web.archive.org/web/*/example.ru/blog/*только адреса внутри раздела /blog/
web.archive.org/web/20160315id_/example.ruисходный HTML без панели Wayback и без переписанных ссылок

Маска со звёздочкой в конце показывает все страницы, которые архив видел на домене, с датами первого и последнего снимка. Так находят удалённые статьи, старые PDF-прайсы и страницы, о которых забыли сами владельцы.

Модификатор id_ после метки времени отдаёт «сырую» копию: без встроенной панели, без замены ссылок на архивные. Именно её стоит скачивать, если вы восстанавливаете текст или вёрстку, — иначе в HTML окажутся служебные скрипты архива.

Как проверить наличие снимка из командной строки

У Internet Archive есть открытые API. Availability API отвечает, есть ли снимок рядом с нужной датой:

curl -s "https://archive.org/wayback/available?url=example.ru&timestamp=20160101"

В ответе JSON с полем archived_snapshots.closest: адрес снимка, метка времени и HTTP-статус. Пустой объект archived_snapshots означает, что копий нет. В Windows то же самое делается в PowerShell:

Invoke-RestMethod "https://archive.org/wayback/available?url=example.ru" | Select-Object -ExpandProperty archived_snapshots

Для полного списка используется CDX API. Команда ниже выводит уникальные адреса сайта, которые когда-либо отдавали код 200:

curl -s "https://web.archive.org/cdx/search/cdx?url=example.ru/*&fl=original&filter=statuscode:200&collapse=urlkey" > old-urls.txt

Параметр collapse=urlkey схлопывает повторные снимки одного адреса, from=2015&to=2018 ограничивает период, output=json меняет формат. Этот файл — готовое сырьё для карты редиректов после переезда.

Почему страницы нет в веб-архиве

Отсутствие снимка не значит, что страницы не существовало. Типичные причины:

  • Краулер туда не дошёл. Архив обходит сеть выборочно: глубокие страницы малоизвестных сайтов, на которые никто не ссылается, могут не попасть в него ни разу. Главная сохраняется чаще, внутренние разделы — реже.
  • Контент рисуется JavaScript. Если сайт — одностраничное приложение, которое получает данные через API после загрузки, в снимке окажется пустой каркас или вечный индикатор загрузки.
  • Нужна авторизация. Личные кабинеты, закрытые группы, лента VK и большинство страниц за логином в архиве выглядят как форма входа.
  • Владелец исключил сайт. По запросу владельца снимки скрываются, и Wayback показывает сообщение, что URL исключён (excluded).
  • Сервер отдавал ошибку. Если в день обхода сайт отвечал 403, 503 или блокировал ботов по User-Agent, в календаре будет оранжевая или красная отметка вместо копии.
  • Адрес записан иначе. Схему (http/https) и www архив обычно приводит к одному виду, а вот параметры запроса считает частью адреса. Попробуйте маску example.ru/* и найдите нужный адрес в списке.

С видео отдельная история. Страницы YouTube в архиве есть, но сам видеопоток, как правило, не сохраняется: плеер в снимке не воспроизводится. Рассчитывать на архив как на способ скачать ролик не стоит.

Как сохранить страницу в веб-архив: Save Page Now

Ждать, пока краулер придёт сам, необязательно. На главной web.archive.org справа есть форма Save Page Now: вставьте URL и нажмите «Save Page». Через несколько секунд или минут появится ссылка на новый снимок. То же самое работает прямой ссылкой:

https://web.archive.org/save/https://example.ru/page

Для вошедших пользователей в форме доступны дополнительные опции: сохранить также страницы, на которые ссылается исходная (outlinks), сохранить страницу даже при ошибке, сделать скриншот. Официальное расширение архива для Chrome, Firefox, Edge и Safari добавляет кнопку сохранения прямо в браузер.

Владельцу сайта стоит сохранять ключевые страницы перед редизайном, сменой цен или правкой оферты и политики конфиденциальности.

Как удалить сайт из Wayback Machine

Владелец может попросить исключить свой сайт или отдельные страницы из публичного доступа. Справочный центр Internet Archive направляет такие запросы на адрес info@archive.org. В письме укажите:

  • точные URL или домен целиком и период, который нужно скрыть;
  • подтверждение, что вы владелец: письмо с адреса на этом домене, либо готовность разместить на сайте файл или текст, который укажут сотрудники;
  • причину — например, утечка персональных данных или устаревшая информация о бывшем сотруднике.

Раньше популярным способом был запрет в robots.txt для бота архива, но политика Internet Archive в отношении robots.txt менялась, и одна строчка в файле не гарантирует, что уже сделанные снимки исчезнут. Надёжный путь — запрос. Учтите и обратную сторону: если вы купили домен с плохой историей, исключение скроет её от любопытных, но не от поисковиков, у которых свои данные. Подробнее о том, какие файлы и бота как ограничивать, — в статье robots.txt: синтаксис и проверка.

Wayback Machine не работает: что проверить

Медленные ответы и временные отказы у бесплатного архива — обычное дело. Прежде чем искать проблему у себя:

  1. Проверьте, отвечает ли сервер архива вообще: curl -I https://web.archive.org/. Код 200 или 302 — сервис жив, таймаут или 503 — проблема на его стороне.
  2. Если главная открывается, а конкретный снимок нет — это обычно «тяжёлая» страница: архиву приходится подгружать сотни ресурсов. Откройте ту же копию с модификатором id_, она легче.
  3. Сообщение «This URL has been excluded from the Wayback Machine» — не сбой, а решение владельца.
  4. Ошибка при Save Page Now чаще всего означает, что целевой сайт не отдал страницу боту архива: заблокировал его, потребовал капчу или не ответил вовремя.

Если архив не открывается только у вас, а из других сетей работает, причина в провайдере или локальной сети — сверьтесь с DNS-резолвингом и маршрутом.

Как скачать сайт из веб-архива

Для одной страницы достаточно открыть её с id_ и сохранить через браузер или curl:

curl -s -o page.html "https://web.archive.org/web/20160315id_/https://example.ru/about"

Для всего сайта используют связку «список URL из CDX API + загрузка каждой копии с id_». Готовые утилиты этого класса существуют — самая известная, Ruby-гем wayback_machine_downloader, давно не обновлялась в исходном репозитории, поэтому смотрите на поддерживаемые форки. Что важно знать заранее:

  • восстановленный сайт — это статический HTML; формы, поиск, корзина и всё, что работало на сервере, вернуть из архива нельзя;
  • не спешите: архив ограничивает частоту запросов, и слишком активный скрипт получит отказы;
  • тексты и изображения, восстановленные с чужого домена, остаются чужой интеллектуальной собственностью — купленный домен не даёт прав на контент прежнего владельца.

Веб-архив при покупке домена и в SEO

Перед покупкой домена — особенно освобождающегося — история в архиве обязательна. Откройте вкладку URLs и календарь и ищите:

  • тематику, далёкую от вашей: казино, фарма, доски объявлений, дорвеи с тысячами сгенерированных страниц;
  • периоды «заглушек» регистратора и парковок — они означают, что домен уже освобождался;
  • резкую смену языка или страны сайта;

Архив даёт только содержимое. Кто владел доменом, когда он был зарегистрирован и продлевался, показывает WHOIS, а попадание в реестр Роскомнадзора — отдельная проверка. Про поиск владельца подробно — в статье как узнать, кому принадлежит домен, про охоту за дропами — в материале освобождающиеся домены.

В SEO архив решает две задачи. Первая — миграция: CDX API выдаёт все адреса, которые сайт когда-либо имел, и по этому списку проверяют, что каждый старый URL отдаёт 301 на новый, а не 404. Вторая — разбор просадки: сравнив снимки до и после падения трафика во вкладке Changes, видно, что именно поменялось — пропали тексты, сменились title, исчез блок ссылок. Порядок действий при переезде описан в чеклисте миграции сайта.

Альтернативы: archive.today и другие архивы

СервисКак появляются копииСильная сторонаОграничения
Wayback Machine (web.archive.org)собственные краулеры + Save Page Nowистория за много лет, календарь, CDX API, сравнение снимковне всегда сохраняет JS-контент; снимки могут быть скрыты по запросу владельца
archive.today (archive.ph)только по запросу пользователясохраняет отрисованную страницу и скриншот, хорошо справляется с динамическими сайтаминет автоматического обхода: если страницу никто не сохранил, её нет; нет публичного API уровня CDX
Кэш поисковикапоследний обход роботабыстро, если ещё доступенодна копия без истории; у Google функция отключена
Своя резервная копиябэкап хостинга или gitполный сайт с базой и серверной логикойесть только у владельца и только если её настроили заранее

archive.today удобно использовать вместе с Wayback: если в интернет-архиве страница сохранилась пустой из-за скриптов, её свежая копия в archive.today часто выглядит так, как её видит пользователь.

Как проверить домен вместе с его историей

Архив отвечает на вопрос «что здесь было». Чтобы понять, что с доменом сейчас, дополните его тремя проверками:

  • WHOIS домена — дата регистрации, регистратор, срок оплаты и статусы. Молодая дата регистрации при длинной истории в архиве означает, что домен освобождался и был зарегистрирован заново.
  • проверка в реестре Роскомнадзора — был ли домен или его IP в списке блокировок. Для купленного дропа это частая скрытая проблема.
  • проверка HTTP-заголовков и доступности — что сайт отдаёт сейчас: код ответа, редиректы, сервер. Удобно сравнить с тем, что видел краулер архива.

Официальные инструкции по сервису — в справочном центре Internet Archive: Using the Wayback Machine и Wayback Machine General Information.

Частые вопросы

Сервис бесплатный?

Да. Просмотр снимков, сохранение страниц через Save Page Now и API бесплатны. Регистрация нужна только для дополнительных опций сохранения.

Как найти официальный сайт Wayback Machine?

Официальный адрес — web.archive.org, он входит в проект archive.org. Похожие домены с другими зонами или дефисами к Internet Archive не относятся.

Как часто архив сохраняет сайты?

Фиксированного расписания нет. Популярные страницы сохраняются часто, малоизвестные — редко или никогда. Если важна конкретная дата, сохраните страницу сами через Save Page Now.

Можно ли посмотреть в архиве старую страницу VK или YouTube?

Часть таких страниц есть, но из-за авторизации и JavaScript снимки нередко показывают форму входа или неработающий плеер. Видео в архиве, как правило, не воспроизводится.

Можно ли удалить из архива страницу чужого сайта?

Запрос рассматривается от владельца сайта или от человека, чьи права или персональные данные затронуты. Пишите на info@archive.org с точными URL и обоснованием.

Как посмотреть все страницы сайта в веб-архиве?

Откройте web.archive.org/web/*/example.ru/* или запросите CDX API с collapse=urlkey — получите список всех адресов, которые архив когда-либо видел на домене.

Проверьте ваш сайт прямо сейчас

Проверить свой домен →
Другие статьи: Инструменты
Инструменты
Массовая проверка URL: автоматизация мониторинга сайтов
11.03.2026 · 688 просм.
Инструменты
Как дать Claude и Cursor инструменты диагностики сайта
15.06.2026 · 616 просм.
Инструменты
Что такое MCP-сервер и зачем он нужен
15.06.2026 · 430 просм.
Инструменты
Конструкторы сайтов 2026: рейтинг и как потом переехать
21.07.2026 · 226 просм.