Skip to content
EN

Боты и ИИ-краулеры в 2026 году: сколько их и кого закрывают в robots.txt

Кратко. Боты — это 35,5% трафика или 61,9%? Оба ответа дал Cloudflare за одну и ту же неделю августа 2026 года.

Боты — это 35,5% трафика или 61,9%? Оба ответа дал Cloudflare за одну и ту же неделю августа 2026 года. Разница не в источнике, а в том, считать все запросы или только запросы страниц.

Ниже — обе цифры со знаменателями, наш собственный замер robots.txt по 600 хостам в четырёх зонах и находка, которой мы не ожидали: GPTBot упоминается в robots.txt чаще, чем Googlebot и Яндекс.

Проверить заголовки сайта →

Одна цифра, два ответа: всё зависит от знаменателя

«Боты — уже большинство трафика» верно и неверно одновременно, и разница не в источнике, а в том, что считать. Cloudflare Radar в одну и ту же неделю (20–26 августа 2026 года) даёт два ответа:

Что считаемЛюдиБоты
Все HTTP-запросы (страницы, картинки, скрипты, API)64,5%35,5%
Только запросы HTML-страниц38,1%61,9%

По HTML-страницам разбивка подробнее: боты не-ИИ — 52,8%, люди — 38,1%, ИИ-боты — 5,7%, смешанного назначения — 3,4%.

Причина расхождения простая: люди тянут с сайта десятки картинок и скриптов на одну страницу, а краулер чаще берёт только HTML. Поэтому в пересчёте на запросы люди выигрывают, а в пересчёте на страницы — проигрывают.

Знаменатель обязателен. Любая цифра о доле ботов без указания, считались ли все запросы или только страницы, вводит в заблуждение — независимо от того, кто её опубликовал.

Данные исследования

Исходные данные всех таблиц этого отчёта доступны в виде открытого CSV-файла (UTF-8, первая строка — заголовки).

Скачать датасет (CSV)

Кого сайты запрещают в robots.txt

Cloudflare нашёл 4 365 файлов robots.txt среди десяти тысяч крупнейших доменов (данные на 24 августа 2026 года) и опубликовал порядок самых запрещаемых ИИ-агентов: GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider, meta-externalagent, Amazonbot, Applebot-Extended. Точные числа по каждому агенту у них закодированы в графике так, что однозначно снять их нельзя, поэтому приводим только порядок.

Мы посчитали то же самое на своей выборке — 600 хостов по 150 на зону, 27 августа 2026 года, с разбором групп по правилам RFC 9309 (подряд идущие строки User-agent делят один набор правил):

ЗонаЕсть robots.txtЗапрещают хотя бы одного ИИ-краулераДоля
.org801012,5%
.com8589,4%
.net4449,1%
.ru9788,2%

Оговорка, без которой таблицу читать нельзя: запрещающих сайтов в каждой зоне всего 4–10. При таких числах различить зоны между собой невозможно — разброс от 8,2% до 12,5% укладывается в случайность. Достоверно здесь только одно: примерно один сайт из десяти, у которого вообще есть robots.txt, закрывается от ИИ-краулеров, и это одинаково верно для всех четырёх зон.

Побочное наблюдение, которое числами подтверждается лучше: robots.txt у сайтов .ru встречается чаще, чем у .com — 97 против 85 из 150.

ИИ-краулеров называют чаще, чем поисковых роботов

Мы посчитали, какие агенты вообще упоминаются в собранных файлах — не обязательно с запретом, а просто названы. Всего разных агентов оказалось 230. Верхушка списка (число сайтов из 600):

АгентСайтовЧей
GPTBot41OpenAI, обучение
Yandex38поиск
ClaudeBot34Anthropic
Google-Extended34Google, обучение ИИ
CCBot29Common Crawl
meta-externalagent29Meta
Bytespider28ByteDance
Amazonbot27Amazon
Googlebot26поиск
Applebot-Extended26Apple, обучение ИИ

Семь позиций из десяти заняты ИИ-краулерами, и GPTBot обходит и Googlebot, и Яндекс. Это косвенно, но красноречиво: владельцы сайтов теперь чаще настраивают правила для машин, которые учат модели, чем для машин, которые приводят посетителей.

Отдельно про Яндекс: его агенты присутствуют во всех четырёх зонах, но в наших данных ни один сайт не закрывает от него доступ полностью — упоминания идут в связке с настройками индексации, а не с запретом.

Почему цифру «57% запросов — боты» лучше не цитировать

В пресс-релизе Cloudflare от 13 июля 2026 года говорится примерно про 57% автоматизированных запросов, а в блоге от 1 июля — что «более 50% трафика в интернете теперь не человеческий». Ни там, ни там не указан период измерения, совокупность и методика, и обе цифры не сходятся с собственными данными Cloudflare Radar за те же месяцы (35,5% по всем запросам).

Есть и противоположный ориентир. Akamai — поставщик, коммерчески заинтересованный говорить обратное — оценивает ИИ-ботов почти в 1% от всего ботового трафика своей сети. Широко цитируемый «рост ИИ-ботов на 300%» считается именно от этой базы, но саму базу в пересказах не приводят.

Общее правило для этой темы: все доступные цифры — это замеры клиентских баз конкретных поставщиков, а не интернета. Cloudflare видит сайты за Cloudflare, Imperva — тех, кто купил защиту от ботов (то есть у кого уже была проблема), Fastly — свои приложения. Нейтрального измерения всего интернета не существует, и это стоит проговаривать вслух.

Посмотреть, что видит ваш собственный сайт, проще всего по логам. Проверить корректность самого файла можно в проверке robots.txt.

Больше по теме

Часто задаваемые вопросы

Как отличить GoogleBot от спуфа?

Reverse DNS lookup на IP + проверка что точка возвращает google-crawler.google.com. Только после верификации считайте legit.

Нужно ли блокировать AI crawlers?

Depends. Если вы хотите citations в Perplexity/ChatGPT — разрешите. Если контент платный/proprietary — блокируйте через robots.txt или CF rule.

47% bots — это норма в 2026?

Да, global average 40-50%. Тренд расти из-за AI scraping и монетизации content через AI.

Как увидеть свой bot-трафик?

Access logs + robots.txt audit. Plus Enterno Pro dashboard показывает bot % по User-Agent.

Запустить инструмент, который описан в этой статье

Бесплатный тариф — 10 мониторов, проверки каждые 5 мин, без карты. Платные тарифы — интервал от 1 минуты и проверки из нескольких регионов.