RSS
2 сентября 2026

Кого вы закрыли в robots.txt

В 2024 году сайт лёг под непонятными роботами, их закрыли — и файл с тех пор не открывали. Сегодня это стоит видимости в ИИ-ответах. Причём чаще всего закрыто совсем не то, что владелец сайта думает.

Клиенты приходят с этим один за другим, и сценарий всегда одинаковый. Сайт просел под незнакомым трафиком, админ посмотрел логи, увидел роботов с непонятными именами, закрыл их — и на этом всё закончилось. Тогда это было правильное решение. Сегодня оно стоит денег.

Почему закрывали

Не из вредности. Нагрузка была настоящая.

Read the Docs, июль 2024: один краулер выкачал 73 терабайта архивов за май, из них почти 10 — за одни сутки. Счёт за трафик больше 5 000 долларов. После блокировки ИИ-ботов расход полосы упал на 75%: с 800 до 200 гигабайт в сутки.

Wikimedia, апрель 2025: с января 2024 года расход полосы на медиафайлы вырос на 50%, и вырос не за счёт людей. 65% самого дорогого трафика создают боты, хотя на них приходится лишь около трети просмотров.

iFixit, июль 2024: ClaudeBot обратился к сайту около миллиона раз за сутки. Показательна развязка — обход прекратился сразу, как только в robots.txt появилось правило для этого бота. Он файл соблюдал, просто в файле про него ничего не было.

Добавьте к этому, что год-полтора назад никто не понимал, кто эти роботы. В логах незнакомые имена, запросы пачками, поведение как у атаки. «Закрыть всё незнакомое» было в тот момент разумной реакцией.

Что изменилось

Раньше все ИИ-боты выглядели одинаково. Сейчас их три вида, и разница не в том, кто их прислал, а в том, что именно ломается, когда вы их закрываете.

Обучающие — здесь вы платите будущим

Собирают тексты, на которых учится следующая версия модели. Закрыты — значит, в её знаниях вас не будет. Ни когда у неё спросят про вашу услугу, ни когда попросят сравнить подрядчиков: там окажутся те, кто остался открыт. И вернуть это быстро нельзя — от обхода до выхода модели к людям проходит от полугода до двух лет.

На эту группу приходится около 80% нагрузки от ИИ-ботов — потому её и закрывали в 2024-м. Тогда это не стоило ничего. Теперь стоит.

• GPTBot — OpenAI, обучение GPT и ChatGPT
• ClaudeBot — Anthropic, обучение Claude
• Google-Extended — Google, обучение Gemini. Не краулер: в логах его не видно, это управляющий токен
• Applebot-Extended — Apple, отказ от обучения Apple Intelligence. Тоже не краулер
• meta-externalagent — Meta, обучение моделей Meta и индексация
• Amazonbot — Amazon, общий краулер, собранное пригодно для обучения
• CCBot — Common Crawl, открытый корпус, на котором учатся почти все
• MistralAI-Training — Mistral AI, обучение моделей Mistral
• Bytespider — ByteDance, обучение и поиск Toutiao

Поисковые — вот это открывать срочно

Строят собственный индекс внутри ИИ-продукта. Именно они решают, попадёт ли ваш сайт в ответ. Если вы «закрыли ИИ» и потеряли видимость, почти наверняка дело в этом списке. Возврат занимает от суток до двух недель.

• OAI-SearchBot — OpenAI, индекс ChatGPT Search
• Claude-SearchBot — Anthropic, поиск внутри Claude
• PerplexityBot — Perplexity, индекс Perplexity
• Googlebot — Google, обычный индекс, и именно он питает AI Overviews и AI Mode
• bingbot — Microsoft, индекс Bing, на нём работает Copilot. Отдельного токена у Copilot нет
• YandexAdditional и YandexAdditionalBot — Яндекс, показ в быстрых ответах YandexGPT и в Поиске с Алисой
• Applebot — Apple, индекс Spotlight, Siri и Safari
• DuckAssistBot — DuckDuckGo, ИИ-ответы. Для обучения данные не используются
• Amzn-SearchBot — Amazon, Alexa и Rufus
• MistralAI-Index — Mistral AI, поиск в Le Chat
• meta-webindexer — Meta, поиск Meta AI
• PetalBot — Huawei, поиск Petal и ассистент Huawei

Агенты по запросу пользователя

Заходят на страницу в тот момент, когда пользователь о вас спросил, то есть когда он уже готов перейти. Дают меньше 5% нагрузки. Половину из них robots.txt вообще не останавливает: если они мешают, нужен файрвол, а если вы их там закрыли — правило могло и не сработать.

• ChatGPT-User — OpenAI. robots.txt не слушается: с декабря 2025 OpenAI пишет, что действие начал пользователь, поэтому правила «могут не применяться»
• Perplexity-User — Perplexity. Не слушается, и это написано в их документации открытым текстом
• Google-GeminiNotebook и Google-Agent — Google. Не слушаются: отнесены к «запускаемым пользователем», которые «как правило игнорируют robots.txt»
• meta-externalfetcher — Meta. Может обходить, Meta признаёт это прямо
• Claude-User — Anthropic. Слушается
• Amzn-User — Amazon. Слушается
• MistralAI-User — Mistral AI. Слушается

Сколько ждать, если открыть

Обратно в ИИ-ответы — быстро. Это поисковый путь. OpenAI обновляет своё представление о вашем robots.txt примерно за сутки, DuckDuckGo за 72 часа, Яндекс за 2–14 дней, Google даёт «от нескольких дней до нескольких недель». Агент, который заходит по вопросу пользователя, приходит вообще без задержки.

Обратно в знания модели — годы. Разрыв складывается из двух частей. Первая: между обходом сайта и датой, за которую производитель ручается. Anthropic однажды раскрыла цепочку целиком — модель обучалась на данных «по ноябрь 2024», а заявленная граница знаний у неё «конец октября 2024». Вторая: между этой границей и выходом модели к людям. Поколение 2026 года укладывается в 2–6 месяцев, поколение 2024–2025 было вдвое медленнее.

Складываем — и получаем от полугода до полутора-двух лет. Причём без гарантий: страница ещё должна пережить отбор и дедупликацию. Ни один производитель попадания не обещает.

Три ловушки, на которых ошибаются почти все

Google-Extended не убирает вас из AI Overviews. Это самое частое заблуждение, и оно прямо противоречит документации Google: AI Overviews и AI Mode берут данные из обычного индекса Googlebot. Чтобы выйти из ИИ-ответов Google, оставаясь в обычном поиске, с 2026 года есть отдельный переключатель в Search Console: Настройки → Search generative AI control.

У Яндекса нет директивы «не обучать». YandexAdditional и YandexAdditionalBot управляют показом в быстрых ответах YandexGPT и в Поиске с Алисой, а индексирующих запросов вообще не делают. Способа сказать Яндексу «не учись на мне, но продолжай индексировать» официально не существует.

Про Crawl-delay всё сложнее, чем пишут. Директива нестандартная, в официальном стандарте robots.txt её нет вообще. Поддерживают bingbot и ClaudeBot. Прямо отказываются Google, Amazon и Apple. Кстати, расхожее «Applebot соблюдает Crawl-delay» никогда не имело подтверждения у Apple, а летом 2026 они написали обратное.

Что сделать сегодня

• Откройте ваш-сайт.ru/robots.txt и прочитайте его целиком. Файл есть далеко не у всех: по данным Cloudflare, среди 10 000 крупнейших доменов robots.txt имеется только у 37%
• Найдите токены из второго и третьего списка. Если рядом стоит Disallow — вы невидимы для ИИ-поиска. Это чинится сегодня и отыгрывается за дни
• Отдельно проверьте, не закрыт ли Googlebot или bingbot целиком. Такое встречается, и это отключает не только ИИ-ответы, но и обычный поиск
• Первый список тоже открывайте, если сайт держит нагрузку, а он почти всегда держит. Закрытым он оставляет вас вне моделей следующих поколений
• Проверьте не только robots.txt. Блокировки часто живут выше: правила файрвола, настройки Cloudflare, чёрные списки в панели хостинга, .htaccess

Последний пункт — тот самый, на котором обычно всё и останавливается. Мы разбираем такие случаи регулярно: robots.txt в порядке, а сайт для ИИ-ботов закрыт двумя уровнями выше.

Не уверены, что и где у вас закрыто? Мы проверяем robots.txt, правила файрвола и настройки хостинга, показываем, какие боты и на каком уровне получают отказ, и приводим файл в порядок. Это входит в аудит и в поддержку сайта — напишите нам.

Все токены сверены с официальной документацией владельцев ботов по состоянию на август 2026.

Кого вы закрыли в robots.txt

← Все материалы