// руководство
Как настроить robots.txt для AI-краулеров?
Обновлено: 2026-08-19
// краткий ответ
Настроить robots.txt для AI-краулеров — значит принять три отдельных решения, а не одно: пускать ли обучающих краулеров, поисковых краулеров и фетчеры по инициативе пользователя. Каждый вендор запускает под каждую задачу отдельный user-agent. Большинству сайтов стоит разрешить поиск и загрузки по запросу пользователя, осознанно решить вопрос с обучением — и помнить, что некоторые фетчеры полностью игнорируют robots.txt.
Одно решение — на самом деле три
«Стоит ли блокировать AI-ботов?» — у этого вопроса нет ответа, потому что это не один вопрос. Каждая крупная AI-компания запускает отдельных краулеров под отдельные задачи: обучающие краулеры наполняют корпуса моделей, поисковые краулеры питают ответы, которые вас цитируют, а фетчеры по инициативе пользователя читают страницу, потому что человек только что спросил о ней ассистента. Заблокируйте их всех одной строкой — и вы не займёте позицию по обучению AI, а просто уберёте себя из AI-ответов.
Цены асимметричны. Блокировка обучающего краулера — философский выбор, в большинстве случаев без цены в видимости: Google и Apple документируют это явно, а для OpenAI и Anthropic это следует из разделения ботов — поиск работает на отдельных агентах с отдельно задокументированными последствиями. Блокировка поискового агента или фетчера пользователя имеет прямую, задокументированную цену — OpenAI, например, заявляет, что сайты, отказавшиеся от OAI-SearchBot, «не будут показываться в поисковых ответах ChatGPT». Механика по каждому движку разобрана в наших гайдах о цитировании в ChatGPT, Claude и Perplexity; эта страница — полная карта.
Сделку задают два числа. Cloudflare измерила, сколько страниц AI-компании обходят на каждый визит, который возвращают взамен: по данным Cloudflare Radar за июнь 2025 года — примерно 1 700 краулов на один переход у OpenAI и около 70 900 у Anthropic. С тех пор соотношения снижаются — дашборд Cloudflare AI Insights отслеживает их в реальном времени, — но суть сделки ясна: вы меняете интенсивный краулинг на цитаты. Таблица ниже — то, чем вы задаёте условия.
Полный список AI-краулеров, сверенный с документацией вендоров
Каждая строка ниже сверена с документацией самого оператора по состоянию на август 2026 года. «Токен» означает, что имя работает только как группа в robots.txt — отдельного краулера с таким user-agent не существует.
| User-agent | Задача | Соблюдает robots.txt | Цена блокировки |
|---|---|---|---|
| GPTBot — OpenAI | Обучение | Да | Будущий контент исключается из обучения моделей OpenAI; поиск ChatGPT работает на OAI-SearchBot |
| OAI-SearchBot — OpenAI | Поисковый индекс | Да | «Не будут показываться в поисковых ответах ChatGPT» |
| ChatGPT-User — OpenAI | Загрузка по инициативе пользователя | «Правила могут не применяться» (официально) | Только декларативно — загрузки инициирует пользователь |
| ClaudeBot — Anthropic | Обучение | Да | Будущий контент исключается из обучающих датасетов Anthropic |
| Claude-SearchBot — Anthropic | Поисковый индекс | Да | Нет индексации — «может снизить видимость вашего сайта» |
| Claude-User — Anthropic | Загрузка по инициативе пользователя | Да | Страницу нельзя получить по запросу пользователя Claude |
| PerplexityBot — Perplexity | Поисковый индекс | Да | Вне поискового индекса и цитат Perplexity |
| Perplexity-User — Perplexity | Загрузка по инициативе пользователя | «Обычно игнорирует robots.txt» (официально) | Только декларативно |
| Google-Extended — Google (токен) | Обучение + управление граундингом | Соблюдается через Googlebot | Вне обучения и граундинга Gemini; Поиск и AI Overviews не затрагиваются |
| Applebot — Apple | Поисковый индекс (Siri, Spotlight, Safari) | Да — следует правилам Googlebot, если не назван явно | Вне поисковых поверхностей Apple |
| Applebot-Extended — Apple (токен) | Управление обучением | Соблюдается через Applebot | Вне обучения фундаментальных моделей Apple; сайт остаётся в Siri и Spotlight |
| Meta-ExternalAgent — Meta | Обучение + индексация | Да | Вне обучения Meta AI и её индекса |
| Meta-ExternalFetcher — Meta | Загрузка по инициативе пользователя | «Может обходить robots.txt» (официально) | Только декларативно |
| CCBot — Common Crawl | Открытый веб-архив | Да | Вне публичных датасетов, на которых обучаются многие AI-лаборатории, — отказ оптом |
| Amazonbot — Amazon | Улучшение продуктов; может обучать AI-модели Amazon | Да | Вне краулинга Amazon, включая любое обучение моделей |
| Amzn-SearchBot — Amazon | Поисковый индекс (поисковые сценарии Alexa; без обучения) | Да — следует общим правилам для поисковых ботов, если не назван явно | Вне поисковых сценариев Alexa |
| Amzn-User — Amazon | Загрузка по инициативе пользователя (запросы Alexa) | «Может следовать не всем директивам robots.txt» (официально) | Только декларативно |
| DuckAssistBot — DuckDuckGo | Ответы в реальном времени (без обучения) | Да (применяется в течение 72 часов) | Вне ответов DuckAssist |
| Bytespider — ByteDance | Обучение (не задокументировано) | Нет — на практике игнорирует файл | Ничего через robots.txt; нужна блокировка на уровне сервера |
Как заблокировать AI-краулеров — или нет: три готовые конфигурации
Таблица сводится к трём рабочим политикам.
Конфигурация 1 — приоритет видимости. Разрешить всё, и явно: отдельная Allow-группа для каждого задокументированного бота из таблицы (все, кроме Bytespider — Allow для бота, который игнорирует файл, лишь шум) плюс правило для всех остальных. Подходит сайтам, которые живут за счёт того, что их находят и цитируют, — контент-бизнесам, агентствам, большинству B2B. Именно так настроен наш собственный файл; см. раздел «Как это устроено у нас» ниже.
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /…и так далее для каждого агента из таблицы. Полная версия — наш рабочий файл на get-geo.ai/robots.txt.
Конфигурация 2 — без обучения. Самый частый осознанный выбор: не попадать в корпуса моделей, но оставаться в ответах. Запретите обучающих краулеров и токены, разрешите остальное. Две оговорки перед тем, как копировать: строка для Bytespider декларативна (почему — в следующем разделе), а исключение Meta-ExternalAgent — единственный отказ от обучения с ценой в видимости: он выводит и из индекса Meta:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: *
Allow: /Конфигурация 3 — полная блокировка. Оправданна для платного или проприетарного контента. Robots.txt позволяет нескольким строкам User-agent разделять один блок правил, поэтому всё остаётся компактным. Applebot мы сюда не включаем: его блокировка убирает вас ещё и из поиска Siri и Spotlight, а это решение серьёзнее, чем AI-ответы:
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: Meta-ExternalFetcher
User-agent: CCBot
User-agent: Amazonbot
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: Bytespider
Disallow: /Прочитайте следующий раздел, прежде чем публиковать это: для нескольких агентов выше файл — просьба, а не барьер.
Какие AI-краулеры игнорируют robots.txt
Robots.txt — это опубликованная политика, а не механизм принуждения, и для целого класса агентов вендоры говорят об этом сами. OpenAI о ChatGPT-User: «Поскольку эти действия инициированы пользователем, правила robots.txt могут не применяться». Meta о Meta-ExternalFetcher: он «может обходить robots.txt, потому что выполняет загрузки, запрошенные пользователем». Фетчер Perplexity по инициативе пользователя «обычно игнорирует правила robots.txt». Amazon об Amzn-User: он «может следовать не всем директивам robots.txt». Логика единая: спросил человек — значит, загрузка считается визитом человека, а не краулингом.
Отдельно стоит Bytespider, у которого нет никакой документации и который на практике игнорирует файл: Cloudflare обнаружила, что он обращается к большему числу защищённых сайтов, чем любой другой AI-краулер (40,4% в середине 2024 года), а HAProxy насчитала на него почти 90% своего трафика AI-краулеров, отметив, что он игнорирует инструкции robots.txt.
Поэтому принуждение живёт уровнем ниже. Проверяйте краулеров по спискам IP, которые публикует большинство вендоров, — OpenAI, Anthropic, Apple, Common Crawl и DuckDuckGo поддерживают JSON-списки, Amazon публикует свои диапазоны на странице для разработчиков — и блокируйте на уровне CDN или WAF то, что действительно хотите остановить. Проверка важнее, чем кажется: по замерам HUMAN Security, 1 из 18 запросов с user-agent известного AI-краулера — подделка.
Как это устроено у нас
Наш собственный robots.txt — это конфигурация с приоритетом видимости: девятнадцать явных Allow-групп по агентам — каждый агент из таблицы, который соблюдает файл, фетчеры по инициативе пользователя, которых мы в любом случае рады видеть, и классический Bingbot — плюс завершающее правило Allow для всех. Мы привели файл к этому виду в августе 2026 года, попутно удалив устаревшую группу anthropic-ai, а во время фактчекинга этого гайда — и спекулятивную группу cohere-ai: собственная документация Cohere утверждает, что на данный момент компания не запускает краулеров.
Очевидное возражение: однострочный «User-agent: * / Allow: /» дал бы идентичное поведение краулеров. Верно. Но явные группы дают три вещи, которых нет у однострочника. Каждый вендор получает недвусмысленный сигнал о намерении, а не отсутствие возражений. Будущие правки безопаснее: Disallow, добавленный для одного агента, не может незаметно распространиться на агентов, о которых никто не подумал. И файл заодно служит нашим чек-листом для ревизии: когда вендор выпускает нового агента — как OpenAI и Anthropic за последние два года, — пробел виден в самом файле и в наших логах краулинга.
Файл — одна из частей настройки, которую мы описываем в гайде о том, как делаем GEO на собственном сайте. Это политика сайта, который зарабатывает на AI-цитатах. Издатель с платным архивом разумно выбрал бы конфигурацию 2 или 3 — смысл этого гайда не в нашем ответе, а в таблице, по которой вы выберете свой. Какую бы конфигурацию вы ни выбрали, поставьте в календарь ежеквартальную ревизию: состав ботов постоянно меняется — OpenAI добавила OAI-SearchBot в 2024-м, Anthropic добавила Claude-SearchBot в 2025-м, Amazon к 2026-му разделила свой краулинг на три агента, — и robots.txt, написанный в 2024 году, уже ошибается насчёт сегодняшних краулеров.
Смежные вопросы
Стоит ли блокировать AI-краулеров?
Разделите вопрос по задачам. Блокировка обучающих краулеров (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot, Amazonbot) не стоит поисковой видимости — это явно задокументировано Google и Apple, а для остальных следует из архитектуры. Исключение — Meta-ExternalAgent, который обучает и индексирует одним агентом: его блокировка выводит из обоих. Блокировка поисковых агентов и фетчеров пользователя убирает вас из AI-ответов, где задаётся всё большая доля покупательских вопросов. Вопрос об обучении решайте из принципа; вопрос о видимости — исходя из того, откуда приходят ваши цитаты и трафик.
Убирает ли блокировка GPTBot мой сайт из ChatGPT?
Нет. GPTBot питает только обучение моделей. Поиск ChatGPT работает на OAI-SearchBot, а страницы по запросу пользователя загружает ChatGPT-User — заблокируйте GPTBot, и оба продолжат работать. Это то же разделение, что у Anthropic с ClaudeBot против Claude-SearchBot и Claude-User.
Влияет ли Google-Extended на AI Overviews?
Нет — и это самая частая ошибка жанра. Google документирует, что Google-Extended управляет обучением и граундингом Gemini и «не влияет на включение сайта в Google Поиск». AI Overviews и AI Mode — часть самого Поиска: ими управляют доступ Googlebot и настройки сниппетов — nosnippet, data-nosnippet, max-snippet, noindex. Полная механика — в нашем гайде о том, как попасть в Google AI Overviews.
Как проверить, что краулер настоящий?
Никогда не доверяйте одной лишь строке user-agent: по замерам HUMAN Security 2026 года, 1 из 18 запросов, представляющихся известным AI-краулером, — подделка. Сверяйте IP источника с опубликованным списком вендора: OpenAI, Anthropic, Apple, Common Crawl и DuckDuckGo публикуют JSON-списки IP, Amazon публикует диапазоны на странице для разработчиков, а Google и Apple поддерживают проверку через обратный DNS. Всё, что не проходит проверку, считается скрейпером — как бы оно себя ни называло.
Достаточно ли robots.txt, или нужен ещё llms.txt?
У них разные задачи. Robots.txt управляет доступом — кто и что может загружать. llms.txt — навигационная подсказка: машиночитаемая карта, которая помогает моделям найти и интерпретировать ваши ключевые страницы, когда они уже внутри. Сначала доступ: llms.txt за сплошным Disallow не поможет никому. llms.txt посвящён отдельный гайд этой серии.
Связанные руководства
Источники
- 01Наш гайд: Как попасть в Google AI Overviews?
- 02Наш гайд: Как делать GEO на собственном сайте на практике?
- 03OpenAI — документация по ботам: GPTBot, OAI-SearchBot, ChatGPT-User
- 04Anthropic — документация по краулерам: ClaudeBot, Claude-SearchBot, Claude-User
- 05Perplexity — документация по краулерам: PerplexityBot, Perplexity-User
- 06Google — основные краулеры и Google-Extended
- 07Google — AI-функции в Поиске и настройки для владельцев сайтов
- 08Apple — Applebot и Applebot-Extended
- 09Meta — веб-краулеры: Meta-ExternalAgent, Meta-ExternalFetcher
- 10Common Crawl — документация CCBot
- 11Amazon — документация Amazonbot
- 12DuckDuckGo — документация DuckAssistBot
- 13Cloudflare — соотношение краулинга к переходам у AI-платформ (июль 2025) и живой дашборд AI Insights
- 14Cloudflare — Bytespider лидирует по трафику AI-ботов и блокировкам (июль 2024)
- 15HAProxy — ~90% нашего трафика AI-краулеров — это Bytespider (октябрь 2024)
- 16HUMAN Security — Состояние AI-трафика 2026: бенчмарки подделки краулеров
// поделиться