Перейти к содержанию
GET-GEO.AI
/
Все руководства

// руководство

Как настроить robots.txt для AI-краулеров?

Обновлено: 2026-08-19

// краткий ответ

Настроить robots.txt для AI-краулеров — значит принять три отдельных решения, а не одно: пускать ли обучающих краулеров, поисковых краулеров и фетчеры по инициативе пользователя. Каждый вендор запускает под каждую задачу отдельный user-agent. Большинству сайтов стоит разрешить поиск и загрузки по запросу пользователя, осознанно решить вопрос с обучением — и помнить, что некоторые фетчеры полностью игнорируют robots.txt.

Одно решение — на самом деле три

«Стоит ли блокировать AI-ботов?» — у этого вопроса нет ответа, потому что это не один вопрос. Каждая крупная AI-компания запускает отдельных краулеров под отдельные задачи: обучающие краулеры наполняют корпуса моделей, поисковые краулеры питают ответы, которые вас цитируют, а фетчеры по инициативе пользователя читают страницу, потому что человек только что спросил о ней ассистента. Заблокируйте их всех одной строкой — и вы не займёте позицию по обучению AI, а просто уберёте себя из AI-ответов.

Цены асимметричны. Блокировка обучающего краулера — философский выбор, в большинстве случаев без цены в видимости: Google и Apple документируют это явно, а для OpenAI и Anthropic это следует из разделения ботов — поиск работает на отдельных агентах с отдельно задокументированными последствиями. Блокировка поискового агента или фетчера пользователя имеет прямую, задокументированную цену — OpenAI, например, заявляет, что сайты, отказавшиеся от OAI-SearchBot, «не будут показываться в поисковых ответах ChatGPT». Механика по каждому движку разобрана в наших гайдах о цитировании в ChatGPT, Claude и Perplexity; эта страница — полная карта.

Сделку задают два числа. Cloudflare измерила, сколько страниц AI-компании обходят на каждый визит, который возвращают взамен: по данным Cloudflare Radar за июнь 2025 года — примерно 1 700 краулов на один переход у OpenAI и около 70 900 у Anthropic. С тех пор соотношения снижаются — дашборд Cloudflare AI Insights отслеживает их в реальном времени, — но суть сделки ясна: вы меняете интенсивный краулинг на цитаты. Таблица ниже — то, чем вы задаёте условия.

Полный список AI-краулеров, сверенный с документацией вендоров

Каждая строка ниже сверена с документацией самого оператора по состоянию на август 2026 года. «Токен» означает, что имя работает только как группа в robots.txt — отдельного краулера с таким user-agent не существует.

AI-краулеры и фетчеры — user-agent'ы, задачи и цена блокировки (проверено в августе 2026)
User-agentЗадачаСоблюдает robots.txtЦена блокировки
GPTBot — OpenAIОбучениеДаБудущий контент исключается из обучения моделей OpenAI; поиск ChatGPT работает на OAI-SearchBot
OAI-SearchBot — OpenAIПоисковый индексДа«Не будут показываться в поисковых ответах ChatGPT»
ChatGPT-User — OpenAIЗагрузка по инициативе пользователя«Правила могут не применяться» (официально)Только декларативно — загрузки инициирует пользователь
ClaudeBot — AnthropicОбучениеДаБудущий контент исключается из обучающих датасетов Anthropic
Claude-SearchBot — AnthropicПоисковый индексДаНет индексации — «может снизить видимость вашего сайта»
Claude-User — AnthropicЗагрузка по инициативе пользователяДаСтраницу нельзя получить по запросу пользователя Claude
PerplexityBot — PerplexityПоисковый индексДаВне поискового индекса и цитат Perplexity
Perplexity-User — PerplexityЗагрузка по инициативе пользователя«Обычно игнорирует robots.txt» (официально)Только декларативно
Google-Extended — Google (токен)Обучение + управление граундингомСоблюдается через GooglebotВне обучения и граундинга Gemini; Поиск и AI Overviews не затрагиваются
Applebot — AppleПоисковый индекс (Siri, Spotlight, Safari)Да — следует правилам Googlebot, если не назван явноВне поисковых поверхностей Apple
Applebot-Extended — Apple (токен)Управление обучениемСоблюдается через ApplebotВне обучения фундаментальных моделей Apple; сайт остаётся в Siri и Spotlight
Meta-ExternalAgent — MetaОбучение + индексацияДаВне обучения Meta AI и её индекса
Meta-ExternalFetcher — MetaЗагрузка по инициативе пользователя«Может обходить robots.txt» (официально)Только декларативно
CCBot — Common CrawlОткрытый веб-архивДаВне публичных датасетов, на которых обучаются многие AI-лаборатории, — отказ оптом
Amazonbot — AmazonУлучшение продуктов; может обучать AI-модели AmazonДаВне краулинга Amazon, включая любое обучение моделей
Amzn-SearchBot — AmazonПоисковый индекс (поисковые сценарии Alexa; без обучения)Да — следует общим правилам для поисковых ботов, если не назван явноВне поисковых сценариев Alexa
Amzn-User — AmazonЗагрузка по инициативе пользователя (запросы Alexa)«Может следовать не всем директивам robots.txt» (официально)Только декларативно
DuckAssistBot — DuckDuckGoОтветы в реальном времени (без обучения)Да (применяется в течение 72 часов)Вне ответов DuckAssist
Bytespider — ByteDanceОбучение (не задокументировано)Нет — на практике игнорирует файлНичего через robots.txt; нужна блокировка на уровне сервера
AI-краулеры и фетчеры — user-agent'ы, задачи и цена блокировки (проверено в августе 2026)

Как заблокировать AI-краулеров — или нет: три готовые конфигурации

Таблица сводится к трём рабочим политикам.

Конфигурация 1 — приоритет видимости. Разрешить всё, и явно: отдельная Allow-группа для каждого задокументированного бота из таблицы (все, кроме Bytespider — Allow для бота, который игнорирует файл, лишь шум) плюс правило для всех остальных. Подходит сайтам, которые живут за счёт того, что их находят и цитируют, — контент-бизнесам, агентствам, большинству B2B. Именно так настроен наш собственный файл; см. раздел «Как это устроено у нас» ниже.

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

…и так далее для каждого агента из таблицы. Полная версия — наш рабочий файл на get-geo.ai/robots.txt.

Конфигурация 2 — без обучения. Самый частый осознанный выбор: не попадать в корпуса моделей, но оставаться в ответах. Запретите обучающих краулеров и токены, разрешите остальное. Две оговорки перед тем, как копировать: строка для Bytespider декларативна (почему — в следующем разделе), а исключение Meta-ExternalAgent — единственный отказ от обучения с ценой в видимости: он выводит и из индекса Meta:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: *
Allow: /

Конфигурация 3 — полная блокировка. Оправданна для платного или проприетарного контента. Robots.txt позволяет нескольким строкам User-agent разделять один блок правил, поэтому всё остаётся компактным. Applebot мы сюда не включаем: его блокировка убирает вас ещё и из поиска Siri и Spotlight, а это решение серьёзнее, чем AI-ответы:

User-agent: GPTBot

User-agent: OAI-SearchBot

User-agent: ChatGPT-User

User-agent: ClaudeBot

User-agent: Claude-SearchBot

User-agent: Claude-User

User-agent: PerplexityBot

User-agent: Perplexity-User

User-agent: Google-Extended

User-agent: Applebot-Extended

User-agent: Meta-ExternalAgent

User-agent: Meta-ExternalFetcher

User-agent: CCBot

User-agent: Amazonbot

User-agent: Amzn-SearchBot

User-agent: Amzn-User

User-agent: DuckAssistBot

User-agent: Bytespider
Disallow: /

Прочитайте следующий раздел, прежде чем публиковать это: для нескольких агентов выше файл — просьба, а не барьер.

Какие AI-краулеры игнорируют robots.txt

Robots.txt — это опубликованная политика, а не механизм принуждения, и для целого класса агентов вендоры говорят об этом сами. OpenAI о ChatGPT-User: «Поскольку эти действия инициированы пользователем, правила robots.txt могут не применяться». Meta о Meta-ExternalFetcher: он «может обходить robots.txt, потому что выполняет загрузки, запрошенные пользователем». Фетчер Perplexity по инициативе пользователя «обычно игнорирует правила robots.txt». Amazon об Amzn-User: он «может следовать не всем директивам robots.txt». Логика единая: спросил человек — значит, загрузка считается визитом человека, а не краулингом.

Отдельно стоит Bytespider, у которого нет никакой документации и который на практике игнорирует файл: Cloudflare обнаружила, что он обращается к большему числу защищённых сайтов, чем любой другой AI-краулер (40,4% в середине 2024 года), а HAProxy насчитала на него почти 90% своего трафика AI-краулеров, отметив, что он игнорирует инструкции robots.txt.

Поэтому принуждение живёт уровнем ниже. Проверяйте краулеров по спискам IP, которые публикует большинство вендоров, — OpenAI, Anthropic, Apple, Common Crawl и DuckDuckGo поддерживают JSON-списки, Amazon публикует свои диапазоны на странице для разработчиков — и блокируйте на уровне CDN или WAF то, что действительно хотите остановить. Проверка важнее, чем кажется: по замерам HUMAN Security, 1 из 18 запросов с user-agent известного AI-краулера — подделка.

Как это устроено у нас

Наш собственный robots.txt — это конфигурация с приоритетом видимости: девятнадцать явных Allow-групп по агентам — каждый агент из таблицы, который соблюдает файл, фетчеры по инициативе пользователя, которых мы в любом случае рады видеть, и классический Bingbot — плюс завершающее правило Allow для всех. Мы привели файл к этому виду в августе 2026 года, попутно удалив устаревшую группу anthropic-ai, а во время фактчекинга этого гайда — и спекулятивную группу cohere-ai: собственная документация Cohere утверждает, что на данный момент компания не запускает краулеров.

Очевидное возражение: однострочный «User-agent: * / Allow: /» дал бы идентичное поведение краулеров. Верно. Но явные группы дают три вещи, которых нет у однострочника. Каждый вендор получает недвусмысленный сигнал о намерении, а не отсутствие возражений. Будущие правки безопаснее: Disallow, добавленный для одного агента, не может незаметно распространиться на агентов, о которых никто не подумал. И файл заодно служит нашим чек-листом для ревизии: когда вендор выпускает нового агента — как OpenAI и Anthropic за последние два года, — пробел виден в самом файле и в наших логах краулинга.

Файл — одна из частей настройки, которую мы описываем в гайде о том, как делаем GEO на собственном сайте. Это политика сайта, который зарабатывает на AI-цитатах. Издатель с платным архивом разумно выбрал бы конфигурацию 2 или 3 — смысл этого гайда не в нашем ответе, а в таблице, по которой вы выберете свой. Какую бы конфигурацию вы ни выбрали, поставьте в календарь ежеквартальную ревизию: состав ботов постоянно меняется — OpenAI добавила OAI-SearchBot в 2024-м, Anthropic добавила Claude-SearchBot в 2025-м, Amazon к 2026-му разделила свой краулинг на три агента, — и robots.txt, написанный в 2024 году, уже ошибается насчёт сегодняшних краулеров.

Смежные вопросы

Стоит ли блокировать AI-краулеров?

Разделите вопрос по задачам. Блокировка обучающих краулеров (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot, Amazonbot) не стоит поисковой видимости — это явно задокументировано Google и Apple, а для остальных следует из архитектуры. Исключение — Meta-ExternalAgent, который обучает и индексирует одним агентом: его блокировка выводит из обоих. Блокировка поисковых агентов и фетчеров пользователя убирает вас из AI-ответов, где задаётся всё большая доля покупательских вопросов. Вопрос об обучении решайте из принципа; вопрос о видимости — исходя из того, откуда приходят ваши цитаты и трафик.

Убирает ли блокировка GPTBot мой сайт из ChatGPT?

Нет. GPTBot питает только обучение моделей. Поиск ChatGPT работает на OAI-SearchBot, а страницы по запросу пользователя загружает ChatGPT-User — заблокируйте GPTBot, и оба продолжат работать. Это то же разделение, что у Anthropic с ClaudeBot против Claude-SearchBot и Claude-User.

Влияет ли Google-Extended на AI Overviews?

Нет — и это самая частая ошибка жанра. Google документирует, что Google-Extended управляет обучением и граундингом Gemini и «не влияет на включение сайта в Google Поиск». AI Overviews и AI Mode — часть самого Поиска: ими управляют доступ Googlebot и настройки сниппетов — nosnippet, data-nosnippet, max-snippet, noindex. Полная механика — в нашем гайде о том, как попасть в Google AI Overviews.

Как проверить, что краулер настоящий?

Никогда не доверяйте одной лишь строке user-agent: по замерам HUMAN Security 2026 года, 1 из 18 запросов, представляющихся известным AI-краулером, — подделка. Сверяйте IP источника с опубликованным списком вендора: OpenAI, Anthropic, Apple, Common Crawl и DuckDuckGo публикуют JSON-списки IP, Amazon публикует диапазоны на странице для разработчиков, а Google и Apple поддерживают проверку через обратный DNS. Всё, что не проходит проверку, считается скрейпером — как бы оно себя ни называло.

Достаточно ли robots.txt, или нужен ещё llms.txt?

У них разные задачи. Robots.txt управляет доступом — кто и что может загружать. llms.txt — навигационная подсказка: машиночитаемая карта, которая помогает моделям найти и интерпретировать ваши ключевые страницы, когда они уже внутри. Сначала доступ: llms.txt за сплошным Disallow не поможет никому. llms.txt посвящён отдельный гайд этой серии.

Связанные руководства

Источники

  1. 01Наш гайд: Как попасть в Google AI Overviews?
  2. 02Наш гайд: Как делать GEO на собственном сайте на практике?
  3. 03OpenAI — документация по ботам: GPTBot, OAI-SearchBot, ChatGPT-User
  4. 04Anthropic — документация по краулерам: ClaudeBot, Claude-SearchBot, Claude-User
  5. 05Perplexity — документация по краулерам: PerplexityBot, Perplexity-User
  6. 06Google — основные краулеры и Google-Extended
  7. 07Google — AI-функции в Поиске и настройки для владельцев сайтов
  8. 08Apple — Applebot и Applebot-Extended
  9. 09Meta — веб-краулеры: Meta-ExternalAgent, Meta-ExternalFetcher
  10. 10Common Crawl — документация CCBot
  11. 11Amazon — документация Amazonbot
  12. 12DuckDuckGo — документация DuckAssistBot
  13. 13Cloudflare — соотношение краулинга к переходам у AI-платформ (июль 2025) и живой дашборд AI Insights
  14. 14Cloudflare — Bytespider лидирует по трафику AI-ботов и блокировкам (июль 2024)
  15. 15HAProxy — ~90% нашего трафика AI-краулеров — это Bytespider (октябрь 2024)
  16. 16HUMAN Security — Состояние AI-трафика 2026: бенчмарки подделки краулеров

// поделиться

LinkedInXReddit