सामग्री पर जाएँ
GET-GEO.AI
/
सभी गाइड

// गाइड

AI crawlers के लिए robots.txt कैसे सेट करें?

अपडेट: 2026-08-19

// संक्षिप्त उत्तर

AI crawlers के लिए robots.txt सेट करना एक नहीं, तीन अलग निर्णय हैं: प्रशिक्षण crawlers को, search-index crawlers को और उपयोगकर्ता-प्रेरित fetchers को आने दें या नहीं। हर vendor हर काम के लिए अलग user-agents चलाता है। अधिकतर साइटों को search और user fetches की अनुमति देनी चाहिए, प्रशिक्षण पर सोच-समझकर निर्णय लेना चाहिए — और यह जानना चाहिए कि कुछ fetchers robots.txt को पूरी तरह अनदेखा करते हैं।

एक निर्णय वास्तव में तीन हैं

“क्या मुझे AI bots को block करना चाहिए?” का कोई उत्तर नहीं है, क्योंकि यह एक प्रश्न है ही नहीं। हर प्रमुख AI कंपनी अलग-अलग कामों के लिए अलग crawlers चलाती है: प्रशिक्षण crawlers मॉडल corpora को भरते हैं, search-index crawlers उन उत्तरों को भरते हैं जो आपको उद्धृत करते हैं, और उपयोगकर्ता-प्रेरित fetchers पेज तब पढ़ते हैं जब किसी व्यक्ति ने assistant से उसके बारे में अभी-अभी पूछा हो। एक पंक्ति से सबको block करें, तो आपने AI प्रशिक्षण पर कोई रुख़ नहीं लिया — आपने ख़ुद को AI उत्तरों से हटा दिया।

क़ीमतें असमान हैं। प्रशिक्षण crawler को block करना एक सैद्धांतिक चुनाव है जिसकी, अधिकतर मामलों में, दृश्यता में कोई क़ीमत नहीं: Google और Apple इसे स्पष्ट रूप से प्रलेखित करते हैं, और OpenAI तथा Anthropic के लिए यह bot-विभाजन से निकलता है — search अलग agents पर चलती है जिनके परिणाम अलग से प्रलेखित हैं। Search या user-fetch agent को block करने की सीधी, प्रलेखित क़ीमत है — OpenAI, उदाहरण के लिए, कहता है कि OAI-SearchBot से opt-out की गई साइटें “will not be shown in ChatGPT search answers.” प्रति-engine तंत्र ChatGPT, Claude और Perplexity द्वारा उद्धृत होने पर हमारे guides में हैं; यह पेज पूरा नक़्शा है।

दो संख्याएँ इस सौदे का ढाँचा दिखाती हैं। Cloudflare ने मापा कि AI कंपनियाँ बदले में भेजी गई हर visit के लिए कितने पेज crawl करती हैं: जून 2025 के Cloudflare Radar डेटा के अनुसार, OpenAI के लिए प्रति referral लगभग 1,700 crawls और Anthropic के लिए लगभग 70,900। तब से ये अनुपात गिर रहे हैं — Cloudflare का AI Insights dashboard इन्हें live ट्रैक करता है — पर सौदे का स्वरूप स्पष्ट है: आप भारी crawling के बदले citations पाते हैं। नीचे की तालिका वह जगह है जहाँ आप शर्तें तय करते हैं।

vendor docs से सत्यापित, AI crawlers की पूरी सूची

नीचे की हर पंक्ति अगस्त 2026 तक operator के अपने documentation से जाँची गई है। “Token” का अर्थ है कि नाम केवल robots.txt group के रूप में काम करता है — उस user-agent वाला कोई अलग crawler नहीं है।

AI crawlers और fetchers — user-agents, काम, और block करने की क़ीमत (अगस्त 2026 में सत्यापित)
User-agentकामrobots.txt मानता हैBlock करने की क़ीमत
GPTBot — OpenAIप्रशिक्षणहाँभविष्य की सामग्री OpenAI के मॉडल-प्रशिक्षण से बाहर; ChatGPT search OAI-SearchBot पर चलती है
OAI-SearchBot — OpenAISearch indexहाँ“Will not be shown in ChatGPT search answers”
ChatGPT-User — OpenAIUser fetch“Rules may not apply” (आधिकारिक)केवल घोषणात्मक — fetches उपयोगकर्ता-प्रेरित हैं
ClaudeBot — Anthropicप्रशिक्षणहाँभविष्य की सामग्री Anthropic के प्रशिक्षण डेटासेट से बाहर
Claude-SearchBot — AnthropicSearch indexहाँIndex नहीं होगा — “may reduce your site’s visibility”
Claude-User — AnthropicUser fetchहाँClaude के उपयोगकर्ता के अनुरोध पर पेज लिया नहीं जा सकेगा
PerplexityBot — PerplexitySearch indexहाँPerplexity के search index और citations से बाहर
Perplexity-User — PerplexityUser fetch“Generally ignores robots.txt” (आधिकारिक)केवल घोषणात्मक
Google-Extended — Google (token)प्रशिक्षण + grounding नियंत्रणGooglebot के माध्यम से माना जाता हैGemini के प्रशिक्षण और grounding से बाहर; Search और AI Overviews अप्रभावित
Applebot — AppleSearch index (Siri, Spotlight, Safari)हाँ — नाम न होने पर Googlebot के नियम मानता हैApple की search सतहों से बाहर
Applebot-Extended — Apple (token)प्रशिक्षण नियंत्रणApplebot के माध्यम से माना जाता हैApple के foundation-model प्रशिक्षण से बाहर; Siri और Spotlight में बना रहता है
Meta-ExternalAgent — Metaप्रशिक्षण + indexingहाँMeta AI के प्रशिक्षण और उसके index से बाहर
Meta-ExternalFetcher — MetaUser fetch“May bypass robots.txt” (आधिकारिक)केवल घोषणात्मक
CCBot — Common Crawlखुला web archiveहाँउन सार्वजनिक डेटासेट से बाहर जिन पर कई AI labs प्रशिक्षण करती हैं — एकमुश्त opt-out
Amazonbot — Amazonउत्पाद-सुधार; Amazon के AI मॉडलों का प्रशिक्षण भी कर सकता हैहाँAmazon की crawling से बाहर, किसी भी मॉडल-प्रशिक्षण समेत
Amzn-SearchBot — AmazonSearch index (Alexa search अनुभव; प्रशिक्षण नहीं)हाँ — नाम न होने पर सामान्य search-bot नियम मानता हैAlexa search अनुभवों से बाहर
Amzn-User — AmazonUser fetch (Alexa अनुरोध)“May not follow all robots.txt directives” (आधिकारिक)केवल घोषणात्मक
DuckAssistBot — DuckDuckGoReal-time उत्तर (प्रशिक्षण नहीं)हाँ (72 घंटों के भीतर लागू)DuckAssist उत्तरों से बाहर
Bytespider — ByteDanceप्रशिक्षण (अप्रलेखित)नहीं — मापे गए व्यवहार में इसे अनदेखा करता हैrobots.txt से कुछ नहीं; server-स्तर का block चाहिए
AI crawlers और fetchers — user-agents, काम, और block करने की क़ीमत (अगस्त 2026 में सत्यापित)

AI crawlers को कैसे block करें — या न करें: तीन तैयार configs

तालिका तीन व्यावहारिक नीतियों में बदलती है।

Config 1 — दृश्यता-प्रथम। सब कुछ स्पष्ट रूप से allow करें: तालिका के हर प्रलेखित bot के लिए प्रति-agent Allow group (Bytespider को छोड़कर — फ़ाइल को अनदेखा करने वाले bot के लिए Allow शोर है), साथ में एक catch-all। उन साइटों के लिए सही जो खोजे और उद्धृत होने पर जीती हैं — content व्यवसाय, agencies, अधिकतर B2B। हम स्वयं यही चलाते हैं; नीचे “हम अपनी कैसे चलाते हैं” देखें।

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

…और तालिका के हर agent के लिए इसी तरह। get-geo.ai/robots.txt पर हमारी production फ़ाइल इसका पूरा संस्करण है।

Config 2 — no-training। सबसे आम सोच-समझा चुनाव: मॉडल corpora से बाहर रहें, उत्तरों में बने रहें। प्रशिक्षण crawlers और tokens को disallow करें, बाक़ी को allow। Paste करने से पहले दो चेतावनियाँ: Bytespider वाली पंक्ति केवल घोषणात्मक है (अगला खंड बताता है क्यों), और Meta-ExternalAgent को हटाना एकमात्र ऐसा प्रशिक्षण opt-out है जिसकी दृश्यता में क़ीमत है — यह Meta के index से भी बाहर कर देता है:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: *
Allow: /

Config 3 — lockdown। Paywall वाली या स्वामित्व सामग्री के लिए वैध। robots.txt में कई User-agent पंक्तियाँ एक rule block साझा कर सकती हैं, इसलिए पूरा config संक्षिप्त रहता है — Applebot को हमने यहाँ बाहर रखा है क्योंकि उसे block करना आपको Siri और Spotlight search से भी हटा देता है, जो AI उत्तरों से बड़ा निर्णय है:

User-agent: GPTBot

User-agent: OAI-SearchBot

User-agent: ChatGPT-User

User-agent: ClaudeBot

User-agent: Claude-SearchBot

User-agent: Claude-User

User-agent: PerplexityBot

User-agent: Perplexity-User

User-agent: Google-Extended

User-agent: Applebot-Extended

User-agent: Meta-ExternalAgent

User-agent: Meta-ExternalFetcher

User-agent: CCBot

User-agent: Amazonbot

User-agent: Amzn-SearchBot

User-agent: Amzn-User

User-agent: DuckAssistBot

User-agent: Bytespider
Disallow: /

इसे लगाने से पहले अगला खंड पढ़ें: ऊपर के कई agents के लिए यह फ़ाइल अनुरोध है, बाधा नहीं।

कौन-से AI crawlers robots.txt अनदेखा करते हैं

robots.txt एक प्रकाशित नीति है, प्रवर्तन-तंत्र नहीं — और agents के एक पूरे वर्ग के लिए यह बात vendors स्वयं कहते हैं। OpenAI, ChatGPT-User पर: “Because these actions are initiated by a user, robots.txt rules may not apply.” Meta, Meta-ExternalFetcher पर: यह “may bypass robots.txt because it performs fetches that were requested by the user.” Perplexity का user fetcher “generally ignores robots.txt rules.” Amazon, Amzn-User पर: यह “may not follow all robots.txt directives.” तर्क एक जैसा है: किसी मनुष्य ने पूछा, इसलिए fetch को crawl नहीं, उस मनुष्य की visit माना जाता है।

फिर है Bytespider, जिसका कोई documentation ही नहीं है और जो मापे गए व्यवहार में फ़ाइल को अनदेखा करता है: Cloudflare ने पाया कि यह किसी भी अन्य AI crawler से अधिक संरक्षित साइटों पर पहुँचता है (2024 के मध्य में 40.4%), और HAProxy ने इसे अपने AI-crawler traffic का लगभग 90% मापा और नोट किया कि यह robots.txt निर्देश अनदेखा करता है।

इसलिए प्रवर्तन एक परत नीचे रहता है। Crawlers को उन IP सूचियों से सत्यापित करें जो अधिकतर vendors प्रकाशित करते हैं — OpenAI, Anthropic, Apple, Common Crawl और DuckDuckGo JSON सूचियाँ रखते हैं, Amazon अपनी ranges अपने developer पेज पर प्रकाशित करता है — और जिसे वास्तव में रोकना है उसे CDN या WAF पर block करें। सत्यापन जितना लगता है उससे अधिक मायने रखता है: HUMAN Security ने मापा कि ज्ञात AI-crawler user-agent वाला हर अठारहवाँ request नक़ली है।

हम अपनी कैसे चलाते हैं

हमारी अपनी robots.txt दृश्यता-प्रथम config है: उन्नीस स्पष्ट प्रति-agent Allow groups — तालिका का हर वह agent जो फ़ाइल मानता है, वे user fetchers जिनका हम वैसे भी स्वागत करते हैं, और classic Bingbot — और अंत में एक catch-all Allow। हमने इसे अगस्त 2026 में इस रूप में ढाला, उसी बदलाव में legacy anthropic-ai group हटाया — और इस guide की तथ्य-जाँच करते हुए एक अटकल-आधारित cohere-ai group भी: Cohere के अपने docs कहते हैं कि वह फ़िलहाल कोई crawler नहीं चलाता।

स्वाभाविक आपत्ति: एक पंक्ति की “User-agent: * / Allow: /” वही crawler-व्यवहार देगी। सही। स्पष्ट groups तीन चीज़ें देते हैं जो एक-पंक्ति नहीं देती। हर vendor को आपत्ति की अनुपस्थिति नहीं, इरादे का असंदिग्ध संकेत मिलता है। भविष्य के संपादन अधिक सुरक्षित हैं — एक agent के लिए जोड़ा गया Disallow चुपचाप उन agents पर लागू नहीं हो सकता जिनके बारे में किसी ने सोचा ही नहीं। और फ़ाइल हमारी review checklist भी है: जब कोई vendor नया agent जारी करता है, जैसा OpenAI और Anthropic दोनों ने पिछले दो वर्षों में किया, तो कमी फ़ाइल में और हमारे crawl logs में स्वयं दिख जाती है।

यह फ़ाइल उस setup का एक हिस्सा है जिसे हम अपनी साइट पर GEO कैसे करते हैं वाले guide में प्रलेखित करते हैं। यह उस साइट की नीति है जो AI citations से अपनी रोज़ी कमाती है। Paywall वाले archives वाला कोई publisher उचित रूप से config 2 या 3 चलाएगा — इस guide का उद्देश्य हमारा उत्तर नहीं, वह तालिका है जिससे आप अपना उत्तर चुन सकें। जो भी config चुनें, कैलेंडर पर तिमाही review रखें: सूची बदलती रहती है — OpenAI ने 2024 में OAI-SearchBot जोड़ा, Anthropic ने 2025 में Claude-SearchBot, और Amazon ने 2026 तक अपनी crawling तीन agents में बाँट दी — और 2024 में लिखी robots.txt आज के crawlers के बारे में पहले से ही ग़लत है।

संबंधित प्रश्न

क्या मुझे AI crawlers को block करना चाहिए?

प्रश्न को काम के अनुसार बाँटें। प्रशिक्षण crawlers (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot, Amazonbot) को block करने से search दृश्यता की कोई क़ीमत नहीं — Google और Apple के लिए स्पष्ट रूप से प्रलेखित, बाक़ी के लिए संरचनात्मक। अपवाद Meta-ExternalAgent है, जो एक ही agent में प्रशिक्षण और indexing करता है: उसे block करना दोनों से बाहर कर देता है। Search-index और user-fetch agents को block करना आपको AI उत्तरों से हटा देता है, जहाँ ख़रीद-प्रश्नों का बढ़ता हिस्सा पूछा जाता है। प्रशिक्षण का प्रश्न सिद्धांत पर तय करें; दृश्यता का प्रश्न इस पर कि आपकी citations और traffic कहाँ से आते हैं।

क्या GPTBot को block करने से मेरी साइट ChatGPT से हट जाती है?

नहीं। GPTBot केवल मॉडल-प्रशिक्षण को भरता है। ChatGPT की search OAI-SearchBot पर चलती है, और उपयोगकर्ता-अनुरोधित पेज-पठन ChatGPT-User से होता है — GPTBot को block करें तो दोनों काम करते रहते हैं। यही विभाजन Anthropic में ClaudeBot बनाम Claude-SearchBot और Claude-User का है।

क्या Google-Extended AI Overviews को प्रभावित करता है?

नहीं — और यह इस विषय की सबसे आम ग़लती है। Google प्रलेखित करता है कि Google-Extended Gemini के प्रशिक्षण और grounding को नियंत्रित करता है, और “does not impact a site’s inclusion in Google Search.” AI Overviews और AI Mode स्वयं Search का हिस्सा हैं: वे Googlebot access और snippet नियंत्रणों — nosnippet, data-nosnippet, max-snippet, noindex — से शासित होते हैं। पूरा तंत्र Google AI Overviews में दिखने पर हमारे guide में है।

कैसे सत्यापित करूँ कि crawler असली है?

केवल user-agent string पर कभी भरोसा न करें — HUMAN Security के 2026 के मापों के अनुसार, ज्ञात AI crawler होने का दावा करने वाला हर अठारहवाँ request नक़ली है। Source IP को vendor की प्रकाशित सूची से मिलाएँ: OpenAI, Anthropic, Apple, Common Crawl और DuckDuckGo JSON IP सूचियाँ प्रकाशित करते हैं, Amazon अपनी ranges अपने developer पेज पर देता है, और Google तथा Apple reverse-DNS सत्यापन का समर्थन करते हैं। जो जाँच में विफल हो, वह अपने को जो भी कहे, scraper माना जाता है।

क्या robots.txt पर्याप्त है, या llms.txt भी चाहिए?

दोनों के काम अलग हैं। robots.txt access नियंत्रित करता है — कौन क्या fetch कर सकता है। llms.txt एक navigation सहायक है — मशीन-पठनीय नक़्शा जो मॉडलों को अंदर आने के बाद आपके प्रमुख पेज खोजने और समझने में मदद करता है। पहले access: सर्वव्यापी Disallow के पीछे रखी llms.txt किसी के काम की नहीं। llms.txt को इस श्रृंखला में अपना अलग guide मिलता है।

संबंधित गाइड

स्रोत

  1. 01हमारा guide: Google AI Overviews में कैसे दिखें?
  2. 02हमारा guide: अपनी साइट पर व्यवहार में GEO कैसे करें?
  3. 03OpenAI — bot documentation: GPTBot, OAI-SearchBot, ChatGPT-User
  4. 04Anthropic — crawler documentation: ClaudeBot, Claude-SearchBot, Claude-User
  5. 05Perplexity — crawler documentation: PerplexityBot, Perplexity-User
  6. 06Google — common crawlers और Google-Extended
  7. 07Google — Search में AI सुविधाएँ और site owner नियंत्रण
  8. 08Apple — Applebot और Applebot-Extended
  9. 09Meta — web crawlers: Meta-ExternalAgent, Meta-ExternalFetcher
  10. 10Common Crawl — CCBot documentation
  11. 11Amazon — Amazonbot documentation
  12. 12DuckDuckGo — DuckAssistBot documentation
  13. 13Cloudflare — AI platforms का crawl-to-refer अनुपात (जुलाई 2025) और live AI Insights
  14. 14Cloudflare — AI-bot traffic और blocks में Bytespider सबसे आगे (जुलाई 2024)
  15. 15HAProxy — हमारे AI-crawler traffic का ~90% Bytespider है (अक्टूबर 2024)
  16. 16HUMAN Security — 2026 State of AI traffic: crawler spoofing benchmarks

// साझा करें

LinkedInXReddit