דלג לתוכן
GET-GEO.AI
/
כל המדריכים

// מדריך

איך מגדירים robots.txt ל-crawlers של AI?

עודכן: 2026-08-19

// תשובה קצרה

הגדרת robots.txt ל-crawlers של AI היא שלוש החלטות נפרדות, לא אחת: האם להכניס crawlers של אימון, crawlers של אינדקס חיפוש ו-fetchers המופעלים בידי משתמשים. כל ספק מפעיל user-agents שונים לכל תפקיד. רוב האתרים צריכים לאפשר חיפוש והבאות של משתמשים, להחליט במודע לגבי אימון — ולדעת שחלק מה-fetchers מתעלמים מ-robots.txt לחלוטין.

החלטה אחת היא בעצם שלוש

ל«האם לחסום bots של AI?» אין תשובה, כי זו אינה שאלה אחת. כל חברת AI מרכזית מפעילה crawlers נפרדים לתפקידים נפרדים: crawlers של אימון מזינים את קורפוסי המודלים, crawlers של אינדקס חיפוש מזינים את התשובות שמצטטות אתכם, ו-fetchers המופעלים בידי משתמשים קוראים דף כי אדם בדיוק שאל עליו את העוזר. חסמו את כולם בשורה אחת — ולא נקטתם עמדה על אימון AI, אלא הסרתם את עצמכם מתשובות AI.

העלויות אינן סימטריות. חסימת crawler של אימון היא בחירה עקרונית שברוב המקרים אין לה מחיר נראות: Google ו-Apple מתעדות זאת במפורש, ואצל OpenAI ו-Anthropic זה נובע מהפרדת ה-bots — החיפוש רץ על agents נפרדים שתוצאות חסימתם מתועדות בנפרד. לחסימת agent של חיפוש או של הבאת משתמש יש מחיר ישיר ומתועד — OpenAI, למשל, מצהירה שאתרים שביטלו את OAI-SearchBot «לא יוצגו בתשובות החיפוש של ChatGPT». המכניקה לכל מנוע מכוסה במדריכים שלנו על קבלת ציטוטים מ-ChatGPT, מ-Claude ומ-Perplexity; הדף הזה הוא המפה המלאה.

שני מספרים ממסגרים את העסקה. Cloudflare מדדה כמה דפים חברות AI סורקות על כל ביקור שהן מחזירות בתמורה: לפי נתוני Cloudflare Radar ליוני 2025, בערך 1,700 סריקות לכל הפניה אצל OpenAI וכ-70,900 אצל Anthropic. היחסים יורדים מאז — לוח המחוונים AI Insights של Cloudflare עוקב אחריהם בזמן אמת — אבל צורת העסקה ברורה: אתם מחליפים סריקה כבדה בציטוטים. הטבלה למטה היא הדרך שבה אתם קובעים את התנאים.

רשימת ה-crawlers המלאה של AI, מאומתת מול תיעוד הספקים

כל שורה למטה נבדקה מול התיעוד של המפעיל עצמו נכון לאוגוסט 2026. «Token» פירושו שהשם עובד רק כקבוצת robots.txt — אין crawler נפרד עם ה-user-agent הזה.

Crawlers ו-fetchers של AI — ‏user-agents, תפקידים ומחיר החסימה (מאומת אוגוסט 2026)
User-agentתפקידמכבד robots.txtמה עולה לכם החסימה
GPTBot — OpenAIאימוןכןתוכן עתידי מוחרג מאימון המודלים של OpenAI; ‏חיפוש ChatGPT רץ על OAI-SearchBot
OAI-SearchBot — OpenAIאינדקס חיפושכן«לא יוצגו בתשובות החיפוש של ChatGPT»
ChatGPT-User — OpenAIהבאה ביוזמת משתמש«הכללים עשויים לא לחול» (רשמי)הצהרתי בלבד — ההבאות מופעלות בידי משתמשים
ClaudeBot — Anthropicאימוןכןתוכן עתידי מוחרג ממערכי האימון של Anthropic
Claude-SearchBot — Anthropicאינדקס חיפושכןללא אינדוקס — «עלול להפחית את נראות האתר שלכם»
Claude-User — Anthropicהבאה ביוזמת משתמשכןאי אפשר להביא את הדף לפי בקשת משתמש Claude
PerplexityBot — Perplexityאינדקס חיפושכןמחוץ לאינדקס החיפוש והציטוטים של Perplexity
Perplexity-User — Perplexityהבאה ביוזמת משתמש«בדרך כלל מתעלם מ-robots.txt» (רשמי)הצהרתי בלבד
Google-Extended — Google (token)אימון + בקרת groundingמכובד דרך Googlebotמחוץ לאימון ול-grounding של Gemini; ‏חיפוש Google ו-AI Overviews אינם מושפעים
Applebot — Appleאינדקס חיפוש (Siri, ‏Spotlight, ‏Safari)כן — פועל לפי כללי Googlebot אם אינו נזכר בשםמחוץ למשטחי החיפוש של Apple
Applebot-Extended — Apple (token)בקרת אימוןמכובד דרך Applebotמחוץ לאימון מודלי הבסיס של Apple; נשאר ב-Siri וב-Spotlight
Meta-ExternalAgent — Metaאימון + אינדוקסכןמחוץ לאימון Meta AI ולאינדקס שלה
Meta-ExternalFetcher — Metaהבאה ביוזמת משתמש«עשוי לעקוף את robots.txt» (רשמי)הצהרתי בלבד
CCBot — Common Crawlארכיון רשת פתוחכןמחוץ למערכי הנתונים הציבוריים שעליהם מתאמנות מעבדות AI רבות — ביטול הצטרפות סיטונאי
Amazonbot — Amazonשיפור מוצרים; עשוי לאמן מודלי AI של Amazonכןמחוץ לסריקה של Amazon, כולל כל אימון מודלים
Amzn-SearchBot — Amazonאינדקס חיפוש (חוויות חיפוש של Alexa; ללא אימון)כן — פועל לפי כללי search-bot כלליים אם אינו נזכר בשםמחוץ לחוויות החיפוש של Alexa
Amzn-User — Amazonהבאה ביוזמת משתמש (בקשות Alexa)«עשוי לא לציית לכל הנחיות robots.txt» (רשמי)הצהרתי בלבד
DuckAssistBot — DuckDuckGoתשובות בזמן אמת (ללא אימון)כן (נכנס לתוקף בתוך 72 שעות)מחוץ לתשובות DuckAssist
Bytespider — ByteDanceאימון (לא מתועד)לא — מתעלם ממנו בפועל הנמדדשום דבר דרך robots.txt; נדרשת חסימה ברמת השרת
Crawlers ו-fetchers של AI — ‏user-agents, תפקידים ומחיר החסימה (מאומת אוגוסט 2026)

איך חוסמים crawlers של AI — או לא: שלוש תצורות מוכנות

הטבלה מיתרגמת לשלוש מדיניויות מעשיות.

תצורה 1 — נראות תחילה. אפשרו הכול, במפורש: קבוצת Allow נפרדת לכל bot מתועד בטבלה (כולם מלבד Bytespider ‏— Allow ל-bot שמתעלם מהקובץ הוא רעש), ועוד כלל catch-all. מתאים לאתרים שחיים מהימצאות ומציטוט — עסקי תוכן, סוכנויות, רוב ה-B2B. זה מה שאנחנו מריצים בעצמנו; ראו «איך אנחנו מריצים את שלנו» למטה.

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

…וכן הלאה לכל agent בטבלה. קובץ ה-production שלנו ב-get-geo.ai/robots.txt הוא הגרסה המלאה.

תצורה 2 — ללא אימון. הבחירה המודעת הנפוצה ביותר: להישאר מחוץ לקורפוסי המודלים, להישאר בתשובות. עשו Disallow ל-crawlers ולטוקנים של האימון, ואפשרו את השאר. שתי הסתייגויות לפני שאתם מדביקים: שורת ה-Bytespider היא הצהרתית בלבד (הפרק הבא מסביר למה), והשמטת Meta-ExternalAgent היא ביטול האימון היחיד עם מחיר נראות — היא מוציאה אתכם גם מהאינדקס של Meta:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: *
Allow: /

תצורה 3 — נעילה מלאה. לגיטימי לתוכן בתשלום או קנייני. robots.txt מאפשר לכמה שורות User-agent לחלוק בלוק כללים אחד, כך שהכול נשאר קומפקטי — את Applebot השארנו כאן בחוץ, כי חסימתו מסירה אתכם גם מחיפוש Siri ו-Spotlight, וזו החלטה גדולה יותר מתשובות AI:

User-agent: GPTBot

User-agent: OAI-SearchBot

User-agent: ChatGPT-User

User-agent: ClaudeBot

User-agent: Claude-SearchBot

User-agent: Claude-User

User-agent: PerplexityBot

User-agent: Perplexity-User

User-agent: Google-Extended

User-agent: Applebot-Extended

User-agent: Meta-ExternalAgent

User-agent: Meta-ExternalFetcher

User-agent: CCBot

User-agent: Amazonbot

User-agent: Amzn-SearchBot

User-agent: Amzn-User

User-agent: DuckAssistBot

User-agent: Bytespider
Disallow: /

קראו את הפרק הבא לפני שאתם מטמיעים את זה: אצל כמה מה-agents שלמעלה, הקובץ הוא בקשה, לא מחסום.

אילו crawlers של AI מתעלמים מ-robots.txt

robots.txt הוא מדיניות מפורסמת, לא מנגנון אכיפה — ולגבי מחלקה שלמה של agents, הספקים אומרים זאת בעצמם. OpenAI על ChatGPT-User: ‏«מכיוון שפעולות אלה מופעלות בידי משתמש, כללי robots.txt עשויים לא לחול». Meta על Meta-ExternalFetcher: הוא «עשוי לעקוף את robots.txt כי הוא מבצע הבאות שהתבקשו בידי המשתמש». הפצ'ר של Perplexity המופעל בידי משתמש «בדרך כלל מתעלם מכללי robots.txt». Amazon על Amzn-User: הוא «עשוי לא לציית לכל הנחיות robots.txt». ההיגיון עקבי: אדם שאל, ולכן ההבאה נחשבת לביקור של האדם, לא לסריקה.

ואז יש את Bytespider, שאין לו תיעוד כלל והוא מתעלם מהקובץ בפועל הנמדד: Cloudflare מצאה שהוא פוגע ביותר אתרים מוגנים מכל crawler אחר של AI ‏(40.4% באמצע 2024), ו-HAProxy מדדה אותו בקרוב ל-90% מתעבורת ה-AI-crawlers שלה, תוך ציון שהוא מתעלם מהנחיות robots.txt.

לכן האכיפה יושבת שכבה אחת למטה. אמתו crawlers מול רשימות ה-IP שרוב הספקים מפרסמים — OpenAI, ‏Anthropic, ‏Apple, ‏Common Crawl ו-DuckDuckGo מתחזקים רשימות JSON, ‏Amazon מפרסמת את הטווחים שלה בדף המפתחים שלה — וחסמו ב-CDN או ב-WAF את מה שאתם באמת רוצים לעצור. האימות חשוב יותר משנדמה: HUMAN Security מדדה שאחת מכל שמונה עשרה בקשות הנושאות user-agent של AI-crawler מוכר היא מזויפת.

איך אנחנו מריצים את שלנו

קובץ ה-robots.txt שלנו הוא תצורת הנראות-תחילה: תשע עשרה קבוצות Allow מפורשות לכל agent — כל agent מהטבלה שמכבד את הקובץ, ה-fetchers של המשתמשים שממילא אנו מקבלים בברכה, ו-Bingbot הקלאסי — ואחריהן Allow גורף. עיצבנו אותו מחדש לצורה הזו באוגוסט 2026, והסרנו באותו מהלך את קבוצת anthropic-ai הישנה — ובזמן בדיקת העובדות למדריך הזה, גם קבוצת cohere-ai ספקולטיבית: התיעוד של Cohere עצמה קובע שהיא אינה מפעילה crawlers בשלב זה.

ההתנגדות המתבקשת: שורה אחת של «User-agent: * / Allow: /‎» הייתה מניבה התנהגות crawler זהה. נכון. הקבוצות המפורשות קונות שלושה דברים שהשורה האחת לא. כל ספק מקבל איתות כוונה חד-משמעי ולא היעדר התנגדות. עריכות עתידיות בטוחות יותר — Disallow שנוסף ל-agent אחד לא יכול לחול בשקט על agents שאיש לא חשב עליהם. והקובץ משמש גם כרשימת הביקורת שלנו: כשספק משיק agent חדש, כפי שעשו OpenAI ו-Anthropic בשנתיים האחרונות, הפער נראה בקובץ עצמו וביומני הסריקה שלנו.

הקובץ הוא חלק אחד מהמערך שאנו מתעדים במדריך על איך אנחנו עושים GEO באתר של עצמנו. זו המדיניות של אתר שמתפרנס מציטוטי AI. מוציא לאור עם ארכיונים בתשלום היה בוחר בסבירות בתצורה 2 או 3 — הנקודה של המדריך הזה אינה התשובה שלנו אלא הטבלה שמאפשרת לכם לבחור את שלכם. תהיה התצורה אשר תהיה, קבעו ביקורת רבעונית ביומן: הרשימה ממשיכה לזוז — OpenAI הוסיפה את OAI-SearchBot ב-2024, ‏Anthropic הוסיפה את Claude-SearchBot ב-2025, ‏Amazon פיצלה את הסריקה שלה לשלושה agents עד 2026 — וקובץ robots.txt שנכתב ב-2024 כבר טועה לגבי ה-crawlers של היום.

שאלות קשורות

האם לחסום crawlers של AI?

פצלו את השאלה לפי תפקיד. חסימת crawlers של אימון (GPTBot, ‏ClaudeBot, ‏Google-Extended, ‏Applebot-Extended, ‏CCBot, ‏Amazonbot) אינה עולה בנראות בחיפוש — מתועד במפורש אצל Google ו-Apple, ומבני אצל השאר. היוצא מן הכלל הוא Meta-ExternalAgent, שמאמן ומאנדקס ב-agent אחד: חסימתו מוציאה משניהם. חסימת agents של אינדקס חיפוש ושל הבאות משתמשים מסירה אתכם מתשובות AI, שם נשאל חלק גדל והולך של שאלות קנייה. את שאלת האימון הכריעו על פי עיקרון; את שאלת הנראות — על פי מקור הציטוטים והתנועה שלכם.

האם חסימת GPTBot מסירה את האתר שלי מ-ChatGPT?

לא. GPTBot מזין רק אימון מודלים. החיפוש של ChatGPT רץ על OAI-SearchBot, וקריאות דפים לבקשת משתמש עוברות דרך ChatGPT-User — חסמו את GPTBot ושניהם ימשיכו לעבוד. זו אותה הפרדה ש-Anthropic מפעילה עם ClaudeBot לעומת Claude-SearchBot ו-Claude-User.

האם Google-Extended משפיע על AI Overviews?

לא — וזו הטעות הנפוצה ביותר בז'אנר. Google מתעדת ש-Google-Extended שולט באימון וב-grounding של Gemini, ו«אינו משפיע על הכללת אתר בחיפוש Google». AI Overviews ו-AI Mode הם חלק מהחיפוש עצמו: הם נשלטים על ידי הגישה של Googlebot ובקרות ה-snippet ‏— nosnippet, ‏data-nosnippet, ‏max-snippet, ‏noindex. המכניקה המלאה נמצאת במדריך שלנו על הופעה ב-AI Overviews של Google.

איך מאמתים ש-crawler הוא אמיתי?

לעולם אל תסמכו על מחרוזת ה-user-agent לבדה — אחת מכל שמונה עשרה בקשות שמתיימרות להיות AI crawler מוכר היא מזויפת, לפי מדידות HUMAN Security מ-2026. בדקו את ה-IP של המקור מול הרשימה שהספק מפרסם: OpenAI, ‏Anthropic, ‏Apple, ‏Common Crawl ו-DuckDuckGo מפרסמים רשימות IP בפורמט JSON, ‏Amazon מפרסמת את הטווחים שלה בדף המפתחים שלה, ו-Google ו-Apple תומכות באימות reverse-DNS. כל מה שנכשל בבדיקה מטופל כ-scraper, יהיה שמו אשר יהיה.

האם robots.txt מספיק, או שצריך גם llms.txt?

הם עושים עבודות שונות. robots.txt שולט בגישה — מי רשאי להביא מה. llms.txt הוא עזר ניווט — מפה קריאה למכונה שעוזרת למודלים למצוא ולפרש את הדפים המרכזיים שלכם אחרי שנכנסו. גישה קודם: llms.txt מאחורי Disallow גורף אינו עוזר לאיש. ל-llms.txt מוקדש מדריך משלו בסדרה הזו.

מדריכים קשורים

מקורות

  1. 01המדריך שלנו: איך מופיעים ב-AI Overviews של Google?
  2. 02המדריך שלנו: איך עושים GEO באתר שלכם בפועל?
  3. 03OpenAI — תיעוד bots: ‏GPTBot, ‏OAI-SearchBot, ‏ChatGPT-User
  4. 04Anthropic — תיעוד crawlers: ‏ClaudeBot, ‏Claude-SearchBot, ‏Claude-User
  5. 05Perplexity — תיעוד crawlers: ‏PerplexityBot, ‏Perplexity-User
  6. 06Google — ה-crawlers הנפוצים ו-Google-Extended
  7. 07Google — יכולות AI בחיפוש ובקרות לבעלי אתרים
  8. 08Apple — Applebot ו-Applebot-Extended
  9. 09Meta — ה-crawlers של הרשת: Meta-ExternalAgent ו-Meta-ExternalFetcher
  10. 10Common Crawl — תיעוד CCBot
  11. 11Amazon — תיעוד Amazonbot
  12. 12DuckDuckGo — תיעוד DuckAssistBot
  13. 13Cloudflare — יחס הסריקה להפניה של פלטפורמות AI ‏(יולי 2025) ו-AI Insights בזמן אמת
  14. 14Cloudflare — Bytespider מוביל בתעבורת bots של AI ובחסימות (יולי 2024)
  15. 15HAProxy — כ-90% מתעבורת ה-AI-crawlers שלנו היא Bytespider ‏(אוקטובר 2024)
  16. 16HUMAN Security — ‏2026 State of AI traffic: ‏benchmarks של זיוף crawlers

// שיתוף

LinkedInXReddit