// מדריך
איך מגדירים robots.txt ל-crawlers של AI?
עודכן: 2026-08-19
// תשובה קצרה
הגדרת robots.txt ל-crawlers של AI היא שלוש החלטות נפרדות, לא אחת: האם להכניס crawlers של אימון, crawlers של אינדקס חיפוש ו-fetchers המופעלים בידי משתמשים. כל ספק מפעיל user-agents שונים לכל תפקיד. רוב האתרים צריכים לאפשר חיפוש והבאות של משתמשים, להחליט במודע לגבי אימון — ולדעת שחלק מה-fetchers מתעלמים מ-robots.txt לחלוטין.
החלטה אחת היא בעצם שלוש
ל«האם לחסום bots של AI?» אין תשובה, כי זו אינה שאלה אחת. כל חברת AI מרכזית מפעילה crawlers נפרדים לתפקידים נפרדים: crawlers של אימון מזינים את קורפוסי המודלים, crawlers של אינדקס חיפוש מזינים את התשובות שמצטטות אתכם, ו-fetchers המופעלים בידי משתמשים קוראים דף כי אדם בדיוק שאל עליו את העוזר. חסמו את כולם בשורה אחת — ולא נקטתם עמדה על אימון AI, אלא הסרתם את עצמכם מתשובות AI.
העלויות אינן סימטריות. חסימת crawler של אימון היא בחירה עקרונית שברוב המקרים אין לה מחיר נראות: Google ו-Apple מתעדות זאת במפורש, ואצל OpenAI ו-Anthropic זה נובע מהפרדת ה-bots — החיפוש רץ על agents נפרדים שתוצאות חסימתם מתועדות בנפרד. לחסימת agent של חיפוש או של הבאת משתמש יש מחיר ישיר ומתועד — OpenAI, למשל, מצהירה שאתרים שביטלו את OAI-SearchBot «לא יוצגו בתשובות החיפוש של ChatGPT». המכניקה לכל מנוע מכוסה במדריכים שלנו על קבלת ציטוטים מ-ChatGPT, מ-Claude ומ-Perplexity; הדף הזה הוא המפה המלאה.
שני מספרים ממסגרים את העסקה. Cloudflare מדדה כמה דפים חברות AI סורקות על כל ביקור שהן מחזירות בתמורה: לפי נתוני Cloudflare Radar ליוני 2025, בערך 1,700 סריקות לכל הפניה אצל OpenAI וכ-70,900 אצל Anthropic. היחסים יורדים מאז — לוח המחוונים AI Insights של Cloudflare עוקב אחריהם בזמן אמת — אבל צורת העסקה ברורה: אתם מחליפים סריקה כבדה בציטוטים. הטבלה למטה היא הדרך שבה אתם קובעים את התנאים.
רשימת ה-crawlers המלאה של AI, מאומתת מול תיעוד הספקים
כל שורה למטה נבדקה מול התיעוד של המפעיל עצמו נכון לאוגוסט 2026. «Token» פירושו שהשם עובד רק כקבוצת robots.txt — אין crawler נפרד עם ה-user-agent הזה.
| User-agent | תפקיד | מכבד robots.txt | מה עולה לכם החסימה |
|---|---|---|---|
| GPTBot — OpenAI | אימון | כן | תוכן עתידי מוחרג מאימון המודלים של OpenAI; חיפוש ChatGPT רץ על OAI-SearchBot |
| OAI-SearchBot — OpenAI | אינדקס חיפוש | כן | «לא יוצגו בתשובות החיפוש של ChatGPT» |
| ChatGPT-User — OpenAI | הבאה ביוזמת משתמש | «הכללים עשויים לא לחול» (רשמי) | הצהרתי בלבד — ההבאות מופעלות בידי משתמשים |
| ClaudeBot — Anthropic | אימון | כן | תוכן עתידי מוחרג ממערכי האימון של Anthropic |
| Claude-SearchBot — Anthropic | אינדקס חיפוש | כן | ללא אינדוקס — «עלול להפחית את נראות האתר שלכם» |
| Claude-User — Anthropic | הבאה ביוזמת משתמש | כן | אי אפשר להביא את הדף לפי בקשת משתמש Claude |
| PerplexityBot — Perplexity | אינדקס חיפוש | כן | מחוץ לאינדקס החיפוש והציטוטים של Perplexity |
| Perplexity-User — Perplexity | הבאה ביוזמת משתמש | «בדרך כלל מתעלם מ-robots.txt» (רשמי) | הצהרתי בלבד |
| Google-Extended — Google (token) | אימון + בקרת grounding | מכובד דרך Googlebot | מחוץ לאימון ול-grounding של Gemini; חיפוש Google ו-AI Overviews אינם מושפעים |
| Applebot — Apple | אינדקס חיפוש (Siri, Spotlight, Safari) | כן — פועל לפי כללי Googlebot אם אינו נזכר בשם | מחוץ למשטחי החיפוש של Apple |
| Applebot-Extended — Apple (token) | בקרת אימון | מכובד דרך Applebot | מחוץ לאימון מודלי הבסיס של Apple; נשאר ב-Siri וב-Spotlight |
| Meta-ExternalAgent — Meta | אימון + אינדוקס | כן | מחוץ לאימון Meta AI ולאינדקס שלה |
| Meta-ExternalFetcher — Meta | הבאה ביוזמת משתמש | «עשוי לעקוף את robots.txt» (רשמי) | הצהרתי בלבד |
| CCBot — Common Crawl | ארכיון רשת פתוח | כן | מחוץ למערכי הנתונים הציבוריים שעליהם מתאמנות מעבדות AI רבות — ביטול הצטרפות סיטונאי |
| Amazonbot — Amazon | שיפור מוצרים; עשוי לאמן מודלי AI של Amazon | כן | מחוץ לסריקה של Amazon, כולל כל אימון מודלים |
| Amzn-SearchBot — Amazon | אינדקס חיפוש (חוויות חיפוש של Alexa; ללא אימון) | כן — פועל לפי כללי search-bot כלליים אם אינו נזכר בשם | מחוץ לחוויות החיפוש של Alexa |
| Amzn-User — Amazon | הבאה ביוזמת משתמש (בקשות Alexa) | «עשוי לא לציית לכל הנחיות robots.txt» (רשמי) | הצהרתי בלבד |
| DuckAssistBot — DuckDuckGo | תשובות בזמן אמת (ללא אימון) | כן (נכנס לתוקף בתוך 72 שעות) | מחוץ לתשובות DuckAssist |
| Bytespider — ByteDance | אימון (לא מתועד) | לא — מתעלם ממנו בפועל הנמדד | שום דבר דרך robots.txt; נדרשת חסימה ברמת השרת |
איך חוסמים crawlers של AI — או לא: שלוש תצורות מוכנות
הטבלה מיתרגמת לשלוש מדיניויות מעשיות.
תצורה 1 — נראות תחילה. אפשרו הכול, במפורש: קבוצת Allow נפרדת לכל bot מתועד בטבלה (כולם מלבד Bytespider — Allow ל-bot שמתעלם מהקובץ הוא רעש), ועוד כלל catch-all. מתאים לאתרים שחיים מהימצאות ומציטוט — עסקי תוכן, סוכנויות, רוב ה-B2B. זה מה שאנחנו מריצים בעצמנו; ראו «איך אנחנו מריצים את שלנו» למטה.
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /…וכן הלאה לכל agent בטבלה. קובץ ה-production שלנו ב-get-geo.ai/robots.txt הוא הגרסה המלאה.
תצורה 2 — ללא אימון. הבחירה המודעת הנפוצה ביותר: להישאר מחוץ לקורפוסי המודלים, להישאר בתשובות. עשו Disallow ל-crawlers ולטוקנים של האימון, ואפשרו את השאר. שתי הסתייגויות לפני שאתם מדביקים: שורת ה-Bytespider היא הצהרתית בלבד (הפרק הבא מסביר למה), והשמטת Meta-ExternalAgent היא ביטול האימון היחיד עם מחיר נראות — היא מוציאה אתכם גם מהאינדקס של Meta:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: *
Allow: /תצורה 3 — נעילה מלאה. לגיטימי לתוכן בתשלום או קנייני. robots.txt מאפשר לכמה שורות User-agent לחלוק בלוק כללים אחד, כך שהכול נשאר קומפקטי — את Applebot השארנו כאן בחוץ, כי חסימתו מסירה אתכם גם מחיפוש Siri ו-Spotlight, וזו החלטה גדולה יותר מתשובות AI:
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: Meta-ExternalFetcher
User-agent: CCBot
User-agent: Amazonbot
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: Bytespider
Disallow: /קראו את הפרק הבא לפני שאתם מטמיעים את זה: אצל כמה מה-agents שלמעלה, הקובץ הוא בקשה, לא מחסום.
אילו crawlers של AI מתעלמים מ-robots.txt
robots.txt הוא מדיניות מפורסמת, לא מנגנון אכיפה — ולגבי מחלקה שלמה של agents, הספקים אומרים זאת בעצמם. OpenAI על ChatGPT-User: «מכיוון שפעולות אלה מופעלות בידי משתמש, כללי robots.txt עשויים לא לחול». Meta על Meta-ExternalFetcher: הוא «עשוי לעקוף את robots.txt כי הוא מבצע הבאות שהתבקשו בידי המשתמש». הפצ'ר של Perplexity המופעל בידי משתמש «בדרך כלל מתעלם מכללי robots.txt». Amazon על Amzn-User: הוא «עשוי לא לציית לכל הנחיות robots.txt». ההיגיון עקבי: אדם שאל, ולכן ההבאה נחשבת לביקור של האדם, לא לסריקה.
ואז יש את Bytespider, שאין לו תיעוד כלל והוא מתעלם מהקובץ בפועל הנמדד: Cloudflare מצאה שהוא פוגע ביותר אתרים מוגנים מכל crawler אחר של AI (40.4% באמצע 2024), ו-HAProxy מדדה אותו בקרוב ל-90% מתעבורת ה-AI-crawlers שלה, תוך ציון שהוא מתעלם מהנחיות robots.txt.
לכן האכיפה יושבת שכבה אחת למטה. אמתו crawlers מול רשימות ה-IP שרוב הספקים מפרסמים — OpenAI, Anthropic, Apple, Common Crawl ו-DuckDuckGo מתחזקים רשימות JSON, Amazon מפרסמת את הטווחים שלה בדף המפתחים שלה — וחסמו ב-CDN או ב-WAF את מה שאתם באמת רוצים לעצור. האימות חשוב יותר משנדמה: HUMAN Security מדדה שאחת מכל שמונה עשרה בקשות הנושאות user-agent של AI-crawler מוכר היא מזויפת.
איך אנחנו מריצים את שלנו
קובץ ה-robots.txt שלנו הוא תצורת הנראות-תחילה: תשע עשרה קבוצות Allow מפורשות לכל agent — כל agent מהטבלה שמכבד את הקובץ, ה-fetchers של המשתמשים שממילא אנו מקבלים בברכה, ו-Bingbot הקלאסי — ואחריהן Allow גורף. עיצבנו אותו מחדש לצורה הזו באוגוסט 2026, והסרנו באותו מהלך את קבוצת anthropic-ai הישנה — ובזמן בדיקת העובדות למדריך הזה, גם קבוצת cohere-ai ספקולטיבית: התיעוד של Cohere עצמה קובע שהיא אינה מפעילה crawlers בשלב זה.
ההתנגדות המתבקשת: שורה אחת של «User-agent: * / Allow: /» הייתה מניבה התנהגות crawler זהה. נכון. הקבוצות המפורשות קונות שלושה דברים שהשורה האחת לא. כל ספק מקבל איתות כוונה חד-משמעי ולא היעדר התנגדות. עריכות עתידיות בטוחות יותר — Disallow שנוסף ל-agent אחד לא יכול לחול בשקט על agents שאיש לא חשב עליהם. והקובץ משמש גם כרשימת הביקורת שלנו: כשספק משיק agent חדש, כפי שעשו OpenAI ו-Anthropic בשנתיים האחרונות, הפער נראה בקובץ עצמו וביומני הסריקה שלנו.
הקובץ הוא חלק אחד מהמערך שאנו מתעדים במדריך על איך אנחנו עושים GEO באתר של עצמנו. זו המדיניות של אתר שמתפרנס מציטוטי AI. מוציא לאור עם ארכיונים בתשלום היה בוחר בסבירות בתצורה 2 או 3 — הנקודה של המדריך הזה אינה התשובה שלנו אלא הטבלה שמאפשרת לכם לבחור את שלכם. תהיה התצורה אשר תהיה, קבעו ביקורת רבעונית ביומן: הרשימה ממשיכה לזוז — OpenAI הוסיפה את OAI-SearchBot ב-2024, Anthropic הוסיפה את Claude-SearchBot ב-2025, Amazon פיצלה את הסריקה שלה לשלושה agents עד 2026 — וקובץ robots.txt שנכתב ב-2024 כבר טועה לגבי ה-crawlers של היום.
שאלות קשורות
האם לחסום crawlers של AI?
פצלו את השאלה לפי תפקיד. חסימת crawlers של אימון (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot, Amazonbot) אינה עולה בנראות בחיפוש — מתועד במפורש אצל Google ו-Apple, ומבני אצל השאר. היוצא מן הכלל הוא Meta-ExternalAgent, שמאמן ומאנדקס ב-agent אחד: חסימתו מוציאה משניהם. חסימת agents של אינדקס חיפוש ושל הבאות משתמשים מסירה אתכם מתשובות AI, שם נשאל חלק גדל והולך של שאלות קנייה. את שאלת האימון הכריעו על פי עיקרון; את שאלת הנראות — על פי מקור הציטוטים והתנועה שלכם.
האם חסימת GPTBot מסירה את האתר שלי מ-ChatGPT?
לא. GPTBot מזין רק אימון מודלים. החיפוש של ChatGPT רץ על OAI-SearchBot, וקריאות דפים לבקשת משתמש עוברות דרך ChatGPT-User — חסמו את GPTBot ושניהם ימשיכו לעבוד. זו אותה הפרדה ש-Anthropic מפעילה עם ClaudeBot לעומת Claude-SearchBot ו-Claude-User.
האם Google-Extended משפיע על AI Overviews?
לא — וזו הטעות הנפוצה ביותר בז'אנר. Google מתעדת ש-Google-Extended שולט באימון וב-grounding של Gemini, ו«אינו משפיע על הכללת אתר בחיפוש Google». AI Overviews ו-AI Mode הם חלק מהחיפוש עצמו: הם נשלטים על ידי הגישה של Googlebot ובקרות ה-snippet — nosnippet, data-nosnippet, max-snippet, noindex. המכניקה המלאה נמצאת במדריך שלנו על הופעה ב-AI Overviews של Google.
איך מאמתים ש-crawler הוא אמיתי?
לעולם אל תסמכו על מחרוזת ה-user-agent לבדה — אחת מכל שמונה עשרה בקשות שמתיימרות להיות AI crawler מוכר היא מזויפת, לפי מדידות HUMAN Security מ-2026. בדקו את ה-IP של המקור מול הרשימה שהספק מפרסם: OpenAI, Anthropic, Apple, Common Crawl ו-DuckDuckGo מפרסמים רשימות IP בפורמט JSON, Amazon מפרסמת את הטווחים שלה בדף המפתחים שלה, ו-Google ו-Apple תומכות באימות reverse-DNS. כל מה שנכשל בבדיקה מטופל כ-scraper, יהיה שמו אשר יהיה.
האם robots.txt מספיק, או שצריך גם llms.txt?
הם עושים עבודות שונות. robots.txt שולט בגישה — מי רשאי להביא מה. llms.txt הוא עזר ניווט — מפה קריאה למכונה שעוזרת למודלים למצוא ולפרש את הדפים המרכזיים שלכם אחרי שנכנסו. גישה קודם: llms.txt מאחורי Disallow גורף אינו עוזר לאיש. ל-llms.txt מוקדש מדריך משלו בסדרה הזו.
מדריכים קשורים
מקורות
- 01המדריך שלנו: איך מופיעים ב-AI Overviews של Google?
- 02המדריך שלנו: איך עושים GEO באתר שלכם בפועל?
- 03OpenAI — תיעוד bots: GPTBot, OAI-SearchBot, ChatGPT-User
- 04Anthropic — תיעוד crawlers: ClaudeBot, Claude-SearchBot, Claude-User
- 05Perplexity — תיעוד crawlers: PerplexityBot, Perplexity-User
- 06Google — ה-crawlers הנפוצים ו-Google-Extended
- 07Google — יכולות AI בחיפוש ובקרות לבעלי אתרים
- 08Apple — Applebot ו-Applebot-Extended
- 09Meta — ה-crawlers של הרשת: Meta-ExternalAgent ו-Meta-ExternalFetcher
- 10Common Crawl — תיעוד CCBot
- 11Amazon — תיעוד Amazonbot
- 12DuckDuckGo — תיעוד DuckAssistBot
- 13Cloudflare — יחס הסריקה להפניה של פלטפורמות AI (יולי 2025) ו-AI Insights בזמן אמת
- 14Cloudflare — Bytespider מוביל בתעבורת bots של AI ובחסימות (יולי 2024)
- 15HAProxy — כ-90% מתעבורת ה-AI-crawlers שלנו היא Bytespider (אוקטובר 2024)
- 16HUMAN Security — 2026 State of AI traffic: benchmarks של זיוף crawlers
// שיתוף