בניתי אתר שרוצה שסוכני AI יצטטו אותו, ובמקום לנחש, יישמתי בפועל שלושה אותות מומלצים מאוד: רשומה ב-robots.txt שמאפשרת לסורקים בסגנון GPT להיכנס, קובץ llms.txt המפרט כל דף, וסכימת JSON-LD המתארת את התוכן. לאחר שבחנתי כל אחד מהם, גיליתי שרק אחד יכול להיכשל ללא התראה, והאחרים לא עושים את מה שרוב האנשים טוענים שהם עושים.

למה שלושת האותות הללו חשובים

מנהלי אתרים נאמר להם שסורקים הממוקדים ב-AI זקוקים להרשאה מפורשת, שאינדקס טקסטואלי פשוט של "llms.txt" עוזר למודלי שפה גדולים (LLMs) לאתר קטעים רלוונטיים, ושנתונים מובנים בפורמט JSON-LD מגדילים את הסיכוי להופיע בציטוטים. ההבטחה היא פשוטה: הוסיפו את הקבצים הללו, והאתר שלכם יתחיל להופיע בתשובות שנוצרו על ידי AI, מה שיגדיל את התנועה ואת הנראות של המותג.

1. מתן גישה לסורקי AI ב-robots.txt

השורה ב-robots.txt שמזכירה את GPTBot (או כל בוט AI אחר) היא רק בקשה. אם רשת הפצת תוכן (CDN) או חומת אש חוסמים את הבוט, הבקשה לעולם לא מגיעה לאתר, והסורק לא יכול לקרוא את הקובץ בכלל. הדרך האמינה היחידה לדעת אם הבוט יכול לגשת אליכם היא לבדוק את קוד הסטטוס של HTTP עבור כל בוט מרכזי. תגובת 403 (forbidden) או 503 (service unavailable) אומרת שכל שאר ה"צנרת" חסרת משמעות – בלי בוט, אין אינדוקס ואין ציטוט.

2. קובץ ה-llms.txt

קובץ llms.txt הוא פשוט רשימת Markdown של כתובות URL, שנועדה לספק ל-LLMs מפה נקייה של האתר כדי שלא יצטרכו להסיק את הניווט מ-HTML בלבד. בפועל, התיעוד של Google אומר שהוא מתעלם מהקובץ, ואף מנוע חיפוש מרכזי לא התחייב להשתמש בו לצורך ציטוטים. החזקה בו כמעט ואינה עולה דבר, והוא יכול להיות שימושי עבור סוכני AI מותאמים אישית, אך אין לשווק אותו כקיצור דרך ליותר ציטוטים מ-AI.

3. סכימת JSON-LD

JSON-LD מטמיע נתונים מובנים — שמות מחברים, תאריכי פרסום, מזהי מוצרים — ישירות בתוך הדף. משווקים רבים מניחים שהוספת סכימה תגרום לדפים שלהם להופיע לעיתים קרובות יותר בתשובות AI, אך מחקר שבדק 1,885 דפים לא מצא שיפור מדיד בכמות הציטוטים משימוש בסכימה בלבד. הערך האמיתי של JSON-LD טמון בפתרון ישויות (entity resolution): הוא אומר למכונה ש-"Jane Doe" בדף אחד הוא אותו "Jane Doe" בדף אחר, מה שמונע בלבול בין אנשים או מוצרים בעלי שמות דומים.

צוואר הבקבוק האמיתי: אינדוקס

שלושת האותות הללו הם רק "צנרת"; הם עובדים רק אם הדף מופיע באינדקס מלכתחילה. דף שלעולם לא מופיע באינדקס לא ניתן לשליפה, לא משנה כמה הרשאות סורקים או תגיות סכימה תוסיפו. האינדיקטור האמין ביותר לבריאות האינדוקס הוא דוח הכיסוי (coverage report) ב-Google Search Console (או הכלי המקביל למנועים אחרים). אם דף מופיע כ-"not indexed", עליכם לתקן זאת לפני שתדאגו לאותות ספציפיים ל-AI.

צ'ק ליסט מעשי

  1. אמת גישת סורקים – בדוק את תגובת ה-HTTP עבור GPTBot, ClaudeBot, או כל סורק AI אחר שחשוב לך. שלב זה יכול להיכשל בשקט; חסימה לא תייצר התראה בכלי האנליטיקה שלך.
  2. אשר כיסוי אינדקס – השתמש ב-Search Console כדי לראות אילו דפים מאונדקסים, אילו מוחרגים ומדוע. פתור תחילה כל "שגיאת סריקה" (crawl errors) או הנחיות "noindex".
  3. הוסף את ה"צנרת" – ברגע שהגישה והאינדוקס יציבים, הוסף את ה-llms.txt וה-JSON-LD. התייחס אליהם כאל עוזרים הדורשים תחזוקה נמוכה ולא כאל ערבות לציטוטים.

נקודת מבט נגדית

ספקים מסוימים עדיין משווקים מחוללי llms.txt ותוספי סכימה כמשפרים SEO עבור AI. הנתונים שאספתי, יחד עם העמדה הרשמית של מנועי חיפוש מרכזיים, מצביעים על כך שהטענות הללו מוגזמות. הכלים אינם מזיקים, אך הם לא צריכים להיות מרכז האסטרטגיה לציטוטים מ-AI.

מה לעקוב אחריו בהמשך

עקוב אחר לוגים של סורקים, שים לב להתראות ב-Search Console, ובדוק מעת לעת את ה-JSON-LD שלך באמצעות כלי וולידציה כדי לשמור על זרימת הנתונים.

שורה תחתונה: אם אתם רוצים שסוכני AI יצטטו את האתר שלכם, הפסיקו להתייחס ל-llms.txt ולסכימה כאל כרטיסי קסם. ודאו שהבוטים באמת יכולים להגיע אליכם ושהדפים שלכם מאונדקסים; רק אז הקבצים הנוספים ימלאו את תפקידם התומך והצנוע.

מקור: הפוסט המקורי ב-dev.to