AI അസിസ്റ്റന്റുകൾ എന്റെ വെബ്സൈറ്റിൽ നിന്ന് ഉദ്ധരണികൾ (quotes) എടുക്കണമെന്ന് ഞാൻ ആഗ്രഹിച്ചു. ഊഹിച്ചതുകൊണ്ട് മാത്രം പോരാതെ, ഞാൻ മൂന്ന് പ്രധാന സിഗ്നലുകൾ നടപ്പിലാക്കി: GPT ശൈലിയിലുള്ള ക്രോളർമാരെ അനുവദിക്കുന്ന ഒരു robots.txt എൻട്രി, എല്ലാ പേജുകളും ഉൾക്കൊള്ളുന്ന ഒരു llms.txt ഫയൽ, കൂടാതെ ഉള്ളടക്കം വിവരിക്കുന്ന JSON-LD സ്കീമ. ഇവ ഓരോന്നും പരിശോധിച്ചപ്പോൾ, മുന്നറിയിപ്പില്ലാതെ പരാജയപ്പെടാൻ സാധ്യതയുള്ളത് ഒന്നുമാത്രമാണെന്നും മറ്റുള്ളവ ആളുകൾ അവകാശപ്പെടുന്നതുപോലെ പ്രവർത്തിക്കുന്നില്ലെന്നും ഞാൻ കണ്ടെത്തി.
ഈ മൂന്ന് സിഗ്നലുകളും പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്
AI-ഫോക്കസ്ഡ് ക്രോളർമാർക്ക് വ്യക്തമായ അനുമതി ആവശ്യമാണെന്നും, ഒരു പ്ലെയിൻ-ടെക്സ്റ്റ് "llms.txt" ഇൻഡക്സ് വലിയ ഭാഷാ മോഡലുകളെ (LLMs) പ്രസക്തമായ ഭാഗങ്ങൾ കണ്ടെത്താൻ സഹായിക്കുമെന്നും, JSON-LD സ്ട്രക്ചേർഡ് ഡാറ്റ ഉദ്ധരണികൾ ലഭിക്കാനുള്ള സാധ്യത വർദ്ധിപ്പിക്കുമെന്നും വെബ്മാസ്റ്റർമാരോട് പറയപ്പെടുന്നു. ഇതിന്റെ വാഗ്ദാനം ലളിതമാണ്: ഈ ഫയലുകൾ ചേർക്കുക, അപ്പോൾ നിങ്ങളുടെ സൈറ്റ് AI-ജനറേറ്റഡ് ഉത്തരങ്ങളിൽ പ്രത്യക്ഷപ്പെടാൻ തുടങ്ങും, ഇത് ട്രാഫിക്കും ബ്രാൻഡ് വിസിബിലിറ്റിയും വർദ്ധിപ്പിക്കും.
1. robots.txt വഴി AI ക്രോളർമാരെ അനുവദിക്കുക
GPTBot (അല്ലെങ്കിൽ മറ്റേതെങ്കിലും AI ബോട്ട്) പരാമർശിക്കുന്ന robots.txt വരി ഒരു അഭ്യർത്ഥന മാത്രമാണ്. ഒരു കണ്ടന്റ് ഡെലിവറി നെറ്റ്വർക്ക് (CDN) അല്ലെങ്കിൽ ഫയർവാൾ ബോട്ടിനെ തടഞ്ഞാൽ, ആ അഭ്യർത്ഥന സൈറ്റിൽ എത്തുന്നില്ല, അതിനാൽ ക്രോളർക്ക് ആ ഫയൽ വായിക്കാൻ കഴിയില്ല. ബോട്ടിന് നിങ്ങളെ ആക്സസ് ചെയ്യാൻ കഴിയുമോ എന്ന് അറിയാനുള്ള ഏക വിശ്വസനീയമായ മാർഗ്ഗം ഓരോ പ്രധാന ബോട്ടിനും വേണ്ടിയുള്ള HTTP സ്റ്റാറ്റസ് കോഡ് പരിശോധിക്കുക എന്നതാണ്. ഒരു 403 (forbidden) അല്ലെങ്കിൽ 503 (service unavailable) റെസ്പോൺസ് എന്നാൽ ബാക്കി കാര്യങ്ങൾ കൊണ്ട് പ്രയോജനമില്ല എന്നാണ് അർത്ഥം—ബോട്ട് ഇല്ലെങ്കിൽ, ഇൻഡക്സിംഗും ഉദ്ധരണികളും ഉണ്ടാവില്ല.
2. llms.txt ഫയൽ
ഒരു llms.txt ഫയൽ എന്നത് വെറും URL-കളുടെ ഒരു മാർക്ക്ഡൗൺ ലിസ്റ്റ് മാത്രമാണ്. HTML മാത്രം ഉപയോഗിച്ച് നാവിഗേഷൻ മനസ്സിലാക്കാൻ ബുദ്ധിമുട്ടുന്ന LLM-കൾക്ക് സൈറ്റിന്റെ ഒരു വ്യക്തമായ മാപ്പ് നൽകാനാണ് ഇത് ഉദ്ദേശിക്കുന്നത്. പ്രായോഗികമായി പറഞ്ഞാൽ, ഗൂഗിളിന്റെ ഡോക്യുമെന്റേഷൻ പറയുന്നത് ഇത് അവഗണിക്കുന്നു എന്നാണ്, കൂടാതെ ഒരു പ്രധാന സെർച്ച് എഞ്ചിനും ഉദ്ധരണികൾക്കായി ഇത് ഉപയോഗിക്കുമെന്ന് വാഗ്ദാനം ചെയ്തിട്ടില്ല. ഇത് നിലനിർത്തുന്നത് വലിയ ചിലവില്ലാത്ത കാര്യമാണ്, കൂടാതെ കസ്റ്റം AI ഏജന്റുകൾക്ക് ഇത് ഉപകാരപ്പെടാം, എന്നാൽ കൂടുതൽ AI ഉദ്ധരണികൾ ലഭിക്കാനുള്ള ഒരു കുറുക്കുവഴിയായി ഇതിനെ പ്രചരിപ്പിക്കരുത്.
3. JSON-LD സ്കീമ
JSON-LD സ്ട്രക്ചേർഡ് ഡാറ്റ—രചയിതാവിന്റെ പേര്, പ്രസിദ്ധീകരിച്ച തീയതി, പ്രൊഡക്റ്റ് ഐഡി എന്നിവ—നേരിട്ട് ഒരു പേജിൽ ഉൾപ്പെടുത്തുന്നു. സ്കീമ ചേർക്കുന്നത് വഴി AI ഉത്തരങ്ങളിൽ തങ്ങളുടെ പേജുകൾ കൂടുതൽ തവണ പ്രത്യക്ഷപ്പെടുമെന്ന് പല മാർക്കറ്റもകൾ കരുതുന്നുണ്ടെങ്കിലും, 1,885 പേജുകൾ നടത്തിയ ഒരു പഠനത്തിൽ സ്കീമ മാർക്കപ്പ് കൊണ്ട് മാത്രം ഉദ്ധരണികളിൽ കാര്യമായ വർദ്ധനവ് ഉണ്ടായില്ലെന്ന് കണ്ടെത്തി. JSON-LD-യുടെ യഥാർത്ഥ മൂല്യം entity resolution-ലാണ്: ഒരേ പേരുള്ള ആളുകൾക്കിടയിലോ ഉൽപ്പന്നങ്ങൾക്കിടയിലോ ഉണ്ടാകാൻ സാധ്യതയുള്ള ആശയക്കുഴപ്പം ഒഴിവാക്കാൻ, ഒരു പേജിലെ "Jane Doe" മറ്റൊരു പേജിലെ അതേ "Jane Doe" തന്നെയാണെന്ന് ഇത് മെഷീനുകളെ അറിയിക്കുന്നു.
യഥാർത്ഥ തടസ്സം: ഇൻഡക്സിംഗ്
ഈ മൂന്ന് സിഗ്നലുകളും അടിസ്ഥാന സംവിധാനങ്ങൾ (plumbing) മാത്രമാണ്; പേജ് ആദ്യം ഇൻഡക്സ് ചെയ്യപ്പെട്ടാൽ മാത്രമേ അവ പ്രവർത്തിക്കൂ. ഒരു പേജ് ഇൻഡക്സിൽ ഒരിക്കലും വരാത്ത പക്ഷം, നിങ്ങൾ എത്ര ക്രോളർ അനുമതികളോ സ്കീമ ടാഗുകളോ നൽകിയാലും അത് കണ്ടെത്താൻ കഴിയില്ല. ഇൻഡക്സിംഗ് നിലവാരം അറിയാനുള്ള ഏറ്റവും വിശ്വസനീയമായ മാർഗ്ഗം Google Search Console-ലെ കവറേജ് റിപ്പോർട്ടാണ് (അല്ലെങ്കിൽ മറ്റ് എഞ്ചിനുകൾക്കായുള്ള സമാനമായ ടൂൾ). ഒരു പേജ് "not indexed" എന്ന് കാണിക്കുന്നുണ്ടെങ്കിൽ, AI-പ്രത്യേക സിഗ്നലുകളെക്കുറിച്ച് ആശങ്കപ്പെടുന്നതിന് മുമ്പ് നിങ്ങൾ അത് പരിഹരിക്കേണ്ടതുണ്ട്.
ഒരു പ്രായോഗിക ചെക്ക്ലിസ്റ്റ്
- ക്രോളർ ആക്സസ് പരിശോധിക്കുക – GPTBot, ClaudeBot അല്ലെങ്കിൽ നിങ്ങൾ ശ്രദ്ധിക്കുന്ന മറ്റേതെങ്കിലും AI ക്രോളറിനായുള്ള HTTP റെസ്പോൺസ് പരിശോധിക്കുക. ഈ ഘട്ടം മുന്നറിയിപ്പില്ലാതെ പരാജയപ്പെട്ടേക്കാം; ഒരു ബ്ലോക്ക് നിങ്ങളുടെ അനലിറ്റിക്സിൽ മുന്നറിയിപ്പ് നൽകില്ല.
- ഇൻഡക്സ് കവറേജ് സ്ഥിരീകരിക്കുക – ഏതെല്ലാം പേജുകളാണ് ഇൻഡക്സ് ചെയ്തിട്ടുള്ളതെന്നും ഏതെല്ലാം ഒഴിവാക്കപ്പെട്ടതെന്നും എന്തുകൊണ്ട് ഒഴിവാക്കപ്പെട്ടതെന്നും അറിയാൻ Search Console ഉപയോഗിക്കുക. ആദ്യം ഏതെങ്കിലും "crawl errors" അല്ലെങ്കിൽ "noindex" നിർദ്ദേശങ്ങൾ പരിഹരിക്കുക.
- അടിസ്ഥാന സംവിധാനങ്ങൾ ചേർക്കുക – ആക്സസും ഇൻഡക്സിംഗും ഉറപ്പാക്കിയ ശേഷം,
llms.txt, JSON-LD എന്നിവ ചേർക്കുക. അവയെ ഉദ്ധരണികൾ ഉറപ്പാക്കുന്നവയായി കാണാതെ, കുറഞ്ഞ പരിപാലനം ആവശ്യമുള്ള സഹായികളായി മാത്രം കാണുക.
വിപരീത വാദം
ചില വെണ്ടർമാർ ഇപ്പോഴും llms.txt ജനറേറ്ററുകളെയും സ്കീമ പ്ലഗിനുകളെയും AI-യ്ക്കായുള്ള SEO ബൂസ്റ്ററുകളായി വിപണനം ചെയ്യുന്നുണ്ട്. ഞാൻ ശേഖരിച്ച വിവരങ്ങളും പ്രധാന സെർച്ച് എഞ്ചിനുകളുടെ ഔദ്യോഗിക നിലപാടും സൂചിപ്പിക്കുന്നത് ആ അവകാശവാദങ്ങൾ അമിതമാണെന്നാണ്. ഈ ടൂളുകൾ ദോഷകരമല്ല, പക്ഷേ അവ ഒരു AI-citation സ്ട്രാറ്റജിയുടെ കേന്ദ്രബിന്ദുവായി മാറരുത്.
ഇനി ശ്രദ്ധിക്കേണ്ടവ
ക്രോളർ ലോഗുകൾ നിരീക്ഷിക്കുക, Search Console അലേർട്ടുകൾ ശ്രദ്ധിക്കുക, കൂടാതെ പൈപ്പ്ലൈൻ സുഗമമായി നടക്കുന്നുണ്ടെന്ന് ഉറപ്പാക്കാൻ കൃത്യമായ ഇടവേളകളിൽ വാലിഡേഷൻ ടൂളുകൾ ഉപയോഗിച്ച് നിങ്ങളുടെ JSON-LD പരിശോധിക്കുക.
ചുരുക്കത്തിൽ: നിങ്ങളുടെ സൈറ്റ് AI ഉദ്ധരണികളിൽ വരണമെന്നുണ്ടെങ്കിൽ, llms.txt, സ്കീമ എന്നിവയെ മാന്ത്രിക ടിക്കറ്റുകളായി കാണുന്നത് നിർത്തുക. ബോട്ടുകൾക്ക് നിങ്ങളെ യഥാർത്ഥത്തിൽ ആക്സസ് ചെയ്യാൻ കഴിയുന്നുണ്ടെന്നും നിങ്ങളുടെ പേജുകൾ ഇൻഡക്സ് ചെയ്തിട്ടുണ്ടെന്നും ഉറപ്പാക്കുക; എങ്കിൽ മാത്രമേ ആ അധിക ഫയലുകൾ അവയുടെ ചെറിയ സഹായപരമായ പങ്ക് നിർവഹിക്കുകയുള്ളൂ.
Source: the original post on dev.to
