મેં એક એવી વેબસાઇટ બનાવી છે જે AI આસિસ્ટન્ટ્સ દ્વારા અવતરણ (quote) લેવા માંગે છે અને, અંદાજ લગાવવાને બદલે, મેં વ્યાપકપણે ભલામણ કરવામાં આવેલા ત્રણ સિગ્નલ્સનો અમલ કર્યો છે: એક robots.txt એન્ટ્રી જે GPT-style ક્રોલર્સને આવવા દે છે, એક llms.txt ફાઇલ જે દરેક પેજની યાદી આપે છે, અને JSON-LD schema જે સામગ્રીનું વર્ણન કરે છે. દરેકનું પરીક્ષણ કર્યા પછી, મને જાણવા મળ્યું કે માત્ર એક જ સિગ્નલ ચેતવણી વગર નિષ્ફળ જઈ શકે છે, અને બાકીના એવું કામ નથી કરતા જે મોટાભાગના લોકો દાવો કરે છે.
આ ત્રણ સિગ્નલ્સ શા માટે મહત્વના છે
વેબમાસ્ટર્સને કહેવામાં આવ્યું છે કે AI-કેન્દ્રિત ક્રોલર્સને સ્પષ્ટ પરવાનગીની જરૂર છે, એક સાદા ટેક્સ્ટ "llms.txt" ઇન્ડેક્સથી લાર્જ લેંગ્વેજ મોડલ્સ (LLMs) ને સંબંધિત ફકરાઓ શોધવામાં મદદ મળે છે, અને JSON-LD સ્ટ્રક્ચર્ડ ડેટા અવતરણ (citation) મળવાની શક્યતા વધારે છે. વચન સરળ છે: આ ફાઇલો ઉમેરો, અને તમારી સાઇટ AI-જનરેટેડ જવાબોમાં દેખાવાનું શરૂ કરશે, જેનાથી ટ્રાફિક અને બ્રાન્ડ વિઝિબિલિટી વધશે.
1. robots.txt માં AI ક્રોલર્સને પરવાનગી આપવી
GPTBot (અથવા અન્ય કોઈપણ AI બોટ) નો ઉલ્લેખ કરતી robots.txt લાઇન માત્ર એક વિનંતી છે. જો કોઈ કન્ટેન્ટ ડિલિવરી નેટવર્ક (CDN) અથવા ફાયરવોલ બોટને બ્લોક કરે છે, તો વિનંતી સાઇટ સુધી પહોંચતી જ નથી, અને ક્રોલર ફાઇલ વાંચી શકતો નથી. બોટ તમને એક્સેસ કરી શકે છે કે નહીં તે જાણવાનો એકમાત્ર વિશ્વસનીય રસ્તો દરેક મુખ્ય બોટ માટે HTTP સ્ટેટસ કોડ તપાસવાનો છે. 403 (forbidden) અથવા 503 (service unavailable) પ્રતિસાદનો અર્થ એ છે કે બાકીનું બધું જ નિરર્થક છે—બોટ નહીં, તો ઇન્ડેક્સિંગ નહીં, અને અવતરણ પણ નહીં.
2. llms.txt ફાઇલ
llms.txt ફાઇલ એ માત્ર URL ની એક markdown યાદી છે, જેનો હેતુ LLMs ને સાઇટનો સ્પષ્ટ નકશો આપવાનો છે જેથી તેઓ માત્ર HTML પરથી નેવિગેશનનો અંદાજ ન લગાવવા પડે. વ્યવહારમાં, Google ના દસ્તાવેજો કહે છે કે તે આ ફાઇલને અવગણે છે, અને કોઈ પણ મુખ્ય સર્ચ એન્જિન તેને અવતરણના હેતુ માટે વાપરવાનું વચન આપ્યું નથી. તેને રાખવાથી લગભગ કંઈ ખર્ચ થતો નથી, અને તે કસ્ટમ AI એજન્ટ્સ માટે ઉપયોગી હોઈ શકે છે, પરંતુ તેને વધુ AI અવતરણો માટેના શોર્ટકટ તરીકે પ્રચારિત ન કરવું જોઈએ.
3. JSON-LD schema
JSON-LD પેજમાં સીધું જ સ્ટ્રક્ચર્ડ ડેટા—લેખકનું નામ, પ્રકાશન તારીખ, પ્રોડક્ટ ID—એમ્બેડ કરે છે. ઘણા માર્કેટર્સ માની લે છે કે schema ઉમેરવાથી તેમના પેજ AI જવાબોમાં વધુ વાર દેખાશે, પરંતુ 1,885 પેજ પરના અભ્યાસમાં માત્ર schema માર્કઅપથી અવતરણોમાં કોઈ માપી શકાય તેવો વધારો જોવા મળ્યો નથી. JSON-LD નું સાચું મૂલ્ય એન્ટિટી રિઝોલ્યુશન (entity resolution) માં રહેલું છે: તે મશીનને જણાવે છે કે એક પેજ પરની "Jane Doe" એ બીજા પેજ પરની સમાન "Jane Doe" જ છે, જે સમાન નામના લોકો અથવા ઉત્પાદનો વચ્ચેની મૂંઝવણ અટકાવે છે.
અસલી અવરોધ: ઇન્ડેક્સિંગ
ત્રણેય સિગ્નલ્સ પાયાના માળખા સમાન છે; તે ત્યારે જ કામ કરે છે જો પેજ સૌ પ્રથમ ઇન્ડેક્સ થયેલું હોય. જે પેજ ક્યારેય ઇન્ડેક્સમાં દેખાતું નથી તેને મેળવી શકાતું નથી, તમે ગમે તેટલા ક્રોલર પરવાનગીઓ અથવા schema ટેગ્સ ઉમેરો. ઇન્ડેક્સિંગ હેલ્થનો સૌથી વિશ્વસનીય સૂચક Google Search Console માં કવરેજ રિપોર્ટ છે (અથવા અન્ય એન્જિન માટે સમાન સાધન). જો કોઈ પેજ “not indexed” તરીકે દેખાય છે, તો તમારે કોઈપણ AI-વિશિષ્ટ સિગ્નલ્સ વિશે ચિંતા કરતા પહેલા તેને ઠીક કરવાની જરૂર છે.
એક વ્યવહારુ ચેકલિસ્ટ
- ક્રોલર એક્સેસની ચકાસણી કરો – GPTBot, ClaudeBot, અથવા તમે જે અન્ય AI ક્રોલર વિશે ચિંતિત હોવ તેના માટે HTTP પ્રતિસાદ તપાસો. આ સ્ટેપ ચૂપચાપ નિષ્ફળ જઈ શકે છે; બ્લોક થવાથી તમારા એનાલિટિક્સમાં કોઈ ચેતવણી જનરેટ થશે નહીં.
- ઇન્ડેક્સ કવરેજની પુષ્ટિ કરો – કયા પેજ ઇન્ડેક્સ થયેલ છે, કયા બાકાત રાખવામાં આવ્યા છે અને શા માટે તે જોવા માટે Search Console નો ઉપયોગ કરો. કોઈપણ “crawl errors” અથવા “noindex” નિર્દેશોને પહેલા ઉકેલો.
- પાયાનું માળખું ઉમેરો – એકવાર એક્સેસ અને ઇન્ડેક્સિંગ મજબૂત થઈ જાય પછી, llms.txt અને JSON-LD ઉમેરો. તેમને અવતરણની ગેરંટીને બદલે ઓછા જાળવણીવાળા મદદગારો તરીકે ગણો.
બીજી દલીલ
કેટલાક વેન્ડર્સ હ
