உங்கள் பக்கம் கூகுளில் முதலிடம் பிடிக்கலாம், ஆனால் ChatGPT-க்குத் தெரியாமலே இருக்கலாம்

கூகுளின் க்ராலர் (crawler) உங்கள் ஜாவாஸ்கிரிப்டை இயக்கி, ரெண்டர் செய்யப்பட்ட HTML-ஐத் தனது குறியீட்டில் (index) சேர்த்து, கிளையன்ட்-சைடு ரெண்டர் செய்யப்பட்ட (client-side rendered) ஒரு தளத்தை தேடல் முடிவுகளின் முதல் பக்கத்தில் வைக்க முடியும். அதே பக்கம், ChatGPT அல்லது Bing-ன் AI தேடல் மூலம் கேட்கப்படும்போது, காணாமல் போய்விடுகிறது; ஏனெனில் அந்தச் சேவைகளை இயக்கும் பாட்கள் (bots) ஜாவாஸ்கிரிப்டை ஒருபோதும் இயக்குவதில்லை. இதன் விளைவாக, ஒரு சிறந்த தரவரிசை பெற்ற தளம், எந்தவொரு AI உதவியாளராலும் முன்னிலைப்படுத்த முடியாத நிலைக்குத் தள்ளப்படுகிறது.

ஏன் AI க்ராலர்கள் உங்கள் உள்ளடக்கத்தைத் தவறவிடுகின்றன

மிகவும் பரவலாகப் பயன்படுத்தப்படும் இரண்டு AI க்ராலர்களான OpenAI-ன் GPTBot மற்றும் Anthropic-ன் ClaudeBot ஆகியவை ஜாவாஸ்கிரிப்டை முற்றிலும் ரெண்டர் செய்வதில்லை. Vercel மற்றும் MERJ ஆகியவற்றின் டிசம்பர் 2024 ஆய்வின்படி, இந்த இரண்டு பாட்களும் வெறும் மூல HTML மற்றும் இணைக்கப்பட்ட ஜாவாஸ்கிரிப்ட் கோப்புகளை மட்டும் பதிவிறக்கம் செய்துவிட்டு நின்றுவிடுகின்றன. ஸ்கிரிப்ட்கள் ஒருபோதும் இயக்கப்படுவதில்லை, எனவே பாட்கள் ஒரு வெற்றுச் சட்டத்தை (empty shell) மட்டுமே பார்க்கின்றன.

இதற்கு நேர்மாறாக, Googlebot பக்கத்தை வரிசையில் வைத்து, ஸ்கிரிப்ட்களை இயக்கி, அதன் விளைவாக உருவாகும் DOM-ஐ குறியீடாக்குகிறது. இந்த அடிப்படை வேறுபாடு காரணமாக, ஒரு தூய கிளையன்ட்-சைடு பிரேம்வொர்க்கில் (React, Vue, போன்றவை) உருவாக்கப்பட்ட தளம் கூகுளுக்கு முழுமையாகத் தெரியலாம், ஆனால் AI சார்ந்த தேடல்களுக்கு அது ஒரு வெற்றுப் பக்கமாகவே இருக்கும்.

கூகுள் vs AI: ரெண்டரிங் இடைவெளி (The Rendering Gap)

கூகுள் நீண்டகாலமாக ஹெட்லெஸ் ரெண்டரிங்கில் (headless rendering) முதலீடு செய்துள்ளது. அதன் பாட்டால் சிக்கலான சிங்கிள்-பேஜ் அப்ளிகேஷன்களை (single-page applications) செயலாக்கவும், அவற்றை ஹைட்ரேட் (hydrate) செய்யவும் மற்றும் ஆரம்பப் பதிவிற்குப் பிறகு தோன்றும் கட்டமைக்கப்பட்ட தரவை (structured data) பிரித்தெடுக்கவும் முடியும். இருப்பினும், AI க்ராலர்கள் இன்னும் "பதிவிறக்கம் மட்டுமே" (download-only) செய்யும் நிலையில் உள்ளன. அவை react-helmet போன்ற கருவிகள் மூலம் செலுத்தப்படும் JSON-LD தரவை பகுப்பாய்வு செய்யக்கூடும், ஆனால் அந்த மார்க்கப் (markup) மூல HTML-இல் இருந்தால் மட்டுமே அது சாத்தியம்.

டெவலப்பர் டூல்கள் (Developer tools) தவறான புரிதலை ஏற்படுத்தலாம். Chrome-ன் Elements பேனல், ஜாவாஸ்கிரிப்ட் இயங்கிய பிறகு உள்ள பக்கத்தைக் காட்டுகிறது, இது மார்க்கப் மூலக் குறியீட்டின் (source) ஒரு பகுதியாக உள்ளது என்ற தவறான எண்ணத்தை அளிக்கிறது. “view-source” (அல்லது பிரவுசர் இல்லாமலிருக்கும் curl) பயன்படுத்துவதன் மூலம் ஒரு பாட் உண்மையில் எதைப் பெறுகிறது என்பதை அறியலாம். அங்கு உள்ளடக்கம் அல்லது கட்டமைக்கப்பட்ட தரவு இல்லை என்றால், AI க்ராலர்கள் அதை ஒருபோதும் பார்க்காது.

இந்தப் பிரச்சனை எவ்வாறு வெளிப்படுகிறது

கிளையன்ட்-சைடு ரெண்டரிங்கைச் சார்ந்திருக்கும் ஒரு சாதாரண React தளம், “best coffee maker” அல்லது “how to fix a leaky faucet” போன்ற முக்கியச் சொற்களுக்கு (keywords) கூகுளில் உயர் தரவரிசையைப் பெறலாம். இருப்பினும், ஒரு பயனர் ChatGPT-யிடம், “What are the best coffee makers?” என்று கேட்டால், அந்தத் தளத்தைத் தவிர்த்து மற்ற பதில்களை மட்டுமே பெறும். ChatGPT-ன் ஏஜென்ட் வினைகளில் (agent queries) சுமார் 92% பங்களிக்கும் Bing-ன் AI-க்கும் இதே இடைவெளி உள்ளது. Bing-ன் ஜாவாஸ்கிரிப்ட் ரெண்டரிங் திறன்கள் மட்டுப்படுத்தப்பட்டவை, எனவே கிளையன்ட்-சைடு மட்டுமே கொண்ட தளம் இரண்டு முக்கிய AI தேடல் வழங்குநர்களுக்கும் தெரியாமல் போகலாம்.

இந்தப் பிரச்சனை அமைதியாக நடக்கிறது. கூகுள் தரவரிசையைக் கண்காணிக்கும் SEO டேஷ்போர்டுகள் ஆரோக்கியமான நிலையைத் தெரிவிக்கும், ஆனால் AI உதவியாளர்களிடமிருந்து தளத்திற்கு வரும் டிராஃபிக் (traffic) பூஜ்ஜியமாகவே இருக்கும். பயனர்கள் விரைவான பதில்களுக்காக உரையாடல் இடைமுகங்களை (conversational interfaces) அதிகம் சார்ந்தே வரும் நிலையில், இந்த முரண்பாடு வணிகங்களுக்குப் புதிய வாடிக்கையாளர்களை இழக்கச் செய்யும்.

டெவலப்பர்கள் எங்கே தவறு செய்கிறார்கள்

கூகுளால் ஒரு பக்கத்தைப் படிக்க முடிந்தால், எந்த க்ராலரும் அதைச் செய்ய முடியும் என்று பல குழுக்கள் கருதுகிறார்கள். அவர்கள் பெரும்பாலும்:

  • பக்கம் லோட் ஆன பிறகு JSON-LD-ஐச் செலுத்த react-helmet அல்லது அது போன்ற லைப்ரரிகளைச் சார்ந்திருக்கிறார்கள், மார்க்கப் அங்கு "இருக்கிறது" என்று நம்புகிறார்கள்.
  • பிரவுசரின் Elements வியூவில் மட்டுமே சோதனை செய்கிறார்கள், மூலக் குறியீட்டில் (raw source) சோதிப்பதில்லை.
  • ஒரு எளிய curl சோதனையைத் தவிர்க்கிறார்கள், இதனால் தலைப்பு அல்லது முக்கியச் சொற்கள் ஆரம்ப HTML பதிலில் இடம்பெறவில்லை என்ற உண்மையை அறியத் தவறுகிறார்கள்.

இந்த நடைமுறைகள் SEO ஆரோக்கியமானதாக இருப்பது போன்ற மாயையை உருவாக்குகின்றன, ஆனால் AI தேடலில் தளத்தை மறைமுகமாகப் பலவீனப்படுத்துகின்றன.

இதை எவ்வாறு சரி செய்வது

இதற்கான தீர்வு, முதல் HTTP பதிலிலேயே (response) உண்மையான உள்ளடக்கத்தை வழங்குவதாகும். மூன்று நிரூபிக்கப்பட்ட அணுகுமுறைகள் இதோ:

  • சர்வர்-சைடு ரெண்டரிங் (SSR) – சர்வர் ஜாவாஸ்கிரிப்டை இயக்கி, முழுமையான HTML-ஐ ரெண்டர் செய்து, அதை கிளையன்ட்டுக்கு அனுப்புகிறது. பக்கம் ஏற்கனவே உள்ளடக்கத்துடன் தயாராக இருக்கும்.
  • ஸ்டேடிக் ஜெனரேஷன் (Static Generation) – பில்ட் நேரத்தின் போது (build time), பிரேம்வொர்க் அனைத்து உள்ளடக்கத்தையும் உள்ளடக்கிய நிலையான HTML கோப்புகளை உருவாக்குகிறது. இதற்குக் கூடுதல் ரன்டைம் ரெண்டரிங் தேவையில்லை.
  • ப்ரீ-ரெண்டரிங் (Prerendering) – ஒரு மிட்ல்வேர் சேவை (middleware service) பக்கத்தை ஒருமுறை ரெண்டர் செய்து, அதன் முடிவை சேமித்து வைத்து (cache), க்ராலர்களுக்கு அந்த நிலையான ஸ்னாப்ஷாட்டை வழங்குகிறது.

Next.js (React) மற்றும் Nuxt (Vue) போன்ற பிரேம்வொர்க்குகள் இந்த நுட்பங்களுக்கு உள்ளமைக்கப்பட்ட ஆதரவை வழங்குகின்றன. முற்றிலும் கிளையன்ட்-சைடு முறையில் இருந்து மேற்கூறிய முறைகளில் ஒன்றிற்கு மாறுவது, Googlebot மற்றும் AI க்ராலர்கள் ஆகிய இரண்டும் ஒரே உள்ளடக்கத்தைப் பார்ப்பதை உறுதி செய்கிறது.

ஒரு விரைவான சரிபார்ப்பு சோதனை:

curl -s https://yourpage.com | grep "your headline text"

இந்தக் கட்டளை எதையும் திரும்பத் தரவில்லை என்றால், தலைப்பு மூல HTML-இல் இல்லை என்று அர்த்தம், AI பாட்கள் அதைத் தவறவிடும்.

கவனிக்க வேண்டியவை

தற்போதைய நிலை ஒரு தெளிவான முரண்பாடாகும்: கூகுளின் ரெண்டரிங் இன்ஜின் மிகவும் மேம்பட்டது; ஆனால் AI க்ராலர்கள் அவ்வாறு இல்லை. இந்த இடைவெளியைக் கண்டறிந்த ஆய்வு சில மாதங்களுக்கு முன்பு மட்டுமே 나왔து, மேலும் OpenAI மற்றும் Anthropic ஆகிய இரண்டும் தங்களின் இண்டெக்ஸிங் வழிமுறைகளை (indexing pipelines) மேம்படுத்துவதில் ஆர்வம் காட்டியுள்ளன. இருப்பினும், முழுமையான ஜாவாஸ்கிரிப்ட் இயக்கம் விரைவில் சேர்க்கப்படும் என்பதற்கு எந்த பொதுவான திட்டமும் (roadmap) இன்னும் உறுதி அளிக்கப்படவில்லை.

இதற்கிடையில், இந்தச் சிக்கலைப் புறக்கணிப்பதன் பாதிப்பு மாறியுள்ளது. பத்து ஆண்டுகளுக்கு முன்பு, கூகுள் இண்டெக்ஸிங் (Google indexing) மெதுவாக இருப்பதுதான் பாதிப்பாக இருந்தது; இன்று, மிக வேகமாக வளர்ந்து வரும் கண்டறியும் தளமான—AI சார்ந்த தேடலில் (AI-driven search) இருந்து விலக்கப்படுவதே அதன் பாதிப்பாகும். ஆர்கானிக் டிராஃபிக்கை (organic traffic) நம்பியிருக்கும் நிறுவனங்கள், தங்கள் பக்கங்களை ராவ்-சோர்ஸ் கருவிகளைக் (raw-source tools) கொண்டு ஆய்வு செய்ய வேண்டும், சாத்தியமான இடங்களில் SSR அல்லது ஸ்டேடிக் ஜெனரேஷனை (static generation) கையாள வேண்டும், மேலும் AI-தனித்துவமான இண்டெக்ஸிங் அறிக்கைகள் கிடைக்கும்போது அவற்றைக் கண்காணிக்க வேண்டும்.

முக்கியக் குறிப்பு: ஒரு இணையதளம் கூகுள் தரவரிசையில் (Google’s rankings) மிகச் சிறப்பாகத் தெரிந்தாலும், அது கிளையண்ட்-சைடு ரெண்டரிங் (client-side rendering) முறையை மட்டுமே நம்பியிருந்தால், ChatGPT மற்றும் Bing AI ஆகியவற்றிற்குத் தெரியாமலேயே போகலாம். ஆரம்பக்கட்ட HTML-லேயே உள்ளடக்கத்தை வழங்குவது—அதாவது SSR, ஸ்டேடிக் ஜெனரேஷன் அல்லது பிரிரெண்டரிங் (prerendering) மூலம்—இந்த இடைவெளியைக் குறைப்பதோடு, பாரம்பரியத் தேடல் மற்றும் AI தேடல் ஆகிய இரண்டிலும் இணையதளம் கண்டறியப்படுவதை உறுதி செய்கிறது.