இந்த செப்டம்பர் மாதம் முதல் Cloudflare இயல்பாகவே AI ஏஜென்ட் க்ராலர்களை (AI Agent Crawlers) தடுக்கும்

செயற்கை நுண்ணறிவால் (AI) கட்டுப்பாடற்ற முறையில் இணையத் தரவுகளைத் திரட்டும் (web scraping) காலம் முடிவுக்கு வருகிறது. வரும் செப்டம்பர் 15 முதல், Cloudflare ஒரு முக்கியக் கொள்கை மாற்றத்தைச் செயல்படுத்த உள்ளது. இது இயல்பாகவே AI ஏஜென்ட் க்ராலர்களைத் தடுப்பதன் மூலம், அனுமதி அடிப்படையிலான தரவு அணுகல் (permission-based data access) எனும் புதிய யுகத்தைத் தொடங்கும்.

செயலற்ற தரவுத் திரட்டலில் இருந்து செயலில் உள்ள அனுமதி முறைக்கு மாறுதல்

பல ஆண்டுகளாக, AI மாதிரிகளும் (AI models) தன்னாட்சி ஏஜென்ட்களும் (autonomous agents) திறந்த இணையத்தைத் திரட்டி, பயனர்களுக்கு நிகழ்நேரப் பதில்களை வழங்கத் தரவுகளைத் திரட்டி வந்தன. இருப்பினும், இணையக் கட்டமைப்புகள் (web infrastructure) இத்தகைய "ஏஜென்டிக்" (agentic) பாட்களை எவ்வாறு கையாளுகின்றன என்பதில் Cloudflare-இன் சமீபத்திய அறிவிப்பு ஒரு குறிப்பிடத்தக்க மாற்றத்தைக் குறிக்கிறது. தகவல்களைத் தேடி எடுப்பதற்காகப் பக்கங்களை வரிசைப்படுத்தும் (index) பாரம்பரியத் தேடுபொறி க்ராலர்களைப் போலன்றி, AI ஏஜென்ட் க்ராலர்கள் ஒரு பயனரின் சார்பாக குறிப்பிட்ட பணிகளைச் செய்ய அல்லது சிக்கலான கேள்விகளுக்குப் பதிலளிக்க நிகழ்நேரத்தில் உள்ளடக்கத்தைப் பெறுகின்றன.

செப்டம்பர் 15 முதல், Cloudflare மூலம் பாதுகாக்கப்பட்ட இணையத்தின் ஒரு குறிப்பிடத்தக்கப் பகுதி தானாகவே இந்த ஏஜென்ட்களைக் கட்டுப்படுத்தும். இணையதள உரிமையாளர்கள் மற்றும் பதிப்பகங்கள் (publishers) தங்களின் பிரத்யேகத் தரவுகள் மற்றும் படைப்பு உள்ளடக்கங்கள், Large Language Models (LLMs) மற்றும் தன்னாட்சி ஏஜென்ட்களால் எவ்வாறு பயன்படுத்தப்படுகின்றன என்பதன் மீது அதிகக் கட்டுப்பாட்டைக் கொடுப்பதே இந்த நடவடிக்கையின் நோக்கமாகும். இணையம் என்பது இனி "எல்லோருக்கும் அனுமதி" என்ற நிலையிலிருந்து மாறி, பாட்கள் (bots) வெளிப்படையாக அனுமதி கோர வேண்டிய ஒரு கட்டுப்படுத்தப்பட்ட மாதிரியை நோக்கி நகர்கிறது.

டெவலப்பர்கள் மற்றும் இணையதள உரிமையாளர்கள் எவ்வாறு அனுமதி வழங்கலாம்

இயல்பான அமைப்பு கட்டுப்பாடுகளைக் கொண்டிருந்தாலும், பயனுள்ள AI கருவிகளின் செயல்பாட்டை முடக்குவதை Cloudflare நோக்கமாகக் கொண்டிருக்கவில்லை. மாறாக, க்ராலர் மற்றும் ஹோஸ்ட் (host) ஆகியவற்றுக்கு இடையே ஒரு கட்டமைக்கப்பட்ட தொடர்பை (structured handshake) ஏற்படுத்துவதே இதன் இலக்காகும். டெவலப்பர்கள் மற்றும் இணையதள நிர்வாகிகளுக்கு, இது "எல்லாவற்றையும் திரட்டு" (scrape everything) என்ற மனநிலையிலிருந்து விலகி, ஒரு நிர்வகிக்கப்பட்ட அணுகுமுறையை நோக்கி நகர்வதைக் குறிக்கிறது.

முறையான மற்றும் அதிக மதிப்புள்ள AI ஏஜென்ட்கள் ஒரு இணையதளத்தின் குறிப்பிட்ட பகுதிகளை அணுக முடியும் என்பதை உறுதிப்படுத்த, உரிமையாளர்கள் குறிப்பிட்ட அனுமதிகளைச் செயல்படுத்த வேண்டியிருக்கும். இதன் மூலம், OpenAI, Anthropic அல்லது Google போன்ற நிறுவனங்களால் இயங்கும் எந்தெந்த AI ஏஜென்ட்கள் தங்களின் உள்ளடக்கத்தைப் படிக்கலாம் மற்றும் எந்த நிபந்தனைகளின் கீழ் படிக்கலாம் என்பதை வணிகங்களால் தீர்மானிக்க முடியும். ஒட்டுமொத்த AI சூழலைப் பொறுத்தவரை, ஏஜென்ட் டெவலப்பர்கள் தங்களை அடையாளம் காணவும், இணைய சேவையகங்களிடம் (web servers) தங்களின் நம்பகத்தன்மையை நிரூபிக்கவும் இது ஒரு மேம்பட்ட முறையைத் தேவைப்படுத்துகிறது.

AI சூழலுக்கு இது ஏன் முக்கியமானது

இந்த வளர்ச்சி உள்ளடக்க உருவாக்குநர்கள் மற்றும் AI நிறுவனங்கள் ஆகிய இரு தரப்பினருக்கும் ஒரு முக்கியமான திருப்புமுனையாகும். பதிப்பகங்களைப் பொறுத்தவரை, இது "தரவுத் திரட்டல் சோர்வுக்கு" (data scraping fatigue) எதிரான ஒரு அவசியமான பாதுகாப்புத் தற்காப்பு முறையாகும்; அதாவது, உள்ளடக்கங்கள் இறுதியில் அசல் படைப்பாளிகளுடனேயே போட்டியிடக்கூடிய மாதிரிகளைப் பயிற்றுவிக்கப் பயன்படுத்தப்படுவதைத் தடுக்க இது உதவும். கட்டுப்பாட்டை மீண்டும் பெறுவதன் மூலம், பதிப்பகங்கள் தங்களின் அறிவுசார் சொத்துக்களைப் (intellectual property) பாதுகாக்கவும், AI அணுகலுக்கான புதிய வருவாய் ஈட்டும் முறைகளை (monetization models) ஆராயவும் முடியும்.

ஏஜென்டிக் பணிப்பாய்வுகளை (agentic workflows) உருவாக்கும் AI டெவலப்பர்கள் மற்றும் நிறுவனர்களுக்கு, இந்த மாற்றம் ஒரு புதிய சிக்கலை அறிமுகப்படுத்துகிறது. பொதுவெளியில் உள்ள அனைத்து HTML தரவுகளும் எளிதாக அணுகக்கூடியவை என்ற அனுமானத்தை இனி ஏஜென்ட்களால் நம்ப முடியாது. AI ஏஜென்ட்களை எதிர்காலத்திற்குத் தயார்படுத்த வேண்டுமானால், அவை "இணக்க விழிப்புணர்வுடன்" (compliance-aware) இருக்க வேண்டும்; அதாவது, அனுமதி அடுக்குகளைக் கையாளவும், Cloudflare போன்ற முக்கிய உள்கட்டமைப்பு வழங்குநர்களால் நிறுவப்பட்ட புதிய நெறிமுறைகளை (protocols) மதிக்கவும் அவை திறன் கொண்டிருக்க வேண்டும்.

முக்கியக் குறிப்புகள்

  • இயல்பானத் தடுப்பு (Default Blocking): செப்டம்பர் 15 முதல், வெளிப்படையான அனுமதி வழங்கப்படாத வரை, பாதுகாக்கப்பட்ட தளங்களில் Cloudflare தானாகவே AI ஏஜென்ட் க்ராலர்களைத் தடுக்கும்.
  • பதிப்பகங்களுக்கான கட்டுப்பாடு: இந்த நடவடிக்கை அதிகாரத்தை மீண்டும் இணையதள உரிமையாளர்களிடம் கொண்டு சேர்க்கிறது, இதன் மூலம் எந்த குறிப்பிட்ட AI அமைப்புகள் தங்களின் நிகழ்நேரத் தரவைப் பெறலாம் என்பதை அவர்களால் தீர்மானிக்க முடியும்.
  • ஏஜென்ட்களுக்கான புதிய தரம்: AI டெவலப்பர்கள் தங்களின் ஏஜென்ட்களை இணைய அனுமதிகளுக்கு மதிப்பளிக்கும் வகையில் மாற்றியமைக்க வேண்டும், மேலும் ஒரு கட்டமைக்கப்பட்ட, அனுமதி அடிப்படையிலான க்ராலிங் மாதிரியை நோக்கி நகர வேண்டும்.