Wikimedia’s engineering team says AI-powered crawlers generate 65 % of the platform’s most expensive traffic, turning a harmless-looking bot surge into a line-item on server bills. The same pattern now shows up on tiny blogs and hobby sites.

विकिमीडियाच्या इंजिनिअरिंग टीमचे म्हणणे आहे की, AI-आधारित क्रॉलर्समुळे प्लॅटफॉर्मच्या सर्वात महागड्या ट्रॅफिकपैकी ६५% ट्रॅफिक निर्माण होते, ज्यामुळे निरुपद्रवी वाटणाऱ्या बॉटच्या वाढीमुळे सर्व्हरच्या बिलांमध्ये मोठी वाढ होते. आता हीच परिस्थिती लहान ब्लॉग्स आणि छंद जोपासणाऱ्या (hobby) साइट्सवरही दिसून येत आहे.

ही वाढ का महत्त्वाची आहे

मानवी अभ्यागत लोकप्रिय पृष्ठांवर—जसे की होमपेजेस, विशेष लेख आणि इतर प्रसिद्ध मजकूर—जास्त वेळ घालवतात. CDNs या पृष्ठांना 'एज लोकेशन्स'वर कॅश (cache) करतात, त्यामुळे ओरिजिन सर्व्हरवर फारसा ताण येत नाही. याउलट, AI क्रॉलर्स एकाच वेळी हजारो अज्ञात (obscure) URLs स्क्रेप करतात. ही पृष्ठे क्वचितच कॅश केलेली असतात, त्यामुळे प्रत्येक विनंती (request) थेट विकिमीडियाच्या ओरिजिन इन्फ्रास्ट्रक्चरपर्यंत पोहोचते. परिणामी, एकूण ट्रॅफिकच्या तुलनेत अत्यंत कमी प्रमाणात असूनही, कॉम्प्युट, स्टोरेज आणि नेटवर्कचा वापर प्रमाणाबाहेर वाढतो.

डेटा प्रसिद्ध करणाऱ्या इंजिनिअरिंग ब्लॉगमध्ये असे नमूद करण्यात आले आहे की, जरी एकूण विनंत्यांमध्ये बॉट्सचा वाटा कमी असला, तरी ते "महागड्या" (costly) श्रेणीमध्ये वर्चस्व गाजवतात.

याचा फटका कोणाला बसतो

लहान ऑपरेटर्सकडे (operators) इतकी आर्थिक सुरक्षितता नसते. हा छुपा खर्च केवळ पैशांचा नाही; यामुळे वैध अभ्यागतांसाठी (legitimate visitors) वेबसाइटची कामगिरी (performance) खालावण्याचा धोकाही निर्माण होतो.

वेबसाइट मालक काय करू शकतात

  • रेट-लिमिटिंगने (rate-limiting) सुरुवात करा – एका ठराविक वेळेत एक सिंगल IP किती विनंत्या करू शकतो यावर मर्यादा आखा. यामुळे क्रॉलर्सना पूर्णपणे प्रवेश नाकारल्याशिवाय त्यांच्या आक्रमक हालचालींवर नियंत्रण मिळवता येते.
  • दृश्यमानता (visibility) आणि खर्च यांचा समतोल राखा – सर्च-इंजिन बॉट ब्लॉक केल्यामुळे ट्रॅफिक कमी होऊ शकते, परंतु यामुळे तुमची पृष्ठे इंडेक्समधून (indexes) बाहेर पडू शकतात, ज्यामुळे तुमची 'ऑरगॅनिक डिस्कव्हरेबिलिटी' (organic discoverability) बाधित होऊ शकते.
  • बॉट्सचे वर्गीकरण करा – सर्व क्रॉलर्स सारखे नसतात. काही वैध सर्च टूल्सचे भाग असतात जे ट्रॅफिक आणतात; तर काही केवळ स्क्रेपर्स (scrapers) असतात ज्यांचा कोणताही उपयोग नसतो.
  • प्रूफ-ऑफ-वर्क (proof-of-work) आव्हाने लागू करा – एखादे पृष्ठ दाखवण्यापूर्वी एक लहान संगणकीय कोडे (computational puzzle) सोडवणे अनिवार्य करा. मानवी ब्राउझर्स ते त्वरित सोडवतात; मात्र बॉट्सना त्यासाठी अतिरिक्त ऊर्जा/साधने खर्च करावी लागतात, ज्यामुळे त्यांचा खर्च वाढतो.
  • CDN ॲनालिटिक्सचा वापर करा – बहुतेक CDNs प्रत्येक बॉटच्या विनंत्यांचे मेट्रिक्स (metrics) दर्शवतात. कोणते एजंट्स वारंवार ओरिजिनला विनंत्या पाठवत आहेत ते ओळखा आणि त्यानुसार नियम तयार करा.

याचा निष्कर्ष साधा आहे: AI क्रॉलर्स आता केवळ कुतूहल राहिलेले नाहीत; ते खर्चाचे एक मोजता येण्यासारखे केंद्र (cost center) बनले आहेत. तुम्ही जागतिक विश्वकोश चालवत असाल किंवा एखादे सिंगल-पेज पोर्टफोलिओ, बॉट ट्रॅफिकला तुमच्या इन्फ्रास्ट्रक्चर बजेटमधील एक महत्त्वाचा घटक मानल्यास अनपेक्षित बिलांपासून वाचता येईल आणि तुमची साइट खऱ्या वापरकर्त्यांसाठी जलद (responsive) राहील.