ChatGPT नंतरच्या वेब कंटेंटपैकी एक तृतीयांश भागात AI लेखनाचे संकेत आढळतात

Pew Research च्या एका महत्त्वपूर्ण अभ्यासाने डिजिटल क्षेत्रात मोठा बदल झाल्याचे समोर आणले आहे, ज्यातून असे दिसून येते की नवीन वेब कंटेंटचा एक मोठा भाग कृत्रिम बुद्धिमत्तेद्वारे (AI) तयार केला जात आहे. जसे Large Language Models (LLMs) कंटेंट वर्कफ्लोमध्ये समाविष्ट होत आहेत, तसे मानवनिर्मित आणि मशीन-निर्मित मजकुरातील सीमा वेगाने धूसर होत आहेत.

AI-निर्मित कंटेंटमध्ये झालेली वाढ

इंटरनेटवरील जनरेटिव्ह AI च्या प्रभावाचे मोजमाप करण्यासाठी, Pew Research ने Common Crawl वेब आर्काइव्हचा वापर करून सुमारे ५,००,००० इंग्रजी भाषेतील वेब पेजेसचे विश्लेषण केले. Open Pangram च्या डिटेक्शन तंत्रज्ञानाचा वापर करून, या अभ्यासाचा उद्देश मानवनिर्मित आणि AI-साहाय्यक मजकुरात फरक करणे हा होता.

जुलै २०२६ मधील १०,००० पेजेसच्या यादृच्छिक नमुन्याने (random sample) १०% AI लेखनाचा दर दर्शवला असला तरी, जनरेटिव्ह AI च्या क्रांतीपूर्वी प्रकाशित झालेल्या जुन्या कंटेंटमुळे हा आकडा विस्कळीत झाला होता. तथापि, जेव्हा संशोधकांनी नोव्हेंबर २०२२ मध्ये ChatGPT च्या लाँच नंतर प्रकाशित झालेल्या पेजेसचा समावेश करण्यासाठी डेटासेट फिल्टर केला, तेव्हा हे आकडे प्रचंड वाढले. या अभ्यासात असे आढळले की, अलीकडच्या काळात प्रकाशित झालेल्या सर्व वेब पेजेसपैकी एक तृतीयांश पेक्षा जास्त (३५%) पेजेसमध्ये AI द्वारे लिहिलेले किंवा "मोठ्या प्रमाणावर संपादित" (substantially edited) केलेले असल्याचे महत्त्वपूर्ण संकेत आढळतात.

डोमेनमधील तफावत आणि "बॉट लूप" (Bot Loop)

AI कंटेंटचा प्रसार संपूर्ण वेबवर एकसमान नाही. या अभ्यासाने विविध टॉप-लेव्हल डोमेन्स (TLDs) मधील तीव्र तफावत अधोरेखित केली आहे, ज्यावरून असे सूचित होते की व्यावसायिक हितसंबंध AI लेखन साधनांचा सर्वात आक्रमकपणे वापर करण्यास प्रवृत्त करत आहेत.

डेटाच्या मते, .com डोमेन असलेल्या URLs मध्ये AI लेखनाचा दर शैक्षणिक किंवा सरकारी साइट्सच्या तुलनेत सुमारे १० पटीने जास्त आहे. विशेषतः, .edu आणि .gov डोमेन्समध्ये AI लेखनाचा दर केवळ १% होता, तर .org डोमेन्समध्ये तो ४.६% होता. ही कल अशा व्यावसायिक वेबकडे निर्देश करते जिथे पारंपारिक संपादकीय देखरेखीपेक्षा वेग आणि व्याप्तीला—जे अनेकदा LLMs द्वारे साध्य केले जाते—प्राधान्य दिले जाते.

AI कंटेंटमधील ही वाढ Cloudflare ने नोंदवलेल्या एका चिंताजनक टप्प्यासोबत येत आहे: बॉट ट्रॅफिकने अधिकृतपणे मानवी वेब ट्रॅफिकला मागे टाकले आहे. यामुळे एक संभाव्य "डेड इंटरनेट" (dead internet) फीडबॅक लूप तयार होतो, जिथे बॉट्स अधिकाधिक अशा कंटेंटचे ब्राउझिंग आणि स्क्रॅपिंग करत आहेत जो स्वतः इतर बॉट्सद्वारे लिहिला गेला आहे.

भाषिक खुणा आणि शोधण्याचे आव्हान

या अभ्यासात काही विशिष्ट भाषिक नमुने देखील ओळखले गेले आहेत जे AI-निर्मित मजकुरासाठी "खुणा" (tells) म्हणून काम करतात. जसे LLMs अधिक प्रगत होत आहेत, तसे त्यांचे शैलीगत ठसे (stylistic fingerprints) अधिक अंदाजित होत आहेत. संशोधकांनी विशिष्ट वाक्यरचनांच्या वाढत्या वापराकडे लक्ष वेधले आहे, जसे की:

  • em dashes आणि Oxford commas चा मोठ्या प्रमाणावर वापर.
  • "It’s not X, it’s Y" सारखे लयबद्ध वाक्यरचनांचे नमुने.
  • वाचनीयतेसाठी अनुकूल असलेल्या परंतु मानवी सूक्ष्मतेचा (human nuance) अभाव असलेल्या विशिष्ट शैलीगत प्रवृत्ती.

जरी या अभ्यासात असे मान्य केले असले की Pangram सारखी AI डिटेक्शन टूल्स अचूक नसतात आणि त्यामध्ये 'फॉल्स पॉझिटिव्ह' (false positives) असू शकतात, तरीही डेटाचे प्रमाण असे सूचित करते की हे निष्कर्ष दिशात्मकदृष्ट्या अचूक आहेत. डेव्हलपर्स आणि संस्थापकांसाठी, हे एक महत्त्वाचे आव्हान अधोरेखित करते: जसजसा वेब सिंथेटिक डेटाने भरला जात आहे, तसतसे भविष्यातील मॉडेल्ससाठी ट्रेनिंग सेट्सची गुणवत्ता राखणे अधिकाधिक कठीण होत आहे.

मुख्य निष्कर्ष

  • कंटेंट निर्मितीमध्ये मोठा बदल: ChatGPT च्या लाँचपासून प्रकाशित झालेल्या वेब पेजेसपैकी ३५% पेजेसमध्ये AI लेखन किंवा मोठ्या प्रमाणावर AI एडिटिंगचे स्पष्ट संकेत आढळतात.
  • व्यावसायिक वर्चस्व: .com डोमेन्स हे AI कंटेंटचे मुख्य चालक आहेत, जे .edu आणि .gov डोमेन्सच्या तुलनेत १० पटीने जास्त आहेत.
  • बॉट इकोसिस्टम: AI-लिखित कंटेंटमधील वाढ ही बॉट ट्रॅफिक मानवी ट्रॅफिकला मागे टाकण्याच्या टप्प्याशी जुळते, जे मशीन-प्रभुत्व असलेल्या वेब इकोसिस्टमकडे होणाऱ्या बदलाचे संकेत देते.