ChatGPT کے بعد ویب مواد کا ایک تہائی حصہ AI کی تحریر کے آثار ظاہر کرتا ہے
Pew Research کی ایک انقلابی تحقیق نے ڈیجیٹل منظرنامے میں ایک بڑی تبدیلی کا انکشاف کیا ہے، جس سے پتہ چلتا ہے کہ ویب کے نئے مواد کا ایک بڑا حصہ مصنوعی ذہانت (AI) کے ذریعے تیار کیا جا رہا ہے۔ جیسے جیسے Large Language Models (LLMs) مواد کے ورک فلو میں شامل ہو رہے ہیں، انسانی اور مشین کے تیار کردہ متن کے درمیان فرق تیزی سے ختم ہو رہا ہے۔
AI کے ذریعے تیار کردہ مواد میں اضافہ
انٹرنیٹ پر جنریٹیو AI کے اثرات کی پیمائش کرنے کے لیے، Pew Research نے Common Crawl ویب آرکائیو کا استعمال کرتے ہوئے تقریباً 500,000 انگریزی زبان کے ویب صفحات کا تجزیہ کیا۔ Open Pangram کی ڈیٹیکشن ٹیکنالوجی کو بروئے کار لاتے ہوئے، اس تحقیق کا مقصد انسانی تحریر اور AI کی مدد سے تیار کردہ متن کے درمیان فرق کرنا تھا۔
اگرچہ جولائی 2026 کے 10,000 صفحات کے ایک بے ترتیب نمونے نے 10% AI تحریر کی شرح دکھائی، لیکن اس ہندسے میں جنریٹیو AI کے عروج سے پہلے شائع ہونے والے پرانے مواد کی شمولیت کی وجہ سے فرق تھا۔ تاہم، جب محققین نے ڈیٹا سیٹ کو فلٹر کیا تاکہ صرف نومبر 2022 میں ChatGPT کے آغاز کے بعد شائع ہونے والے صفحات شامل ہوں، تو اعداد و شمار میں اضافہ ہوا۔ تحقیق سے پتہ چلا کہ اس حالیہ دور میں شائع ہونے والے تمام ویب صفحات میں سے ایک تہائی سے زیادہ (35%) میں AI کے ذریعے لکھے جانے یا "بڑی حد تک ترمیم" کیے جانے کے نمایاں آثار ملتے ہیں۔
ڈومینز میں فرق اور "بوٹ لوپ"
ویب پر AI مواد کا پھیلاؤ یکساں نہیں ہے۔ تحقیق نے مختلف ٹاپ لیول ڈومینز (TLDs) کے درمیان واضح فرق کو اجاگر کیا ہے، جس سے یہ اشارہ ملتا ہے کہ تجارتی مفادات AI لکھنے والے ٹولز کے سب سے زیادہ جارحانہ استعمال کو فروغ دے رہے ہیں۔
ڈیٹا کے مطابق، .com ڈومین والے URLs میں AI تحریر کی شرح تعلیمی یا حکومتی سائٹس کے مقابلے میں تقریباً 10 گنا زیادہ ہے۔ خاص طور پر، .edu اور .gov ڈومینز میں AI تحریر کی شرح محض 1% رہی، جبکہ .org ڈومینز 4.6% پر رہی۔ یہ رجحان ایک تجارتی ویب کی طرف اشارہ کرتا ہے جہاں روایتی ادارتی نگرانی کے مقابلے میں رفتار اور وسعت کو ترجیح دی جاتی ہے—جو اکثر LLMs کے ذریعے حاصل کی جاتی ہے۔
AI مواد میں یہ اضافہ Cloudflare کی رپورٹ کردہ ایک تشویشناک سنگ میل کے ساتھ ہو رہا ہے: بوٹ ٹریفک نے باقاعدہ طور پر انسانی ویب ٹریفک کو پیچھے چھوڑ دیا ہے۔ یہ ایک ممکنہ "dead internet" فیڈ بیک لوپ پیدا کرتا ہے، جہاں بوٹس تیزی سے اس مواد کو براؤز اور اسکریپ کر رہے ہیں جو خود دوسرے بوٹس نے لکھا ہوتا ہے۔
لسانی اشارے اور ڈیٹیکشن کے چیلنجز
تحقیق نے مخصوص لسانی نمونوں کی بھی نشاندہی کی ہے جو AI کے تیار کردہ متن کے لیے "اشارے" کے طور پر کام کرتے ہیں۔ جیسے جیسے LLMs زیادہ پیچیدہ ہوتے جا رہے ہیں، ان کے اسلوب کے نشانات زیادہ قابلِ پیش گوئی ہو گئے ہیں۔ محققین نے مخصوص نحوی ڈھانچوں کے بڑھتے ہوئے استعمال کو نوٹ کیا ہے، جیسے کہ:
- em dashes اور Oxford commas کا کثرت سے استعمال۔
- تال کے حامل جملوں کے نمونے جیسے "It’s not X, it’s Y"۔
- پڑھنے میں آسانی کے لیے موزوں مخصوص اسلوب کے رجحانات لیکن انسانی باریکیوں کی کمی۔
اگرچہ تحقیق اس بات کو تسلیم کرتی ہے کہ Pangram جیسے AI ڈیٹیکشن ٹولز ناقابلِ خطا نہیں ہیں اور ان میں غلط نتائج (false positives) کا امکان ہو سکتا ہے، لیکن ڈیٹا کا حجم یہ بتاتا ہے کہ یہ نتائج درست سمت میں ہیں۔ ڈویلپرز اور فاؤنڈرز کے لیے، یہ ایک اہم چیلنج کو اجاگر کرتا ہے: جیسے جیسے ویب مصنوعی ڈیٹا سے بھرتی جا رہی ہے، مستقبل کے ماڈلز کے لیے ٹریننگ سیٹس کے معیار کو برقرار رکھنا تیزی سے مشکل ہوتا جا رہا ہے۔
اہم نکات
- مواد کی تخلیق میں بڑی تبدیلی: ChatGPT کے آغاز کے بعد سے شائع ہونے والے 35% ویب صفحات AI کی تحریر یا بھاری AI ایڈیٹنگ کے واضح آثار ظاہر کرتے ہیں۔
- تجارتی غلبہ: .com ڈومینز AI مواد کے بنیادی محرک ہیں، جو .edu اور .gov ڈومینز سے 10 گنا زیادہ ہیں۔
- بوٹ ایکو سسٹم: AI کے ذریعے لکھے گئے مواد میں اضافہ بوٹ ٹریفک کے انسانی ٹریفک سے آگے نکلنے کے ساتھ ہو رہا ہے، جو مشین کے زیرِ اثر ویب ایکو سسٹم کی طرف تبدیلی کا اشارہ ہے۔
