Sepertiga Kandungan Web Pasca-ChatGPT Menunjukkan Tanda Penulisan AI

Satu kajian rintis oleh Pew Research telah mendedahkan peralihan besar dalam landskap digital, yang menunjukkan bahawa sebahagian besar kandungan web baharu dijana oleh kecerdasan buatan. Memandangkan Model Bahasa Besar (LLM) semakin disepadukan ke dalam aliran kerja kandungan, sempadan antara teks buatan manusia dan mesin semakin kabur dengan pantas.

Lonjakan Kandungan Dijana AI

Untuk mengukur impak AI generatif terhadap internet, Pew Research telah menganalisis hampir 500,000 halaman web dalam bahasa Inggeris menggunakan arkib web Common Crawl. Dengan menggunakan teknologi pengesanan Open Pangram, kajian tersebut cuba membezakan antara teks yang ditulis oleh manusia dan teks yang dibantu oleh AI.

Walaupun sampel rawak sebanyak 10,000 halaman dari Julai 2026 menunjukkan kadar penulisan AI sebanyak 10%, angka ini telah terpesong disebabkan oleh penyertaan kandungan lama yang diterbitkan sebelum ledakan AI generatif. Walau bagaimanapun, apabila penyelidik menapis set data untuk menyertakan hanya halaman yang diterbitkan selepas pelancaran ChatGPT pada November 2022, angka tersebut melonjak. Kajian mendapati bahawa lebih daripada sepertiga (35%) daripada semua halaman web yang diterbitkan dalam era terbaharu ini menunjukkan tanda-tanda ketara telah ditulis atau "disunting secara ketara" oleh AI.

Perbezaan Domain dan "Gelung Bot"

Proliferasi kandungan AI tidak seragam di seluruh web. Kajian tersebut menonjolkan perbezaan ketara antara domain tahap tinggi (TLD) yang berbeza, yang menunjukkan bahawa kepentingan komersial memacu penggunaan alat penulisan AI yang paling agresif.

Menurut data tersebut, URL dengan domain .com menunjukkan kadar penulisan AI kira-kira 10 kali lebih tinggi daripada laman akademik atau kerajaan. Secara khusus, domain .edu dan .gov hanya menunjukkan kadar penulisan AI sebanyak 1%, manakala domain .org berada pada kadar 4.6%. Trend ini menunjukkan ke arah web yang dikomersialkan di mana kepantasan dan skala—yang sering dicapai melalui LLM—diutamakan berbanding penyeliaan editorial tradisional.

Lonjakan kandungan AI ini berlaku seiring dengan pencapaian membimbangkan yang dilaporkan oleh Cloudflare: trafik bot secara rasmi telah mengatasi trafik web manusia. Ini mewujudkan potensi "gelung maklum balas internet mati" (dead internet feedback loop), di mana bot semakin banyak melayari dan mencakar (scraping) kandungan yang sebenarnya ditulis oleh bot lain.

Petunjuk Linguistik dan Cabaran Pengesanan

Kajian tersebut juga mengenal pasti corak linguistik khusus yang berfungsi sebagai "petunjuk" bagi teks janaan AI. Memandangkan LLM telah menjadi lebih canggih, cap jari gaya penulisannya menjadi lebih mudah diramal. Penyelidik memerhatikan peningkatan prevalens struktur sintaksis tertentu, seperti:

  • Penggunaan tanda sengkang (em dash) dan koma Oxford yang meluas.
  • Corak frasa berirama seperti "Ia bukan X, ia adalah Y."
  • Kecenderungan gaya khusus yang dioptimumkan untuk kebolehbacaan tetapi kekurangan nuansa manusia.

Walaupun kajian tersebut mengakui bahawa alat pengesanan AI seperti Pangram tidaklah sempurna dan boleh mengalami ralat positif (false positives), skala data tersebut menunjukkan bahawa penemuan ini adalah tepat dari segi arah tuju. Bagi pembangun dan pengasas, ini menonjolkan cabaran kritikal: apabila web menjadi tepu dengan data sintetik, mengekalkan kualiti set latihan untuk model masa hadapan menjadi semakin sukar.

Ringkasan Utama

  • Peralihan Besar dalam Penciptaan Kandungan: 35% halaman web yang diterbitkan sejak pelancaran ChatGPT menunjukkan tanda-tanda jelas penulisan AI atau penyuntingan AI yang berat.
  • Dominasi Komersial: Domain .com adalah pemacu utama kandungan AI, mengatasi domain .edu dan .gov sebanyak 10 kali ganda.
  • Ekosistem Bot: Peningkatan kandungan bertulis AI berlaku serentak dengan trafik bot yang mengatasi trafik manusia, menandakan peralihan ke arah ekosistem web yang didominasi oleh mesin.