Третина вебконтенту після появи ChatGPT має ознаки написання ШІ

Революційне дослідження Pew Research виявило масштабний зсув у цифровому ландшафті, встановивши, що значна частина нового вебконтенту створюється штучним інтелектом. Оскільки великі мовні моделі (LLM) інтегруються в робочі процеси створення контенту, межа між текстами, створеними людиною та машиною, стрімко стирається.

Сплеск контенту, створеного ШІ

Щоб кількісно оцінити вплив генеративного ШІ на інтернет, Pew Research проаналізували майже 500 000 англомовних вебсторінок, використовуючи веб-архів Common Crawl. За допомогою технології виявлення Open Pangram дослідження намагалося розрізнити тексти, написані людиною, та тексти за допомогою ШІ.

Хоча випадкова вибірка з 10 000 сторінок за липень 2026 року показала 10% рівень авторства ШІ, цей показник був викривлений через включення застарілого контенту, опублікованого до буму генеративного ШІ. Однак, коли дослідники відфільтрували набір даних, залишивши лише сторінки, опубліковані після запуску ChatGPT у листопаді 2022 року, показники різко зросли. Дослідження виявило, що понад третина (35%) усіх вебсторінок, опублікованих у цю сучасну епоху, мають значні ознаки того, що вони були написані або «суттєво відредаговані» ШІ.

Розбіжності між доменами та «петля ботів»

Поширення ШІ-контенту не є рівномірним по всьому вебу. Дослідження висвітлило різкий контраст між різними доменами верхнього рівня (TLD), що свідчить про те, що комерційні інтереси є рушійною силою найбільш агресивного впровадження інструментів написання текстів за допомогою ШІ.

Згідно з даними, URL-адреси з доменом .com демонструють рівень авторства ШІ приблизно в 10 разів вищий, ніж академічні або урядові сайти. Зокрема, домени .edu та .gov показали лише 1% авторства ШІ, тоді як домени .org склали 4,6%. Ця тенденція вказує на комерціалізований веб, де швидкість і масштаб — часто досягаються за допомогою LLM — мають пріоритет над традиційним редакційним наглядом.

Цей сплеск ШІ-контенту відбувається паралельно з тривожною подією, про яку повідомила Cloudflare: трафік ботів офіційно перевершив трафік людей. Це створює потенційну петлю зворотного зв'язку «мертвого інтернету», де боти дедалі частіше переглядають і збирають (scraping) контент, який сам був написаний іншими ботами.

Лінгвістичні ознаки та виклики виявлення

Дослідження також виявило специфічні лінгвістичні патерни, які слугують «ознаками» тексту, створеного ШІ. Оскільки LLM стають дедалі складнішими, їхні стилістичні відбитки стають більш передбачуваними. Дослідники відзначили зростання поширеності певних синтаксичних структур, таких як:

  • Широке використання довгих тире (em dashes) та оксфордських ком.
  • Ритмічні моделі фраз, наприклад: «Це не X, це Y».
  • Специфічні стилістичні тенденції, оптимізовані для читабельності, але позбавлені людських нюансів.

Хоча в дослідженні визнається, що інструменти виявлення ШІ, такі як Pangram, не є безпомилковими і можуть давати хибнопозитивні результати, масштаб даних свідчить про те, що ці висновки вказують на правильний напрямок. Для розробників і засновників це підкреслює критичну проблему: оскільки веб стає насиченим синтетичними даними, підтримувати якість навчальних наборів для майбутніх моделей стає дедалі складніше.

Основні висновки

  • Масштабний зсув у створенні контенту: 35% вебсторінок, опублікованих після запуску ChatGPT, мають чіткі ознаки авторства ШІ або інтенсивного редагування ШІ.
  • Комерційне домінування: Домени .com є основними рушіями ШІ-контенту, випереджаючи домени .edu та .gov у 10 разів.
  • Екосистема ботів: Зростання обсягу контенту, написаного ШІ, збігається з моментом, коли трафік ботів перевершив трафік людей, що сигналізує про перехід до веб-екосистеми, де домінують машини.