
Нове дослідження визначило, яку частину інтернету зараз генерує ШІ: 35%. Такою є частка нещодавно опублікованих веб-сайтів, класифікованих як створені або підтримані ШІ до середини 2025 року, згідно з дослідженням Стенфордського університету, Імперського коледжу Лондона та Internet Archive. До запуску ChatGPT у листопаді 2022 року цей показник був практично нульовим.
"Я вважаю надзвичайну швидкість поглинання вебу штучним інтелектом досить приголомшливою", — сказав 404 Media Йонаш Долежал, дослідник Імперського коледжу Лондона та співавтор статті. "Після десятиліть формування людьми значна частина інтернету стала визначатися ШІ всього за три роки."
Дослідження під назвою «Вплив тексту, згенерованого ШІ, на Інтернет» ґрунтувалося на 33 місяцях знімків веб-сайтів з Wayback Machine Internet Archive та використовувало детектор тексту ШІ під назвою Pangram v3 для класифікації кожної сторінки.
Підтверджені шкоди: враження, а не факти
Дослідники перевірили шість гіпотез щодо впливу контенту ШІ на веб. Лише дві витримали перевірку даними.
Перша: Ми перетворюємося на орду тупих NPC, що діють однаково... Або, науково кажучи, веб стає менш семантично різноманітним.
Сайти, згенеровані ШІ, показали парні показники семантичної схожості на 33% вищі, ніж створені людьми. Одні й ті самі ідеї продовжують виражатися майже однаковими способами.
Стаття припускає, що онлайн-вікно Овертона може звужуватися не через цензуру чи скоординовані кампанії, а тому, що мовні моделі оптимізують результати, близькі до їхнього навчального розподілу.
Друга: Веб стає агресивно життєрадісним.
Контент ШІ показав показники позитивного настрою більш ніж на 107% вищі, ніж людський контент. Дослідники пов'язують це з добре задокументованими підлабузницькими тенденціями великих мовних моделей (LLM) — навчені на сигналах людського схвалення, вони створюють текст, який відчувається очищеним, безконфліктним і невтомно оптимістичним.
Інтернет, переповнений життєрадісним, гомогенізованим контентом, може маргіналізувати людське інакомислення у великих масштабах, без чийогось свідомого втручання.
Попри поширену громадську думку, дослідження не виявило статистично значущих доказів того, що контент ШІ робить інтернет менш фактично точним. Дослідники не знайшли значущої кореляції між поширеністю ШІ та рівнем фактичних помилок.
Гіпотеза стилістичної монокультури — що ШІ згладжує індивідуальні голоси до загального уніфікованого реєстру — була думкою, яку респонденти підтримували найрішучіше (83% погодилися). Дані не підтвердили це. Аналіз на рівні символів не виявив статистично значущого збільшення стилістичної однорідності, пов'язаної з поширеністю ШІ.
Більш широкі ставки виходять за межі якості дискурсу. При 35% поширеності ШІ теоретичний ризик колапсу моделі — коли майбутні моделі деградують після навчання на даних, згенерованих ШІ — перетворюється з академічної проблеми на емпіричну реальність. Майбутні фундаментальні моделі, навчені на сучасних веб-скануваннях, неминуче поглинатимуть дані, які значною мірою згенеровані ШІ та помітно менш семантично різноманітні.
Зараз команда співпрацює з Internet Archive, щоб перетворити дослідження на безперервний інструмент моніторингу в реальному часі, відстежуючи частку ШІ у вебі, а не як одноразовий знімок.
Опитування в США, проведене разом із дослідженням, показало, що більшість американців вже вірять у всі шість негативних гіпотез, включаючи ті, які дані не підтверджують. Люди, які рідко використовують ШІ, на 12% частіше вірили в шкоду, ніж часті користувачі. Віруючі в Теорію Мертвого Інтернету, ось вам дані: Інтернет не мертвий, але 35% нового контенту, ймовірно, є своєрідним зомбі-контентом.