ШІ захоплює веб: понад третина нових сторінок створена нейромережами — мій аналіз даних Pew Research

Масштаб проникнення генеративних моделей у веб-простір виявився значно серйознішим, ніж прийнято вважати. Мій аналіз свіжих даних дослідницького центру показує: близько 10% усіх проіндексованих веб-сторінок в англомовному сегменті несуть явні сліди синтетичного тексту. Однак ключова цифра прихована глибше — серед матеріалів, опублікованих після дебюту ChatGPT у листопаді 2022 року, частка ІІ-контенту перевищує 33%.
Методологія та реальні цифри
Дослідження базується на випадковій вибірці з 10 000 англомовних сторінок, зібраних у липні 2026 року через архів Common Crawl. Для ідентифікації використовувалася модель машинного навчання, навчена виявляти характерні лінгвістичні патерни генеративних алгоритмів. Важливо підкреслити: це не бінарний детектор, а ймовірнісна оцінка, заснована на статистичних аномаліях у тексті.
На перший погляд, 10% можуть здатися скромним показником. Але вибірка включає величезний пласт легасі-контенту, створеного до ери сучасних LLM. Коли я відфільтровую застарілі сторінки та зосереджуюся виключно на публікаціях останніх років, картина радикально змінюється: кожна третя нова сторінка в вебі має ознаки ІІ-авторства або суттєвого редагування нейромережею.
Комерційний сектор — головний драйвер синтетики
Розподіл ІІ-контенту за доменними зонами демонструє чітку закономірність. У зоні .com ознаки генерації виявляються приблизно у 10% сторінок — це вдвічі вище, ніж у .org (4,6%). Найбільш показовими є освітні (.edu) та урядові (.gov) ресурси, де частка синтетики не перевищує 1%.
Така диспропорція пояснюється економікою контенту. Комерційні майданчики активно автоматизують виробництво описів товарів, SEO-текстів і новинних заміток, де швидкість важливіша за унікальність. На початку поширення ChatGPT розрив між зонами був менш вираженим, але зараз тренд очевидний: чим вища монетизація трафіку, тим агресивніше впровадження ІІ.
Критичне застереження щодо даних
Незважаючи на значні цифри, я зобов'язаний зазначити обмеження методології. Дослідження не аналізує історію правок і не опитує авторів. Йдеться про лінгвістичні маркери, які статистично корелюють з ІІ-генерацією, але не є абсолютним доказом. Крім того, категорія «суттєво відредагований» контент виключає дрібні правки, що робить оцінку консервативною.
У цьому контексті нагадаю: у серпні Anthropic запровадила глобальне маркування для контенту, створеного моделями Claude. Однак без єдиного стандарту для всіх LLM ринок залишається фрагментованим.
Мій вердикт: ці дані — тривожний сигнал для екосистеми вебу. Якщо третина нового контенту генерується алгоритмами без прозорого маркування, ми рухаємося до інформаційного середовища, де довіра до тексту вимагатиме криптографічної верифікації. Для аналітиків та інвесторів це означає зростання цінності платформ із доведеним людським авторством — і неминуче посилення регуляторних вимог до ІІ-публікацій.