Масштаб проникнення генеративних моделей у веб-контент виявився набагато серйознішим, ніж прийнято вважати. Мій аналіз свіжих даних Pew Research Center показує: приблизно 10% усіх веб-сторінок в інтернеті несуть сліди тексту, створеного або глибоко відредагованого штучним інтелектом. Однак ключова цифра прихована глибше — серед матеріалів, опублікованих після дебюту ChatGPT, частка синтетики перевищує третину.
ШІ захоплює нові сторінки
Дослідники вивчили випадкову вибірку з 10 000 англомовних сторінок, зібраних у липні 2026 року через Common Crawl. Для ідентифікації авторства застосовувалася модель машинного навчання, навчена виявляти характерні мовні патерни генеративних нейромереж. На перший погляд, 10% — скромний показник, але він включає величезний пласт історичного контенту, створеного до ери сучасних LLM.
Коли я відфільтровую старі артефакти та зосереджуюся лише на сторінках, що з'явилися після листопада 2022 року, картина радикально змінюється. Понад третина таких сторінок демонструють явні ознаки ШІ-генерації. Це підтверджує: зростання синтетичного контенту безпосередньо корелює з експансією ChatGPT, Claude, Gemini та їхніх конкурентів.
Комерційний сектор — головний полігон ШІ
Розподіл ШІ-контенту за доменними зонами вкрай нерівномірний і відображає економічні стимули. У 2026 році кожна десята сторінка в зоні .com несе сліди нейромереж — це вдвічі вище, ніж у .org (4,6%). На освітніх (.edu) та державних (.gov) ресурсах частка падає до 1%, що в десять разів нижче комерційного сектора. Розрив пояснюється просто: бізнес-сайти масово публікують описи товарів, SEO-статті та новини, які легко автоматизувати. На початку ери ChatGPT ці відмінності були згладжені, але зараз ринок чітко сегментувався.
Методологічні нюанси
Важливо підкреслити: Pew не перевіряв історію створення кожної сторінки і не опитував авторів. Аналіз ґрунтується на статистичних мовних маркерах, які корелюють із ШІ-генерацією. Тому результати варто трактувати як оцінку ймовірного авторства, а не точний підрахунок. Більше того, йдеться про «написаний або суттєво відредагований» контент — дрібні правки нейромережею в цю категорію не потрапляють.
Показово, що Anthropic уже в серпні запровадила глобальне маркування контенту від Claude, що лише підтверджує системність проблеми.
Мій висновок: ці цифри — не просто статистика, а сигнал про тектонічний зсув у виробництві інформації. Ринок стрімко рухається до гібридного контенту, де межа між людським і машинним авторством стирається. Для інвесторів та аналітиків це означає необхідність перегляду оцінки якості веб-активів і ризиків дезінформації в найближчі роки.