Цифровий ландшафт стрімко трансформується: мій аналіз свіжих даних показує, що приблизно 10% усіх веб-сторінок в інтернеті несуть явні сліди машинної генерації або глибокого редагування. Однак куди тривожніша цифра прихована в динаміці — серед матеріалів, опублікованих після дебюту ChatGPT, частка синтетичного контенту перевищує 33%.

Масштаб експансії: від 10% до третини

Під час дослідження було проаналізовано випадкову вибірку з 10 000 англомовних сторінок, зібраних у липні 2026 року через архів Common Crawl. Для ідентифікації використовувалася модель машинного навчання, налаштована на пошук лінгвістичних патернів, характерних для генеративних нейромереж. На перший погляд, 10% — це помірний показник, але він включає в себе величезний пласт «доісторичного» контенту, створеного до ери просунутих LLM.

Якщо ж відфільтрувати цей legacy-контент і зосередитися виключно на публікаціях, що з'явилися після листопада 2022 року, картина змінюється радикально. Понад одна третина таких сторінок демонструє високу ймовірність ІІ-авторства. Це прямий доказ того, що генеративні моделі стали основним інструментом виробництва текстів для значної частини вебу.

Географія синтетики: комерція лідирує

Розподіл ІІ-контенту за доменними зонами вкрай нерівномірний, що свідчить про прагматичне використання технології. У зоні .com ознаки генерації виявляються приблизно в кожної десятої сторінки. Для порівняння, у некомерційній зоні .org цей показник удвічі нижчий — 4,6%. Найбільш «чистими» залишаються освітні (.edu) та урядові (.gov) ресурси, де частка синтетики ледь сягає 1%.

Така диференціація пояснюється тим, що комерційні майданчики активно автоматизують створення SEO-текстів, карток товарів і новинних стрічок. На початку поширення ChatGPT розрив між зонами був мінімальним, однак зараз ринок чітко сегментувався за ступенем впровадження ІІ.

Методологічна обережність

Важливо розуміти обмеження цієї оцінки. Дослідження не перевіряє історію правок кожної сторінки і не опитує авторів. Висновки ґрунтуються на статистичному аналізі мовних маркерів, які корелюють з ІІ-генерацією. Йдеться про ймовірнісну оцінку, а не про точний підрахунок. Крім того, категорія «суттєво відредагований» контент виключає легку коректуру, що робить оцінки навіть дещо консервативними.

Мій коментар: Ринок уже пройшов точку неповернення. Ми спостерігаємо не просто тренд, а фундаментальний зсув в економіці контенту. Однак гонка за обсягом за допомогою ІІ створює ризик девальвації інформації та зростання «цифрового шуму». У найближчі роки ключовим активом стане не швидкість генерації, а довіра до джерела та якість верифікації даних. Гравці, які зможуть вибудувати гібридні редакційні процеси, де ІІ посилює, а не замінює аналітику, отримають вирішальну перевагу.