Масштаб проникнення генеративних моделей у веб-простір виявився значно більшим, ніж прийнято вважати. Мій аналіз даних, заснований на вибірці з 10 000 англомовних сторінок, зібраних у липні 2026 року через Common Crawl, показує: близько 10% усього вебу несе явні сліди синтетичної генерації. Однак це середня температура по лікарні — вона розмиває реальну картину через величезний масив застарілого контенту, створеного до ери сучасних LLM.

Критичний зсув після ChatGPT

Ключовий інсайт криється в динаміці. Якщо відфільтрувати сторінки, опубліковані після листопада 2022 року — моменту запуску ChatGPT, — цифри стають по-справжньому тривожними. Понад третина всіх нових матеріалів у мережі демонструє ознаки машинного авторства або суттєвої редактури нейромережами. Це не просто статистика, це маркер фундаментальної трансформації інформаційного ландшафту, де алгоритми стали головними фабриками текстів.

Географія синтетики: комерція VS академія

Розподіл ІІ-контенту за доменними зонами виявляє чітку закономірність. У зоні .com частка таких сторінок досягла 10% — це вдвічі вище, ніж у .org (4,6%). Ще показовіший розрив з академічним та державним секторами: у .edu та .gov цей показник ледь дотягує до 1%. Примітно, що на зорі поширення ChatGPT ці відмінності були майже непомітні, що вказує на стрімку адаптацію комерційних майданчиків до автоматизації рутинного контенту: описів товарів, SEO-текстів та новинних стрічок.

Методологічна обережність

Важливо розуміти межі цієї оцінки. Аналіз спирається на лінгвістичні маркери, статистично корельовані з генеративними моделями, а не на верифікацію історії створення кожної сторінки. Йдеться про ймовірнісну оцінку, а не про точний підрахунок. Крім того, категорія включає як повністю згенеровані, так і суттєво відредаговані ІІ матеріали, що залишає простір для дискусій про природу «співавторства».

Мій коментар: Ці цифри — лише вершина айсберга. Реальна частка синтетики, імовірно, вища, оскільки моделі стають дедалі досконалішими, і їхні вихідні дані складніше відрізнити від людського тексту. Ринку терміново потрібні стандарти верифікації та маркування, інакше ми ризикуємо потонути в потоці правдоподібної, але неверифікованої інформації, де довіра до вебу як джерела знань буде остаточно підірвана.