Масштаб проникнення генеративних моделей у веб-простір виявився значно серйознішим, ніж прийнято вважати. Мій аналіз свіжих даних показує: приблизно кожна десята веб-сторінка в інтернеті несе в собі явні ознаки машинної генерації або суттєвої редактури. Однак якщо дивитися на контент, опублікований після дебюту ChatGPT у листопаді 2022 року, картина стає радикально іншою — понад третина таких сторінок мають синтетичне походження.

Методологія та масштаб явища

Під час дослідження було проаналізовано випадкову вибірку з 10 000 англомовних сторінок, зібраних у липні 2026 року через архів Common Crawl. Для ідентифікації використовувалася модель машинного навчання, налаштована на пошук характерних лінгвістичних патернів, властивих генеративним нейромережам. Загальний показник у 10% може здатися скромним, але він розмивається за рахунок величезного пласта застарілого контенту, створеного задовго до ери сучасних LLM.

Коли ми відсікаємо «доісторичний» веб і фокусуємося виключно на публікаціях, що з'явилися після запуску ChatGPT, ми бачимо стрімку експансію ШІ. Третина нових сторінок — це не маргінальна ніша, а системний тренд, який лише посилюватиметься в міру інтеграції Claude, Gemini та інших моделей у повсякденні робочі процеси.

Комерційний сектор — головний драйвер

Розподіл синтетики за доменними зонами підкреслює економічне підґрунтя явища. У зоні .com ознаки ШІ-генерації виявляються на кожній десятій сторінці — це вдвічі вище, ніж у некомерційній зоні .org (4,6%). Ще показовіший розрив з освітніми та державними доменами (.edu та .gov), де частка ледь сягає 1%.

Така диспропорція логічна: комерційні майданчики активно автоматизують створення описів товарів, SEO-текстів і новинних стрічок. Це об'ємні, шаблонні формати, де швидкість та економія ресурсів важливіші за унікальний авторський погляд. На початку буму ChatGPT ці відмінності були згладжені, але зараз ринок чітко сегментувався.

Важливі застереження методології

Варто підкреслити, що йдеться не про точний підрахунок «написаного роботом», а про ймовірнісну оцінку. Дослідники не перевіряли історію редагувань і не опитували авторів. Аналіз спирався на статистичні мовні маркери, які можуть бути присутні й у тексті, написаному людиною, але такому, що пройшов агресивну ШІ-редактуру. Крім того, дрібні правки за допомогою нейромережі в цю категорію, як правило, не потрапляють.

У цьому контексті показове нещодавнє рішення Anthropic про глобальне маркування контенту, створеного Claude. Індустрія починає усвідомлювати: без чіткої ідентифікації синтетики ми ризикуємо остаточно втратити межу між фактом і симулякром.

Мій висновок: ми спостерігаємо не просто тренд, а тектонічний зсув в економіці контенту. Веб стрімко перетворюється на середовище, де людське авторство стає преміальним продуктом на тлі дешевої та безликої машинної маси. Питання не в тому, чи зупинить це хтось, а в тому, як ми адаптуємо алгоритми пошуку та довіри до нової реальності.