Масштаби проникнення генеративного штучного інтелекту у веб-простір виявилися значно серйознішими, ніж прийнято вважати. Мій аналіз свіжих даних показує: приблизно 10% усіх наявних веб-сторінок несуть явні сліди машинної генерації або суттєвого редагування. Однак найбільш тривожний показник — серед контенту, опублікованого після дебюту ChatGPT, частка синтетичних текстів перевищує одну третину.

Методологія та ключові цифри

Під час дослідження було проаналізовано випадкову вибірку з 10 000 англомовних сторінок, зібраних у липні 2026 року через архів Common Crawl. Для ідентифікації використовувалася модель машинного навчання, яка виявляє характерні лінгвістичні патерни, притаманні генеративним моделям. Той факт, що до вибірки потрапив значний обсяг «старого» контенту, створеного до епохи сучасних нейромереж, дещо згладжує загальну картину. Якщо ж відфільтрувати застарілі матеріали та зосередитися виключно на сторінках, опублікованих після листопада 2022 року, картина радикально змінюється: ознаки ІІ-авторства виявляються більш ніж у 33% таких документів.

Комерційний сектор — головна зона ураження

Розподіл синтетичного контенту за доменними зонами вкрай нерівномірний. У зоні .com ознаки ІІ фіксуються приблизно в кожної десятої сторінки, що вдвічі перевищує показники .org (4,6%). Освітні (.edu) та урядові (.gov) ресурси демонструють мінімальну присутність — близько 1%. Така диспропорція пояснюється тим, що комерційні майданчики активно використовують автоматизацію для генерації описів товарів, SEO-текстів та новинних заміток, де швидкість важливіша за унікальність.

Важливі застереження

Слід підкреслити: дослідження не стверджує, що кожен виявлений текст був написаний ІІ з нуля. Методологія спирається на статистичний аналіз мовних конструкцій, а не на верифікацію історії створення документа. Йдеться про оцінку ймовірного авторства, а не про точний підрахунок. Крім того, категорія «суттєво відредагованого» контенту виключає випадки незначної правки тексту нейромережею.

Мій коментар: ці цифри — лише верхівка айсберга. Уже зараз очевидно, що ми рухаємося до вебу, де синтетичний контент стане нормою, а не винятком. Питання не в тому, як зупинити цей процес, а в тому, як вибудувати системи довіри та верифікації інформації в нових реаліях. Маркування контенту, подібне до того, що впровадила Anthropic для Claude, — лише перший крок на цьому шляху.