Масштаб проникнення генеративних нейромереж у веб-простір виявився значно глибшим, ніж прийнято вважати. Мій аналіз свіжих даних показує: приблизно кожна десята веб-сторінка в інтернеті несе сліди синтетичного авторства. Однак якщо дивитися на контент, опублікований після запуску ChatGPT, ситуація виглядає набагато радикальніше — понад третина таких сторінок демонструє явні ознаки генерації або суттєвого редагування штучним інтелектом.

Методологія та ключові цифри

Під час дослідження було проаналізовано випадкову вибірку з 10 000 англомовних сторінок, зібраних у липні 2026 року. Для ідентифікації використовувалася модель машинного навчання, навчена виявляти лінгвістичні патерни, характерні для сучасних LLM. На перший погляд, 10% від загального масиву — помірна цифра. Але не варто забувати: у вибірку потрапила величезна кількість «старого» вебу, створеного задовго до ери генеративного ШІ.

Якщо ж відсікти спадщину минулого та зосередитися виключно на матеріалах, опублікованих після листопада 2022 року, картина змінюється драматично. Синтетичні сліди виявляються більш ніж у третини нових сторінок. Це прямий доказ того, що ChatGPT, Claude, Gemini та їхні аналоги стали головними «авторами» сучасного контенту.

Хто лідирує за генерацією

Розподіл синтетики за доменними зонами вкрай нерівномірний, і це відображає економічну логіку. У зоні .com ознаки ШІ виявляються на кожній десятій сторінці (близько 10%), що вдвічі перевищує показники .org (4,6%). А ось освітні (.edu) та урядові (.gov) ресурси демонструють лише близько 1% — у десять разів менше.

Така диспропорція пояснюється природою контенту. Комерційний сектор завалює мережу масовими текстами: описами товарів, SEO-статтями та новинними замітками. Саме ці формати найлегше автоматизувати. На початку буму ChatGPT розрив між зонами був менш помітним, але зараз ринок повністю адаптувався до можливостей ШІ.

Важливі застереження

Варто підкреслити: дослідження не стверджує, що кожен такий текст написаний ботом. Методологія ґрунтується на статистичному аналізі мовних маркерів, а не на перевірці історії створення файлів. Це радше оцінка ймовірного авторства, а не точний підрахунок. Крім того, категорія «написаного або відредагованого» ШІ передбачає значну обробку, а не просто використання автозаміни чи дрібних правок.

Мій коментар: Ці дані — тривожний дзвінок для ринку контенту. Ми стоїмо на порозі інфляції інформаційного шуму, де пошуковики та агрегатори захлинаються в синтетиці. Галузі потрібні нові стандарти верифікації та маркування, інакше довіра до вебу як джерела знань буде остаточно підірвана. Ініціативи на кшталт маркування контенту від Anthropic — лише перший крок у правильному напрямку, але індустрії доведеться пройти довгий шлях.