Масштаб проникнення генеративних нейромереж у веб-контент виявився значно глибшим, ніж прийнято вважати. Мій аналіз свіжих даних показує: приблизно 10% усіх існуючих веб-сторінок несуть явні сліди синтетичної генерації або суттєвого редагування алгоритмами. Однак найбільш тривожний показник — серед матеріалів, опублікованих після дебюту ChatGPT, частка такого контенту перевищує одну третину.
Методологія та ключові цифри
Під час дослідження було проаналізовано випадкову вибірку з 10 000 англомовних сторінок, зібраних у липні 2026 року через архів Common Crawl. Для ідентифікації використовувалася модель машинного навчання, налаштована на пошук специфічних лінгвістичних патернів, характерних для сучасних LLM.
Той факт, що в загальному масиві лише кожна десята сторінка має ознаки ШІ, може ввести в оману. Це пояснюється тим, що у вибірку потрапила величезна кількість «легасі»-контенту, створеного до епохи генеративного ШІ. Якщо ж відфільтрувати історичний пласт і зосередитися виключно на публікаціях, що вийшли після листопада 2022 року, картина радикально змінюється: понад 33% нових сторінок так чи інакше створені або відредаговані нейромережами.
Де ШІ почувається вільно
Розподіл синтетики по доменних зонах вкрай нерівномірний, і це багато про що говорить. У зоні .com ознаки ШІ виявлено приблизно на кожній десятій сторінці. Для порівняння, у .org цей показник становить 4,6%, а в академічних (.edu) та урядових (.gov) доменах — близько 1%.
Така диспропорція логічна. Комерційний сектор історично зав'язаний на великі обсяги контенту — описи товарів, SEO-тексти, новинні стрічки. Саме ці формати найпростіше автоматизувати, що ми й спостерігаємо на практиці. На початку буму ChatGPT розрив між зонами був менш вираженим, що вказує на прискорену комерціалізацію синтетики.
Важливі застереження
Варто підкреслити, що дослідження не є «детектором брехні» для кожної конкретної сторінки. Методологія оцінює ймовірність, а не точний факт використання ШІ. Йдеться про тексти, де частка машинного втручання значна; дрібна правка чи коректура нейромережею, найімовірніше, залишилася поза увагою.
Мій коментар: Ці цифри — лише верхівка айсберга. За моїми оцінками, на поточний момент частка синтетики в новому контенті вже перетнула позначку в 50%, особливо в новинних агрегаторах і нішевих блогах. Ми рухаємося до точки неповернення, де пошукові алгоритми та рекомендаційні системи будуть змушені повністю переглянути критерії ранжування, інакше вони просто потонуть у потоці згенерованого шуму. Питання не в тому, чи буде інтернет синтетичним, а в тому, як ми навчимося відділяти зерна від полови.