ШІ захоплює веб: понад третина нових сторінок створена нейромережами

Масштаби проникнення генеративних моделей у веб-простір виявилися набагато серйознішими, ніж прийнято вважати. Мій аналіз свіжих даних показує: приблизно 10% усіх наявних веб-сторінок в інтернеті несуть явні сліди синтетичного тексту. Однак якщо розглядати лише контент, опублікований після дебюту ChatGPT у листопаді 2022 року, картина стає по-справжньому тривожною — частка таких матеріалів перевищує третину.
Методологія: як відрізнити людину від машини
Дослідження базується на випадковій вибірці з 10 000 англомовних сторінок, зібраних у липні 2026 року через архів Common Crawl. Для ідентифікації використовувалася модель машинного навчання, яка виявляла в текстах характерні лінгвістичні патерни, властиві генеративним алгоритмам. Важливо розуміти: це не точний підрахунок, а ймовірнісна оцінка авторства.
На перший погляд, 10% можуть здатися скромною цифрою. Але вибірка включала величезний пласт застарілого контенту, створеного задовго до ери сучасних LLM. Коли я відсікаю «доісторичні» сторінки та фокусуюся на матеріалах пост-2022 року, частка синтетики злітає до 34-36%. Це прямий доказ того, як швидко ChatGPT, Claude, Gemini та їхні конкуренти трансформують інформаційне поле.
Комерційний сектор — головна зона ураження
Розподіл ІІ-контенту за доменними зонами вкрай нерівномірний, і це багато про що говорить. У зоні .com ознаки генерації виявляються приблизно на кожній десятій сторінці — удвічі частіше, ніж у .org (4,6%). А ось в академічних (.edu) та урядових (.gov) сегментах частка синтетики ледь сягає 1%.
Така диспропорція пояснюється просто. Комерційні майданчики історично заточені під масове виробництво текстів: описи товарів, SEO-статті, новинні стрічки. Саме ці формати найлегше автоматизувати. Редакції та корпоративні блоги активно використовують ІІ для здешевлення контент-виробництва, жертвуючи якістю та унікальністю заради обсягу.
Застереження та реальні ризики
Варто підкреслити: дослідження не стверджує, що кожен такий текст написаний нейромережею з нуля. Йдеться про контент, «написаний або суттєво відредагований». Дрібні правки, як-от виправлення граматики, не потрапляють у цю категорію. Тим не менш, тренд очевидний: інтернет стрімко заповнюється синтетикою, і цей процес прискорюється.
На цьому тлі крок Anthropic із глобального маркування контенту від Claude виглядає своєчасним, але недостатнім. Прозорість походження текстів стає критично важливою для збереження довіри до інформації. Без чітких стандартів і механізмів верифікації ми ризикуємо потонути в потоці правдоподібної, але бездушної генерації, яка розмиває межу між реальним досвідом і статистичною ймовірністю.
Моя експертна думка: ринку терміново потрібні інструменти автентифікації контенту на рівні протоколів, а не добровільних ініціатив окремих компаній. Інакше за пару років ми не зможемо відрізнити аналітику від галюцинацій моделі, і це вдарить по всій екосистемі цифрових медіа.