Масштабне дослідження, проведене аналітиками Pew Research Center, пролило світло на стрімку експансію генеративних моделей у веб-просторі. Згідно з отриманими даними, приблизно 10% усіх наявних веб-сторінок несуть на собі сліди машинної генерації або значного редагування. Однак найбільш тривожний показник прихований у динаміці: серед контенту, опублікованого після дебюту ChatGPT у листопаді 2022 року, частка синтетичних текстів перевищує 33%. Це означає, що кожен третій новий матеріал в інтернеті створений або суттєво перероблений нейромережею.
Методологія дослідження заслуговує на окрему увагу. В основу аналізу лягла випадкова вибірка з 10 000 англомовних сторінок, зібраних у липні 2026 року через архів Common Crawl. Для ідентифікації «цифрового почерку» ШІ застосовувалася спеціалізована модель машинного навчання, налаштована на пошук характерних лінгвістичних патернів, властивих генеративним алгоритмам. Такий підхід дає змогу виявити статистично значущі маркери, але не є стовідсотковим доказом авторства.
Комерційний сектор — головна зона ураження
Розподіл ШІ-контенту за доменними зонами демонструє чітку кореляцію з економічними стимулами. Лідирує з великим відривом комерційний сектор: у зоні .com ознаки генерації виявляються на кожній десятій сторінці (близько 10%). Для порівняння, у некомерційній зоні .org цей показник удвічі нижчий — 4,6%. Найбільш «чистими» залишаються освітні та державні ресурси: у доменах .edu та .gov частка синтетики ледь сягає 1%.
Така диспропорція пояснюється структурою контенту. Комерційні майданчики активно використовують ШІ для автоматизації рутинних текстових обсягів: описів товарів, SEO-статей, довідкових матеріалів і новинних заміток. На початку ери ChatGPT подібного розриву між зонами не спостерігалося — розбіжність посилилася в міру розвитку технологій.
Методологічні застереження та перспективи
Важливо підкреслити: дослідження не є точним підрахунком, а радше оцінкою ймовірного авторства. Pew не аналізував історію створення сторінок і не опитував авторів. Висновки ґрунтуються виключно на лінгвістичному аналізі, який може давати похибку. Крім того, категорія «суттєво відредагованого» контенту виключає незначні правки тексту, виконані за допомогою ШІ.
На тлі цих даних стає зрозумілим рішення Anthropic про впровадження глобального маркування для контенту, створеного моделями Claude. В умовах, коли синтетика стає невіддільною частиною вебу, питання довіри до інформації та прозорості походження текстів виходить на перший план. Ринок уже зіткнувся з проблемою «інфошуму», де алгоритми генерують контент для алгоритмів, і це ставить перед індустрією фундаментальні питання про якість і достовірність даних.
Мій коментар: Тенденція до тотальної синтетизації контенту несе в собі приховані ризики не лише для читачів, а й для самих пошукових систем і моделей ШІ, що навчаються на цих даних. Виникає ефект «виродження» інформації, коли моделі навчаються на власних виходах. У найближчі роки ми неминуче прийдемо до необхідності впровадження криптографічних стандартів верифікації контенту, інакше цифрова екосистема ризикує перетворитися на замкнену петлю самообману.