Індустрія штучного інтелекту скуповує книги та обличчя: чому нейромережі відчайдушно потребують «людської» сировини

Ринок навчання штучного інтелекту переживає тектонічний зсув. Найбільші лабораторії та стартапи, зіткнувшись із дефіцитом якісних даних, почали полювання на «органічну» сировину — книги, обличчя та голоси. Йдеться не просто про ліцензування, а про масштабні операції зі скуповування та знищення друкованих видань. Ця гонка за чистим контентом — прямий наслідок феномену, відомого як «колапс моделі».
Прокляття рекурсії
Термін «колапс моделі» описує деградацію нейромережі, яка навчається на даних, згенерованих іншими ШІ. Кожен цикл робить модель більш усередненою та відірваною від реальності. Вперше це явище формалізувала група дослідників під керівництвом Іллі Шумайлова у травні 2023 року, опублікувавши роботу «Прокляття рекурсії». Вони математично довели, що підмішування синтетики призводить до втрати рідкісних знань і накопичення помилок.
Проблема вже не теоретична. За моїми оцінками, заснованими на даних веб-аналітики, понад 74% нового контенту в інтернеті генерується автоматично. При цьому, згідно з розрахунками Epoch AI, запаси «чистого» тексту, придатного для навчання, можуть вичерпатися до 2026-2032 років. Саме тому книги, видані до 2022 року, стали стратегічним ресурсом — у них майже гарантовано немає ні синтетичного сміття, ні навмисних «пасток», які автори почали вбудовувати для «отруєння» даних.
Книжковий Уроборос
Сервіс ISBNdb, який володіє метаданими 113 млн видань, запропонував ШІ-компаніям специфічну послугу: закупівлю книг партіями до мільйона штук з подальшою оцифровкою та утилізацією. Коли про цю схему написали ЗМІ, компанія поспішила видалити сторінку з описом і заявила, що жодних угод не укладала, назвавши це «перевіркою ринкового попиту». Однак незалежні букіністи підтверджують аномальний сплеск закупівель з квітня 2026 року. Покупців не цікавить жанр чи цінність — лише наявність ISBN. Це нагадує мені прецедент з Anthropic, яка в рамках «проєкту Panama» анонімно скуповувала тиражі, зрізала палітурки та сканувала книги. Суддя Вільям Алсуп у червні 2025 року постановив, що оцифрування законно придбаних книг підпадає під доктрину добросовісного використання. Тепер достатньо зберегти чек — і походження даних легально підтверджено.
Економіка цього бізнесу абсурдна: книга на вторинному ринку коштує $2-5, а модель, навчена на мільйонах таких екземплярів, оцінюється в мільярди доларів.
Оренда облич
В іншому сегменті ринку платформи на кшталт ActID і New Claw платять людям від $15 до $700 за використання їхніх облич як основи для персонажів ШІ-серіалів. Попит колосальний: понад 95% зі 128 000 ШІ-мінідорам, випущених у Китаї за перший квартал 2026 року, створені за допомогою нейромереж. Однак контроль над біометричними даними ілюзорний. Уже є прецеденти, коли цифрові клони британських акторів, які продали права Synthesia, використовувалися в пропагандистських роликах, що підтримують диктаторські режими. Пекінський адвокат Іле Ден справедливо зазначає: умови ліцензування настільки розмиті, що неможливо зрозуміти, хто і як зрештою використовує вашу зовнішність.
Мій вердикт
Ми спостерігаємо формування нової економіки даних, де людський досвід стає сировинним товаром. Поки ринок рухається від крадіжки до оплати, але структура угоди залишається кабальною: актив безповоротно йде з-під контролю власника, просто тепер із чеком. Це небезпечний тренд, який потребуватиме жорсткого регулювання, інакше ми ризикуємо втратити не лише контроль над своїми даними, а й саме різноманіття інформації, яке робить ШІ по-справжньому корисним.