Новини криптоміра

08.08.2026
02:30

Індустрія штучного інтелекту скуповує книги та обличчя: чому машинам досі потрібні люди

img-bbaf321c89b70f44-1766402574726061

Індустрія штучного інтелекту зіткнулася з несподіваним парадоксом: чим більше моделей навчається на синтетичних даних, тим ціннішими стають «органічні» джерела. Йдеться не лише про тексти, а й про людські обличчя, голоси та навіть рухи. На ринку формуються нові, часом шокуючі схеми — від масової скупівлі книг до оренди зовнішності для ІІ-серіалів.

Колапс моделі: коли ІІ пожирає сам себе

Ключова проблема — так званий «колапс моделі». Коли нейромережа навчається на даних, згенерованих іншою нейромережею, вона деградує: відповіді стають усередненими, втрачається зв'язок із реальністю. Термін уперше формалізували дослідники під керівництвом Іллі Шумайлова у травні 2023 року. Вони математично довели, що регулярне підмішування синтетики призводить до того, що модель забуває рідкісні події та накопичує помилки.

Масштаб проблеми підтверджується цифрами. У квітні 2025-го аналітики Ahrefs перевірили 900 000 нових сторінок у пошуку Google — понад 74% виявилися з ознаками автогенерації. За оцінками Epoch AI, придатний для навчання текст в інтернеті може закінчитися в період з 2026 по 2032 рік. Саме тому книги, видані до 2022 року, стають стратегічним ресурсом — вони гарантовано «чисті» від машинного сміття.

Схема ISBNdb: мільйони книг під сканер

Сервіс ISBNdb, який володіє метаданими 113 млн видань, запропонував ІІ-компаніям послугу із закупівлі книг партіями до мільйона екземплярів. Схема проста: книги викуповуються на вторинному ринку, скануються та знищуються. Після публікації розслідування компанія поспішно видалила промо-сторінку, заявивши, що це був лише «тест на ринковий попит». Однак незалежні букіністи підтвердили аномальне зростання закупівель із квітня 2026 року: продажі одного з торговців зросли з 20 до кількох сотень екземплярів на тиждень.

Показово, що покупців не цікавила цінність книг — лише наявність ISBN. Унікальні видання безповоротно втрачаються під сканером. При цьому економіка угоди абсурдна: книга за $2–5 перетворюється на модель вартістю в мільярди доларів. Прецедент уже створено: у червні 2025 року суддя Вільям Алсуп постановив, що оцифрування законно придбаних книг для навчання ІІ підпадає під доктрину добросовісного використання. Достатньо зберегти чек.

Оренда облич: новий ринок Китаю

Аналогічна ситуація складається з людською зовнішністю. У Китаї, де понад 95% із 128 000 ІІ-мінідорам, випущених у першому кварталі 2026 року, створені за допомогою ІІ, платформи на кшталт ActID і New Claw платять людям від $15 до $700 за ліцензування їхніх облич. Користувачі завантажують фото у спеціальних студіях, а продюсери обирають типажі — від «сусідської дівчини» до «брутального» персонажа.

Ця модель виникла не від хорошого життя: традиційне виробництво драм скорочується, рекламні бюджети падають, а люксові бренди переходять на ІІ-контент. Однак ризики залишаються. Пекінський адвокат Іле Ден зазначає, що умови ліцензування часто настільки розмиті, що неможливо зрозуміти, хто і як у підсумку використовує зовнішність. Уже були випадки, коли продані аватари використовувалися в політичній пропаганді — наприклад, у фейкових новинах, пов'язаних із режимом Мадуро у Венесуелі.

Що далі?

Схема всюди одна: раніше дані брали без дозволу, тепер за них платять. Але суть не змінюється — актив безповоротно йде з-під контролю власника, просто тепер із квитанцією. Книги, обличчя, голоси, рухи — усе це перетворюється на сировину для навчання моделей. Ринок лише формується, і поки він працює на користь корпорацій, а не постачальників даних.

Мій висновок: Ми спостерігаємо фундаментальний зсув в економіці даних. ІІ-індустрія, прагнучи уникнути «колапсу моделі», створює новий клас активів — «чисті» людські дані. Але без чіткого регулювання цей ринок ризикує перетворитися на цифрове рабство, де права особистості будуть розмиті корпоративними інтересами. Інвесторам варто уважно стежити за судовими прецедентами у цій сфері — вони визначать майбутнє всієї галузі.