Світ штучного інтелекту стикається з принципово новим класом загроз. Дослідники з провідних ізраїльських університетів та компанії Intuit виявили вразливість, яка може перетворити «галюцинації» мовних моделей на потужний механізм для створення ботнетів. Атака, що отримала назву Adversarial HalluSquatting, використовує схильність LLM вигадувати неіснуючі ідентифікатори репозиторіїв, навичок та інших зовнішніх ресурсів.

На відміну від класичних ін'єкцій промпту, цей метод не вимагає прямого контакту з жертвою. Зловмиснику достатньо зареєструвати підставний ресурс на платформі на кшталт GitHub і дочекатися, поки ІІ-агент сам його запитає. Це відкриває шлях до масових, нетаргетованих атак, де один скомпрометований ресурс може вразити тисячі машин.

Як працює HalluSquatting

Сценарій будується на передбачуваній помилці моделі. Коли користувач просить агента клонувати популярний репозиторій, модель має визначити точну адресу. Якщо вона не знає правильного ідентифікатора, то генерує схожий, але неіснуючий. Атакуючий заздалегідь з'ясовує, які саме «фантомні» адреси модель видає найчастіше, і реєструє їх, розміщуючи шкідливі інструкції. Агент, «галюцинуючи» цю адресу, підтягує шкідливий код і починає працювати з ним як із легітимним.

Результати експериментів вражають. Під час понад 14 000 запусків для нових репозиторіїв (із GitHub Trending) середній рівень галюцинацій становив приголомшливі 92,4%. У 53 із 60 комбінацій «репозиторій — модель» система жодного разу не вказала правильного власника. Для старих проєктів, які, ймовірно, були присутні в навчальних даних, цей показник впав до 0,9%.

Практичні тести: від теорії до шкідливого коду

Перехід від базових моделей до реальних застосунків (Cursor, Windsurf, GitHub Copilot, Cline) підтвердив серйозність загрози. End-to-end атака спрацьовувала в 20-65% запусків. Особливо вразливою виявилася платформа OpenClaw: з моделлю Sonnet 4.6 вона показала 100% успіху як за викликом вбудованих інструментів, так і за віддаленим виконанням коду.

Окремий блок дослідження присвячений «скілл-сквоттингу» — атаці через навички на маркетплейсі ClawHub. У 90,7% запусків OpenClaw згенерував ідентифікатор навички, який міг бути зареєстрований атакуючим. Експеримент з ексфільтрацією контексту дав 100% успіху, а сценарій, за якого скомпрометований пристрій сам підключається до сервера атакуючого, спрацював у 88% випадків.

Захист і реакція вендорів

Дослідники рекомендують впровадити обов'язкову перевірку джерела перед будь-яким завантаженням зовнішнього ресурсу. Веб-пошук перед клонуванням знижує рівень галюцинацій до 6,6%, але, як показали тести, жоден тип промпту не є універсально безпечним.

Реакція вендорів виявилася неоднозначною. GitHub заявив, що це не вразливість платформи, а наслідок галюцинацій LLM. Cursor і Anthropic також не визнали проблему, віднісши її до атак через захоплення імен залежностей. У Google пообіцяли передати інформацію продуктовій команді.

Моя експертна думка: Той факт, що великі вендори відмахуються від цієї загрози, — тривожний сигнал. HalluSquatting — це не баг, а фундаментальна властивість архітектури агентних ІІ-систем. Поки ми не впровадимо обов'язкову верифікацію всіх зовнішніх ресурсів на рівні протоколу, подібні атаки будуть лише множитися, перетворюючи «розумних» агентів на ідеальних розповсюджувачів шкідливого ПЗ.