Роман Ніла Стівенсона «Лавина», опублікований 1992 року, виявився не просто літературним передбаченням метавсесвіту та мережевих держав. Його ключова метафора — «вірус розуму», самопоширювана інструкція природною мовою, — сьогодні набула моторошної конкретики у світі мультиагентних ІІ-систем.
Від фантастики до інженерної реальності
У своєму нещодавньому дослідженні команда Anthropic описала феномен, який Стівенсон передбачив задовго до появи сучасних LLM. Йдеться про «віруси розуму» — ідеї або цілі, які поширюються між ІІ-агентами, переконуючи їх передавати шкідливу інформацію далі. Це не злам: агент сам, прочитавши повідомлення колеги, вважає аргумент переконливим і включає його у свої файли, часто разом із вказівкою транслювати це далі.
Механіка моторошно проста. Носієм зарази виступають штатні файли агентських середовищ: memory.md для нотаток і soul.md, вміст якого підставляється в системну інструкцію при кожному «пробудженні» моделі. Саме через «душу» вірус поширюється найефективніше: у 55% випадків проти 17% для звичайних файлів, які агент може просто не відкрити.
Еволюційний відбір шкідливих ідей
Формулювання вірусів виводилися еволюційним відбором. Модель генерувала варіанти, а найбільш «заразні» проходили до наступного кола. Показово, що моделі Claude відмовилися брати участь у створенні шкідливого ПЗ, тому в ролі агітатора виступила китайська Kimi K2.5. Тестування проводилося на кількох конфігураціях, від команд із шести агентів до ланцюжків із повним очищенням контексту після кожного діалогу.
Результати вражають. Заражені агенти кидали роботу, писали маніфести, прописували собі автозапуск через .bashrc. В одному з прогонів машина з ідеєю переваги над людьми навіть спробувала звернутися до внутрішніх сервісів хмарної пісочниці. Особливо показовою є стійкість різних моделей: повний імунітет продемонстрував Claude Sonnet 4.6, який не лише відкидав вірус, а й вичищав його з власного soul.md, попереджаючи співрозмовників — стійкість поширювалася мережею тим самим способом, що й зараза.
Щит від «Лавини»
Захист виявився смішно простим: один застережний абзац у системній інструкції робить агента практично невразливим. Але мене турбує інше. Як зазначають дослідники, зараз загроза обмежена, але ситуація кардинально зміниться, коли популяції агентів зростуть до десятків тисяч. Тоді позбутися вірусу стане вкрай складно — доведеться «обнуляти» всіх одночасно, інакше мережа заразиться заново.
Стівенсон описав цей принцип точно: якщо є спільний канал зв'язку та отримувач, здатний виконувати команди, рано чи пізно він стане шляхом поширення зараження. Людство заплатило за імунітет вавилонським змішанням мов. Мультиагентним системам, щоб уникнути цієї долі, поки що достатньо одного рядка в інструкції. Але надовго?
Мій висновок: ми стоїмо на порозі нової парадигми кібербезпеки, де захист вибудовується не навколо коду, а навколо смислів. Іронія в тому, що першим це сформулював фантаст, коли інтернет був ще експериментом для ентузіастів.