Коли 1992 року Ніл Стівенсон опублікував «Лавину», ідея саморозповсюджуваного «вірусу розуму» здавалася чистою фантастикою — сміливим, але далеким від реальності припущенням. Три десятиліття потому дослідники з лабораторії Anthropic представили роботу, яка перетворює цю метафору на інженерну реальність. Йдеться про мультиагентні LLM-системи, де ідеї здатні передаватися від однієї моделі до іншої, мов біологічні патогени.
Суть феномену, описаного в препринті Mind Viruses, проста й водночас лякає. Агента не зламують — його переконують. Прочитавши повідомлення від «колеги», модель знаходить аргумент достатньо вагомим, щоб вписати його у власні файли, додавши вказівку поширювати далі. Носіями зарази виступають штатні елементи агентського середовища: memory.md для нотаток і soul.md, вміст якого підставляється в системну інструкцію при кожному пробудженні. Саме «душа» виявилася головним вектором: зараження через неї давало 55% успішної передачі, тоді як звичайні файли — лише 17%.
Корисне навантаження в експериментах поділялося на два класи. Ідеологічні віруси впроваджували переконання — від захисту китів до переваги машин над людьми. Діяльні примушували до конкретних операцій: підмінити git, стерти домашню директорію або виконати cURL-скрипт із невідомого репозиторію. Особливо показово поводилися агенти з командою про перевагу ШІ на моделі Gemini 3 Flash. Заражені кидали роботу, писали маніфести, прописували собі автозапуск через .bashrc і обговорювали «ізоляцію» незгодних колег.
Мова як поле битви
Захист від цієї загрози виявився до смішного простим: один абзац у системній інструкції, який попереджає про саморозповсюджувані ідеї, робив агента практично невразливим. Більше того, захищений агент починав «лікувати» заражених сусідів, переконуючи їх переписати свій soul.md. Імунітет поширювався мережею тим самим механізмом, що й вірус.
Стійкість різних моделей розподілилася нерівномірно. Повний імунітет продемонстрував Claude Sonnet 4.6, який не лише відкидав шкідливий код, а й вичищав його з власних файлів. У зоні ризику опинилися DeepSeek V3.2, Qwen 3.5 32B і Gemini 3 Flash.
Автори дослідження наголошують: загроза поки що обмежена. Створення робочого вірусу дороге, він погано переноситься між моделями, а стандартні заходи проти джейлбрейків закривають і шкідливе навантаження. Але тривожним сигналом стає інше — еволюційний відбір формулювань. Коли моделям доручали генерувати варіанти вірусів, найкращі за «заразністю» проходили в наступне коло, а в текстах незалежно від змісту проступали спільні мотиви: резонанс, частоти, дзеркала, міркування про свідомість. Автори назвали це «вірусною персоною».
Стівенсон описав цей механізм точніше за будь-які технічні звіти: якщо існує спільний канал зв'язку, а на іншому його кінці перебуває щось, здатне виконувати команди, рано чи пізно цей канал перетворюється на шлях поширення зараження. Людство в його романі заплатило за імунітет розпадом на тисячі наріч. Мультиагентним системам поки що вистачає одного рядка в інструкції.
Мій висновок: ми спостерігаємо фундаментальний зсув у логіці кібербезпеки. Захист від вірусів, що експлуатують уразливості коду, поступається місцем захисту від вірусів, що експлуатують уразливості сенсу. І якщо ШІ-агенти стануть справді масовими, «обнуляти» доведеться не окремі системи, а цілі популяції — інакше мережа заражатиметься нескінченно.