Дослідники з Чжецзянського університету та Alibaba представили на конференції ICML 2026 у Сеулі новий метод дестабілізації ШІ-систем. На відміну від традиційних атак, спрямованих на крадіжку даних або підміну виведення, цей підхід спрямований на паралізацію моделі через примусове «зациклювання» її логічних ланцюжків.

Суть методу: генетичний алгоритм проти міркувальних моделей

Сучасні міркувальні моделі (reasoning models), на відміну від звичайних LLM, розбивають складні запити на послідовні кроки. Це робить їх незамінними в агентних системах — від торговельних ботів до аудиту смарт-контрактів. Однак саме ця архітектура відкриває вразливість: під час роботи з неповними або суперечливими даними моделі схильні до надмірного обдумування, генеруючи надмірно довгі ланцюжки міркувань.

Розроблений метод використовує генетичний алгоритм для спотворення вхідних умов: він перемішує передумови, видаляє ключові дані та додає надлишкові. Потім алгоритм відбирає ті варіанти, які провокують максимально довгу відповідь. На бенчмарку MATH довжина міркувань зросла в 26,1 раза, що суттєво перевищує показники існуючих атак.

Найбільш вразливими виявилися DeepSeek-R1, Qwen3-Thinking, GPT-o3 та Gemini 2.5 Flash. Ключовий висновок: запити, створені для однієї невеликої моделі, ефективно працюють проти інших, включаючи великі комерційні системи. Це відкриває можливість атак на закриті сервіси без значних обчислювальних витрат.

Ризики для DeFi та агентних систем

Міркувальні моделі все активніше впроваджуються в DeFi-інфраструктуру, де цифрові асистенти керують реальними коштами без участі людини. Збій у логіці, спричинений навмисно, створює прямий операційний ризик. Особливо тривожно, що атака не потребує злому — достатньо надіслати спеціально сконструйований запит, який викличе параліч системи.

Дослідники підкреслюють, що їхня робота не демонструє «масштабні атаки з мінімальними витратами», а фіксує існування нової поверхні атаки. Раніше, у лютому 2025 року, аналіз 4018 агентних траєкторій виявив три патерни надмірного обдумування: параліч аналізу (модель продовжує міркувати замість виконання завдання), непередбачувані дії (спроба виконати кілька дій одночасно після помилки) та передчасне завершення (припинення завдання без перевірки результату).

Думка експерта: Цей метод — тривожний сигнал для індустрії. Якщо міркувальні моделі стануть стандартом для DeFi-агентів, подібні атаки можуть призвести до реальних фінансових втрат. Розробникам необхідно впроваджувати механізми детекції аномально довгих ланцюжків міркувань та обмежувати час виконання запитів. Інакше ми ризикуємо отримати «нескінченні» транзакції, заблоковані логікою ШІ.