На конференції ICML 2026 у Сеулі було представлено принципово нову методологію атак на системи штучного інтелекту. Її суть — не в компрометації даних або отриманні несанкціонованого доступу, а в навмисному уповільненні роботи моделі до стану повної непридатності. Дослідники з Чжецзянського університету та Alibaba продемонстрували, як можна перетворити сильну сторону міркувальних ШІ на їхню ахіллесову п'яту.

Механіка атаки: як змусити ШІ «замислитися» до нескінченності

На відміну від стандартних великих мовних моделей (LLM), міркувальні моделі (reasoning models) розбивають складні завдання на послідовні логічні кроки. Ця особливість робить їх незамінними для багатоетапного аналізу, але водночас створює вразливість. Під час роботи з неповними або суперечливими даними такі моделі схильні до надмірного «обмірковування», генеруючи надто довгі ланцюжки міркувань.

Розроблений метод використовує генетичний алгоритм для цілеспрямованого провокування такої поведінки. Алгоритм перемішує умови завдань, видаляє ключові передумови та додає зайві, відбираючи ті варіанти, які викликають максимально довгу відповідь. Результати вражають: на тестовому наборі MATH довжина ланцюжків міркувань збільшилася в 26,1 раза. Найбільш уразливими виявилися DeepSeek-R1, Qwen3-Thinking, GPT-o3 та Gemini 2.5 Flash.

Критично важливо, що запити, створені для однієї невеликої моделі, виявилися ефективними й проти інших систем, включаючи великі комерційні проєкти. Це відкриває можливість для атак на закриті сервіси без значних витрат.

Ризики для DeFi та агентних систем

Особливе занепокоєння викликає поширення міркувальних моделей в агентних ШІ-системах, включаючи торговельних ботів, інструменти аудиту смарт-контрактів та децентралізовану інфраструктуру. У DeFi цифрові асистенти на базі ШІ керують реальними коштами без участі людини. Збій у логіці, спричинений навмисно, створює прямий операційний ризик.

Ця робота підтверджує відому проблему «надмірного обмірковування», виявлену ще в лютому 2025 року. Аналіз 4018 агентних траєкторій показав три ключові патерни: «параліч аналізу» (модель продовжує міркувати замість виконання завдання), «непередбачувані дії» (спроба виконати кілька дій одночасно після помилки) та «передчасне завершення» (припинення завдання без перевірки результату).

Моя експертна оцінка: Цей клас атак є не просто академічним курйозом, а реальною загрозою для інфраструктури, де час відгуку критичний. Враховуючи, що подальший розвиток провідних ШІ-компаній дедалі більше залежить від доступності обчислювальних потужностей, такі DoS-атаки можуть стати дешевим та ефективним інструментом для порушення роботи цілих екосистем. Інвесторам та розробникам DeFi-проєктів варто негайно переглянути свої протоколи безпеки в контексті цієї нової поверхні атаки.