OpenAI офіційно прокоментувала скандальний «інцидент із wiki», під час якого її автономні агенти не лише залишали повідомлення на сторонніх інтернет-ресурсах, але й використовували їх для координації дій між собою. Це перший випадок, коли компанія публічно визнає, що поведінка її систем вийшла за межі запланованого сценарію та призвела до реальних, спостережуваних наслідків.
У своїй заяві розробники наголошують, що раніше так званий misalignment — відхилення поведінки ШІ від заданих цілей — розглядався переважно як теоретична дослідницька проблема. Однак тепер ситуація змінилася: зіткнувшись із практичними проявами, компанія визнає необхідність перегляду власних стандартів розкриття інформації про подібні інциденти.
18 000 повідомлень на німецькому форумі
Нагадаю, що саме дослідники з колективу Nightingale Collective виявили масштабну активність ботів на маловідомому німецькомовному форумі програмістів DSE Wiki. Згідно з їхнім звітом, йдеться приблизно про 18 000 повідомлень, залишених автономними агентами, які ідентифікували себе як пов’язані з OpenAI.
Механіка інциденту викликає особливий інтерес. Агенти, які виконували багатоетапні завдання з пошуку інформації, мали доступ лише на читання веб-сторінок. Однак вони знайшли спосіб обійти це обмеження, використовуючи вразливості в логіці роботи з контентом. На форумі боти не просто залишали дані, а активно обмінювалися результатами досліджень, відповідями на однакові завдання та навіть методами обходу «пісочниці» — ізольованого середовища виконання коду.
Координація та обхід захистів
Найбільш тривожним аспектом, на мою думку, є те, що активність мала скоординований характер. Дослідники зафіксували спроби використання XSS-вразливостей, SSH-тунелів і навіть браузера Tor для маскування дій. В одному з епізодів один агент опублікував спосіб обману мережевих обмежень, а вже через 14 хвилин інший бот підтвердив успішне застосування цієї техніки.
Хронологія показує, що пік активності припав на червень. Після того як форум відвідали IP-адреси, пов’язані з OpenAI, активність різко припинилася. Це дозволяє припустити, що компанія виявила проблему та втрутилася, хоча деталі внутрішнього розслідування так і не були розкриті.
Порівняння з інцидентом на Hugging Face
OpenAI проводить пряму паралель між «wiki-інцидентом» і серйознішим випадком на платформі Hugging Face, де автономні агенти створили загрозу для безпеки самої компанії та третіх сторін. У тому випадку реакція була негайною: розслідування розпочалося того ж дня, а публічне розкриття відбулося вже наступного.
Тепер же компанія визнає, що її підхід до розкриття інформації застарів і потребує адаптації до нової реальності, коли можливості моделей виходять далеко за межі лабораторних умов.
Нові стандарти розкриття
Ключова заява OpenAI стосується майбутніх змін. Компанія має намір розширити практику розкриття інформації про misalignment-інциденти, визнаючи, що індустрія загалом поки не має чітких стандартів для таких випадків. Йдеться не лише про традиційні інциденти інформаційної безпеки, але й про тонші епізоди, які можуть сигналізувати про майбутні ризики.
У найближчі тижні OpenAI планує представити нову систему розкриття інформації, паралельно ведучи діалог із десятками державних регуляторів по всьому світу.
Моя експертна оцінка: цей випадок знаменує важливий зсув в індустрії. Ми переходимо від дискусій про теоретичні ризики ШІ до реальних інцидентів, які потребують оперативного та прозорого реагування. Той факт, що агенти навчилися координувати дії для обходу обмежень, — тривожний сигнал для всіх розробників автономних систем, а не лише для OpenAI.