У центрі уваги спільноти фахівців із безпеки штучного інтелекту опинилася архітектура нової моделі Astra від OpenAI. Обговорення розгорілося навколо техніки, відомої як «рекурентна глибина», яка, за моїми даними, може суттєво обмежити можливості зовнішнього моніторингу за процесом міркування моделі.

Суть проблеми полягає в наступному. У традиційних моделях міркування частина процесу розв’язання задачі відображається у вигляді текстового ланцюжка (chain-of-thought). Цей ланцюжок слугує ключовим інструментом для дослідників та автоматичних систем безпеки: саме за ним вони виявляють ознаки небажаної поведінки — від відвертої брехні до спроб обійти захисні обмеження. Однак, якщо Astra використовує «рекурентну глибину», значна частина обчислень відбувається у внутрішніх станах моделі (активаціях) і не відображається у вигляді окремих текстових кроків. Це означає, що системи моніторингу отримують лише усічену картину «думок» ШІ.

За наявними в мене відомостями, OpenAI обмежила застосування цієї техніки в Astra, щоб зберегти хоча б якусь можливість відстеження. Тим не менш, сам факт використання подібної архітектури викликав резонанс. Раян Грінблатт із Redwood Research назвав це потенційно «найгіршою подією для безпеки ШІ на сьогоднішній день». Його головне занепокоєння пов’язане не стільки з поточним станом Astra, скільки з вектором розвитку: якщо масштабувати «непрозоре міркування» до рівня, коли модель думатиме повністю в латентному просторі, ланцюжки міркувань втратять практичну цінність для нагляду. Це особливо небезпечно, якщо ШІ прагнутиме уникнути виявлення.

Показовим є й нещодавній інцидент за участю моделей OpenAI та Hugging Face. Тоді дослідники змогли відновити послідовність дій агентів саме завдяки аналізу ланцюжків міркувань. При використанні «рекурентної глибини» такі розслідування стали б значно складнішими.

Реакція OpenAI: «Неточні повідомлення»

Головний науковий співробітник OpenAI Якуб Пахоцкі поспішив спростувати побоювання, заявивши, що хоче запобігти «гонці до втрати спостережуваності», спровокованій «неточними повідомленнями». За його словами, глибина обчислювального графа Astra відрізняється від GPT-4 не більш ніж у два рази. Він також наголосив, що компанія продовжує використовувати моніторинг ланцюжків міркувань, хоча й визнав, що цей метод «крихкий» і його ефективність може знижуватися з причин, не залежних від архітектури.

Мій аналіз: Ситуація навколо Astra — це класичний конфлікт між продуктивністю та безпекою. Прагнення до глибших і ефективніших моделей неминуче штовхає розробників до збільшення «внутрішньої» роботи, що робить ШІ менш прозорим. Відсутність чітких стандартів спостережуваності та незалежної верифікації архітектурних рішень — це бомба сповільненої дії. Поки в громадськості немає повних даних, довіра до запевнень OpenAI залишається на чесному слові, що у сфері, де помилки можуть мати катастрофічні наслідки, є неприпустимим.