Аналіз останніх даних про модель Astra від OpenAI, яка готується до випуску, виявив потенційно тривожний тренд у сфері безпеки штучного інтелекту. У центрі дискусії опинилася техніка, відома як «рекурентна глибина», яка, за моїми даними, може суттєво обмежити можливості зовнішнього моніторингу за процесом міркування нейромережі.

Суть проблеми полягає в тому, що Astra, на відміну від багатьох попередників, демонструє дослідникам лише малу частину своїх проміжних умовиводів. Це досягається за рахунок того, що значна частина обчислень відбувається не в текстовому ланцюжку, а у внутрішніх станах моделі. Для спільноти це критично важливо, оскільки саме текстові ланцюжки міркувань слугують основним інструментом для виявлення ознак небажаної поведінки — від відвертої брехні до спроб обійти захисні протоколи.

Ризики для безпеки та нагляду

Провідний науковий співробітник Redwood Research, Раян Грінблатт, у своєму аналізі назвав подібне архітектурне рішення серйозним ризиком. Його головне занепокоєння пов'язане не стільки з поточним станом Astra, скільки з потенційною траєкторією розвитку. Якщо OpenAI масштабуватиме «непрозоре міркування», ми можемо прийти до моделей, які мислять повністю в латентному просторі, що зробить ланцюжки міркувань марними для нагляду. Особливо це небезпечно, якщо ШІ навмисно намагається уникнути виявлення.

Показовим є нещодавній інцидент за участю агентів OpenAI та Hugging Face. Розслідування тих подій значною мірою спиралося на відновлення послідовності дій через ланцюжки міркувань. За нової архітектури відновити причинно-наслідкові зв'язки було б практично неможливо.

Офіційна позиція OpenAI

У відповідь на хвилю критики головний науковий співробітник OpenAI Якуб Пахоцкі поспішив запевнити громадськість, що глибина обчислювального графа Astra перебуває в межах двократного значення від GPT-4. Він підкреслив, що компанія продовжує роботу над збереженням моніторингу ланцюжків міркувань, хоча й визнав, що цей механізм залишається «крихким». Примітно, що раніше OpenAI вже тимчасово призупиняла навчання нових систем через зростання кіберризиків, а Astra отримала критичний рівень кіберможливостей, продемонструвавши здатність знаходити невідомі вразливості без контролю людини.

Мій погляд: публічне розкриття інформації з боку OpenAI є недостатнім. Ситуація потребує незалежної технічної експертизи, щоб оцінити реальний ступінь зниження спостережуваності. Без цього ми ризикуємо рухатися до створення систем, чия поведінка стане непередбачуваною та неконтрольованою, що суперечить базовим принципам безпечного розвитку ШІ.