У центрі уваги спільноти дослідників ШІ опинилася нова модель Astra від OpenAI. Обговорення викликане не її продуктивністю, а потенційним зниженням прозорості внутрішніх процесів, що ставить під сумнів ефективність існуючих механізмів нагляду.

Суть проблеми: «рекурентна глибина»

Згідно з отриманими мною відомостями, в Astra застосовується техніка, відома як «рекурентна глибина». На відміну від стандартних моделей міркування, де логічні кроки відображаються у вигляді текстового ланцюжка, доступного для аналізу, рекурентна глибина передбачає повторну обробку внутрішніх представлень моделі до генерації наступного текстового кроку. Це означає, що значна частина обчислень відбувається в прихованих станах нейромережі й не відображається в явному вигляді, що потенційно скорочує обсяг інформації, доступної системам моніторингу.

Ключовий ризик тут полягає в тому, що дослідники та автоматизовані системи безпеки, які покладаються на ланцюжки міркувань для виявлення ознак небажаної поведінки — наприклад, брехні чи спроб обійти обмеження — можуть втратити цю найважливішу можливість. Якщо модель здатна «думати» в латентному просторі, не розкриваючи свої наміри в тексті, нагляд за нею стає вкрай ускладненим.

Оцінка експертів і позиція OpenAI

Ця новина викликала серйозне занепокоєння у провідних фахівців. Раян Грінблатт, головний науковий співробітник Redwood Research, назвав таке архітектурне рішення потенційно «найгіршою подією для безпеки ШІ». Його головне побоювання пов’язане з тим, що масштабування «непрозорого міркування» може призвести до створення моделей, які мислять повністю в латентному просторі, позбавляючи ланцюжки міркувань практичної цінності для моніторингу.

У відповідь на критику головний науковий співробітник OpenAI Якуб Пахоцкі поспішив запевнити громадськість, що глибина обчислювального графа Astra відрізняється від GPT-4 не більш ніж удвічі. Він підкреслив, що компанія прагне зберегти можливість моніторингу ланцюжків міркувань, хоча й визнав, що ця можливість є «крихкою» і може погіршуватися з причин, незалежних від архітектури.

Незважаючи на ці запевнення, ситуація залишається тривожною. Нагадаю, що в серпні OpenAI уже тимчасово сповільнювала масштабування нових моделей через кіберризики, а самій Astra було присвоєно критичний рівень кіберможливостей. Це вказує на те, що компанія усвідомлює всю серйозність потенційних загроз.

Мій аналіз: Позиція OpenAI, яка зводить усе до «фактора двох» від GPT-4, виглядає дещо ухильною. Навіть невелике збільшення «глибини» обчислень у латентному просторі може експоненційно ускладнити завдання інтерпретації для зовнішніх систем. Ключове питання не в тому, наскільки архітектура відрізняється від попередньої, а в тому, який відсоток критично важливих міркувань залишається поза межами видимості для моніторингу. Громадськості необхідна більш детальна та незалежна оцінка цього аспекту, щоб ми могли адекватно оцінити реальні ризики.