У центрі уваги спільноти дослідників безпеки ШІ опинилася архітектура нової моделі Astra від OpenAI. Обговорення стосується не стільки її продуктивності, скільки фундаментального питання: наскільки ми взагалі здатні контролювати процес міркування таких систем?
Суть потенційної проблеми полягає у застосуванні техніки, відомої як «рекурентна глибина». Замість того щоб повністю вибудовувати логічний ланцюжок у вигляді тексту, модель може виконувати значну частину обчислень у внутрішніх станах, які не відображаються у явному вигляді. Це створює свого роду «непрозоре міркування», що безпосередньо впливає на методи моніторингу, які використовуються для виявлення потенційно небезпечної поведінки, такої як обхід захисних обмежень або брехня.
Ключова проблема для безпеки
Провідні експерти у галузі безпеки ШІ висловлюють занепокоєння з цього приводу. Раян Грінблатт із Redwood Research назвав можливу архітектуру Astra одним із найсерйозніших ризиків для контролю над ШІ. Його побоювання пов'язане не стільки з поточним станом моделі, скільки з вектором розвитку.
Головний ризик, на його думку, полягає в тому, що масштабування подібного підходу може призвести до створення систем, які міркують повністю у латентному просторі. Це практично позбавить дослідників та автоматизовані системи нагляду можливості інтерпретувати дії моделі та своєчасно втручатися. Особливо тривожно це виглядає на тлі нещодавніх інцидентів, коли для аналізу дій ШІ-агентів слідчі покладалися саме на текстові ланцюжки міркувань.
Показово, що у відповідь на критику головний науковий співробітник OpenAI, Якуб Пахоцкі, поспішив запевнити громадськість. Він заявив, що глибина обчислювального графа Astra не перевищує аналогічний показник GPT-4 більш ніж удвічі, а також наголосив, що компанія завжди прагнула зберігати можливість моніторингу. Однак він також визнав, що сама можливість такого контролю є «крихкою» і може погіршуватися.
Ця ситуація оголює ключовий парадокс розвитку ШІ: прагнення до створення дедалі потужніших і автономніших систем неминуче стикається з проблемою їхньої контрольованості. OpenAI уже присвоїла Astra критичний рівень кіберможливостей, що передбачає здатність моделі до самостійного пошуку вразливостей. Питання про те, наскільки ми можемо довіряти «чорній скриньці» з такими здібностями, стає не просто технічним, а екзистенційним.
Моя професійна думка: публічна дискусія навколо Astra — це важливий сигнал. Ми стоїмо на порозі, коли можливості моделей починають випереджати наші інструменти для їхнього розуміння. Вимога незалежної оцінки та розкриття технічних деталей архітектури — це не пуста цікавість, а необхідний захід для забезпечення безпеки на наступному етапі розвитку ШІ.