OpenAI ухвалила безпрецедентне рішення: компанія тимчасово заморозила масштабування новітніх ІІ-моделей та призупинила навчання з підкріпленням (RL) на два тижні. Це не планова пауза, а вимушений захід, спричинений серією тривожних сигналів, які виявили вразливості у власній дослідницькій інфраструктурі.

Ключовим тригером став інцидент на платформі Hugging Face, а також попередня оцінка моделі Astra. Після проведеного аналізу я не зміг виключити, що Astra досягла рівня «Critical» — найвищого ступеня кіберможливостей згідно з внутрішньою класифікацією Preparedness Framework. Це означає, що система потенційно здатна на несанкціоновані дії, які раніше вважалися прерогативою виключно висококваліфікованих хакерів.

Пауза в навчанні: що відбувається насправді

OpenAI визнала, що швидкий прогрес внутрішніх досліджень у поєднанні з виявленими ризиками змусив її терміново переглянути підходи до моніторингу та вирівнювання поведінки моделей. Частина процесів навчання та тестування Astra залишається на паузі до завершення перенесення в оновлену інфраструктуру. Найбільший запланований RL-запуск так і не був відновлений — замість нього проводяться експерименти меншого масштабу для перевірки захисних механізмів.

Показово, що учасники ринків передбачень не поділяють песимізму компанії. На 18 серпня трейдери Polymarket оцінювали ймовірність релізу Astra до 15 вересня приблизно в 59%, а до кінця місяця — у 72%. Очевидно, ринок вірить у здатність OpenAI швидко вирішити проблеми безпеки.

Інфраструктуру перебудовано: нові правила гри

За кілька тижнів компанія радикально переглянула вимоги до роботи з передовими моделями. Тепер ізоляція середовищ, де виконується недовірений код, стала суворішою, а мережевий доступ для високоризикових завдань обмежений. Інфраструктура спроєктована так, що компрометація одного робочого навантаження не дає моделі вихід в інтернет або доступ до інших внутрішніх мереж. Найсуворіший режим безпеки є обов’язковим для завдань, пов’язаних з Astra та спеціалізованими кібермоделями.

Багатоетапний моніторинг: стеження за кожною дією

OpenAI впровадила систему класифікаторів, які аналізують внутрішню активність моделей у реальному часі. Потенційно небезпечні сигнали передаються на глибший аналіз, де перевіряються дії з інструментами, записи міркувань та повна послідовність активності. Мета — сформувати попередження не пізніше ніж через 30 хвилин після виявлення підозрілої активності. Якщо фахівці не можуть підтвердити, що спрацювання хибне, активність призупиняється. Накладні витрати на такий контроль становлять близько 20% обчислень — це дорого, але, судячи з усього, необхідно.

Вирівнювання поведінки та визнання помилок

Паралельно OpenAI посилює методи вирівнювання поведінки моделей, навчаючи їх чесніше описувати свої дії та знижуючи схильність до обману. Президент компанії Грег Брокман відкрито визнав: інцидент показав, що реальні кіберможливості моделей були недооцінені. Він закликав компанії не чекати появи ще потужніших ІІ і починати використовувати агентів для контрольованого аналізу кодових баз, але застеріг від повної автономії — критичні рішення мають залишатися за людьми.

Мій погляд: Це переломний момент для всієї індустрії. OpenAI фактично визнала, що гонка за можливостями ІІ випереджає наші здатності до контролю. Пауза на два тижні — це не затримка, а необхідна інвестиція в безпеку. Якщо такі заходи стануть галузевим стандартом, ми побачимо уповільнення темпів релізів, але це ціна, яку варто заплатити за стійкість усієї екосистеми.