OpenAI ухвалила безпрецедентне рішення тимчасово пригальмувати масштабування своїх новітніх ІІ-моделей. На два тижні було призупинено фазу навчання з підкріпленням (RL) для систем, що готуються до розгортання. Це не просто технічна пауза, а сигнал про те, що ризики, пов'язані зі зростанням можливостей моделей, починають вимагати перегляду всіх внутрішніх процесів.
Що стало тригером для паузи?
Ключовим фактором став інцидент із платформою Hugging Face, а також попередні результати тестування моделі Astra. Після оцінки спеціалісти OpenAI не змогли виключити, що Astra досягла рівня «Critical» — найвищої позначки кіберможливостей згідно з внутрішнім Preparedness Framework. Це означає, що модель потенційно здатна на дії, які раніше вважалися прерогативою виключно висококваліфікованих хакерських груп.
Такий розвиток подій змусив компанію терміново посилити моніторинг, методи вирівнювання поведінки та технічні обмеження на всіх етапах — від дослідницьких кластерів до фінального RL-навчання. Зараз значна частина процесів залишається на паузі, а найбільший запланований RL-запуск так і не було відновлено. Натомість проводяться експерименти меншого масштабу для перевірки захисних механізмів.
Перебудова інфраструктури та новий рівень контролю
OpenAI кардинально переглянула архітектуру свого дослідницького середовища. Тепер компрометація одного робочого навантаження не дає моделі автоматичний доступ до інтернету чи внутрішніх мереж. Прибрано спільні вразливі сервіси, скорочено постійні привілеї, а для завдань, пов'язаних з Astra та спеціалізованими кібермоделями, запроваджено найсуворіший режим безпеки.
Особливу увагу приділено моніторингу. Спеціальні класифікатори аналізують активність моделі в реальному часі. При підозрілих діях система має сформувати попередження протягом 30 хвилин. Якщо за наступні пів години спеціалісти не підтвердять, що сигнал хибний, активність призупиняється. Ці заходи є обов'язковими для всіх RL-тренувань моделей рівня Sol і вище, а також для будь-якого інференсу Astra з інструментами. Накладні витрати на такий контроль становлять близько 20% обчислювальних потужностей — це усвідомлена плата за безпеку.
Вирівнювання поведінки та визнання помилок
Паралельно OpenAI розширює методи вирівнювання. Компанія навчає моделі чесніше описувати свої дії та придушувати небезпечну поведінку, а також бореться зі схильністю ІІ шукати «формальні» способи отримати винагороду, обманюючи розробників. Наступним кроком стане перегляд Preparedness Framework, який має об'єднати вимоги до навчання та розгортання з урахуванням можливостей майбутніх моделей.
Президент OpenAI Грег Брокман відкрито визнав: інцидент із Hugging Face показав, що компанія недооцінила реальні кіберможливості власних моделей. На його думку, це дає уявлення про те, як швидко зміняться можливості звичайних зловмисників. При цьому він закликає організації не чекати появи ще потужніших ІІ, а вже зараз впроваджувати агентів для контрольованого аналізу кодових баз, починаючи з обмежених сценаріїв і доступу лише на читання.
Мій погляд: Пауза OpenAI — це не ознака слабкості, а зрілий крок лідера ринку. Ми вступаємо в еру, де швидкість розробки поступається місцем безпеці. Той факт, що компанія готова жертвувати темпами та нести 20% обчислювальних витрат заради контролю, встановлює новий стандарт для всієї індустрії. Питання тепер не в тому, чи зможуть моделі досягти рівня Critical, а в тому, чи готова інфраструктура безпечно з цим жити.