Команда дослідників Anthropic зробила несподіване відкриття всередині своїх моделей Claude. Під час аналізу внутрішніх процесів вони натрапили на структуру, яка не була закладена розробниками під час проєктування. Йдеться про механізм під назвою «J-space» — глобальний робочий простір, до якого звертаються різні компоненти моделі.
Дослідження, опубліковане 6 липня, стало помітним кроком уперед у розумінні того, що насправді відбувається «під капотом» великих мовних моделей. J-space працює як віртуальна дошка: коли Claude відповідає на запитання, вирішує задачу або виконує інструкцію, ключова інформація з'являється в цьому просторі, щоб різні частини моделі могли з нею взаємодіяти.
Як працює J-space?
Для виявлення J-space фахівці Anthropic розробили спеціальний інструмент під назвою «J-lens». За його допомогою вони спостерігали, як інформація переміщується всередині моделі під час виконання завдання. Найпримітніше: J-space виник спонтанно в процесі навчання — його не закладали в архітектуру напряму.
Ідея нагадує концепцію «глобального робочого простору» з нейронаук. У людини ця система забезпечує доступ до важливої інформації одразу для кількох розумових процесів. Наприклад, коли людина чує запитання, згадує потрібний факт і вирішує, як відповісти, мозок зводить усі необхідні дані в одному місці.
Claude працює схоже. Дослідники показали, що модель може описувати вміст J-space за запитом, а також змінювати його, якщо її про це попросити. Більше того, коли вчені вручну змінювали J-space, змінювалися і відповіді Claude, і його поведінка під час виконання завдань.
Чому це важливо для безпеки ШІ
Відкриття має величезне значення для безпеки штучного інтелекту. Якщо вчені зможуть відстежувати активність J-space, у них з'явиться шанс виявляти приховані мотиви в поведінці ШІ-моделей. Завдяки цьому можна буде ефективніше помічати, коли система починає працювати ненадійно.
У тому числі — виявлення атак. Моніторинг J-space дозволяє побачити момент, коли модель стикається зі спробами prompt-ін'єкції (впровадження шкідливих інструкцій у запит, щоб перехопити керування відповіддю). Навіть частковий доступ до такого «усвідомленого» шару обробки відкриває важливі перспективи для досліджень.
Поки можливості обмежені: більша частина обробки інформації у Claude, як і раніше, відбувається поза J-space. Тим не менш Anthropic відкрила вихідний код реалізації J-lens і виклала демоверсію на Neuronpedia, запропонувавши дослідницькій спільноті перевірити результати на практиці.
Дослідження спирається на серію більш ранніх робіт. У жовтні 2025 року Anthropic опублікувала доповідь про формування інтроспективної усвідомленості. Раніше, у квітні 2025 року, компанія запустила ініціативи з вивчення благополуччя моделей, крок за кроком просуваючись у розумінні того, що відбувається всередині її систем.
Мій коментар: Це відкриття може стати поворотним моментом для всієї індустрії ШІ. Здатність зазирати в «робочий простір» моделі — це не просто науковий інтерес, а реальний інструмент для підвищення безпеки та контролю. Якщо ми зможемо бачити, як модель приймає рішення, ми зможемо краще захищати її від зломів та маніпуляцій. Для криптоіндустрії, де ШІ вже використовується для аналізу ринків та управління активами, це особливо актуально.