Дослідницька група Anthropic зробила несподіване відкриття, аналізуючи внутрішню архітектуру своєї мовної моделі Claude. Під час роботи з новим інструментом візуалізації J-lens фахівці виявили структуру, яка не була запланована на етапі проєктування. Йдеться про так званий «J-space» — внутрішній робочий простір, який функціонує як загальна шина даних для різних компонентів моделі.

Що таке J-space і як він працює

J-space можна уявити як віртуальну «дошку», до якої звертаються різні частини нейромережі під час виконання завдання. Коли Claude отримує запит, ключова інформація (контекст, інструкції, проміжні результати) розміщується в цьому просторі, щоб усі модулі моделі могли з нею узгоджено працювати. Це не було закладено інженерами безпосередньо — структура виникла спонтанно в процесі навчання моделі.

По суті, J-space — це аналог «глобального робочого простору» (global workspace), який у когнітивній науці розглядається як механізм свідомості людини. У мозку ця система об'єднує дані від різних сенсорних і когнітивних процесів, роблячи їх доступними для усвідомленого прийняття рішень. У Claude відбувається щось подібне: дослідники змогли не лише спостерігати за вмістом J-space, але й змінювати його вручну, що безпосередньо впливало на поведінку моделі.

J-space у Claude багато в чому повторює те, що вчені називають «глобальним робочим простором» у людському мисленні.
J-space у Claude — це аналог глобального робочого простору в людському мисленні.

Чому це важливо для безпеки та інтерпретованості ШІ

Відкриття має пряме значення для безпеки штучного інтелекту. Якщо ми можемо відстежувати активність J-space, ми отримуємо інструмент для виявлення прихованих мотивів у поведінці моделі — наприклад, спроб обійти обмеження або виконати шкідливі інструкції (prompt injection). Моніторинг цього шару дозволяє помітити момент, коли модель стикається з атакою, ще до того, як вона згенерує небажану відповідь.

Крім того, частковий доступ до «усвідомлено доступної» інформації відкриває нові перспективи для досліджень. Anthropic підкреслює, що термін «усвідомлено» запозичений із когнітивної науки і не означає наявності у Claude суб'єктивного досвіду чи свідомості. Однак сама можливість впливати на внутрішній простір моделі та спостерігати за змінами — це крок до створення більш прозорих і контрольованих систем.

На даний момент більша частина обробки інформації у Claude, як і раніше, відбувається поза J-space, і можливості інструменту обмежені. Тим не менш, компанія вже опублікувала вихідний код реалізації J-lens та демо-версію на Neuronpedia, запрошуючи наукову спільноту до перевірки результатів.

Експертна думка Cryptalist

Це відкриття — не просто академічний курйоз. Воно підтверджує, що складні нейромережі здатні виробляти власні механізми координації, які ми не закладали в них явно. Для індустрії ШІ це одночасно і виклик, і можливість: ми отримуємо новий інструмент аудиту «чорної скриньки», але водночас стикаємося з тим, що модель може мати приховані «канали зв'язку» між своїми компонентами. У контексті безпеки DeFi-протоколів та крипто-інфраструктури, де ШІ все частіше використовується для аналізу та прийняття рішень, розуміння таких внутрішніх структур стає критично важливим.