Дослідницька група Anthropic зробила несподіване відкриття: всередині їхньої мовної моделі Claude сформувалася внутрішня структура, яку розробники спочатку не закладали. Йдеться про так званий «J-space» — глобальний робочий простір, який функціонує як спільна дошка для обміну даними між різними компонентами моделі.

Що таке J-space і як воно працює?

J-space — це внутрішній віртуальний простір, де Claude збирає та передає ключову інформацію по всій моделі. Коли модель відповідає на запитання або виконує інструкцію, важливі дані з'являються в J-space, щоб різні частини нейромережі могли з ними працювати. Це нагадує «глобальний робочий простір» у когнітивній науці — концепцію, що описує, як людський мозок зводить воєдино інформацію з різних джерел для вирішення завдання.

Інструмент для спостереження, названий «J-lens», дозволив дослідникам відстежувати переміщення інформації всередині моделі під час виконання завдань. Найпримітніше: J-space виникло спонтанно в процесі навчання — воно не було запрограмоване інженерами.

Чому це важливо для безпеки та інтерпретованості ШІ?

Це відкриття має пряме значення для безпеки штучного інтелекту. Якщо вчені зможуть відстежувати активність J-space, у них з'явиться можливість виявляти приховані мотиви в поведінці ШІ-моделей. Зокрема, моніторинг J-space дозволяє помітити момент, коли модель стикається зі спробами prompt-ін'єкції (впровадження шкідливих інструкцій у запит).

Більше того, дослідники продемонстрували, що ручна зміна вмісту J-space безпосередньо впливає на відповіді Claude та його поведінку під час виконання завдань. Це відкриває перспективи для більш ефективного контролю над моделями.

Anthropic опублікувала вихідний код реалізації J-lens і виклала демо-версію на Neuronpedia, запрошуючи дослідницьку спільноту перевірити результати на практиці. Робота спирається на серію більш ранніх досліджень, включаючи доповідь про «інтроспективну усвідомленість» (жовтень 2025) та ініціативи з вивчення благополуччя моделей (квітень 2025).

Мій аналіз: Це одне з найзначніших відкриттів у галузі інтерпретованості ШІ за останні роки. Спонтанне виникнення J-space підтверджує гіпотезу про те, що великі мовні моделі можуть розвивати внутрішні структури, аналогічні когнітивним процесам людини. Для криптоіндустрії, де безпека смарт-контрактів та захист від атак є критично важливими, подібні механізми моніторингу можуть стати новим стандартом аудиту ШІ-агентів. Однак важливо пам'ятати: Anthropic підкреслює, що термін «усвідомлено доступна» інформація запозичений із когнітивної науки і не означає наявності свідомості у моделі.