Дослідницька група Anthropic здійснила прорив у розумінні внутрішньої архітектури великих мовних моделей. Під час аналізу моделей сімейства Claude було виявлено структуру, яку розробники не закладали на етапі проєктування. Йдеться про так званий «J-space» — внутрішній механізм, що функціонує як загальний робочий простір, до якого звертаються різні компоненти моделі.

Згідно з опублікованими даними (дослідження від 6 липня), J-space являє собою віртуальну «дошку», де збирається та передається ключова інформація по всій моделі. Коли Claude відповідає на запитання, розв'язує задачу або виконує інструкцію, критично важливі дані з'являються в цьому просторі, щоб різні частини моделі могли з ними працювати. Дослідники використовували інструмент під назвою «J-lens», який дозволяє спостерігати за переміщенням інформації всередині моделі в реальному часі. Дивовижно, але J-space виник спонтанно в процесі навчання — він не був закладений конструкторами безпосередньо.

Ця концепція напрочуд перегукується з тим, що в нейронауках називають «глобальним робочим простором». У людини ця система забезпечує доступ до важливої інформації одразу для кількох розумових процесів. Наприклад, коли людина чує запитання, згадує потрібний факт і вирішує, як відповісти, мозок зводить усі необхідні дані в одному місці. Claude працює подібним чином: модель може описувати вміст J-space за запитом і навіть змінювати його, якщо її про це попросити. Більше того, коли дослідники вручну змінювали J-space, змінювалися і відповіді Claude, і його поведінка під час виконання завдань.

Чому це важливо для безпеки та інтерпретованості ШІ?

Відкриття має величезне значення для безпеки штучного інтелекту. Якщо вчені зможуть відстежувати активність J-space, у них з'явиться шанс виявляти приховані мотиви в поведінці ШІ-моделей. Це дозволить ефективніше помічати моменти, коли система починає працювати ненадійно, зокрема при атаках типу prompt-injection (впровадження шкідливих інструкцій у запит). Навіть частковий доступ до такого «усвідомленого» шару обробки відкриває важливі перспективи для досліджень.

Поки що можливості обмежені: більша частина обробки інформації у Claude, як і раніше, відбувається поза J-space. Тим не менш, Anthropic вже відкрила вихідний код реалізації J-lens і виклала демоверсію на Neuronpedia, запропонувавши дослідницькій спільноті перевірити результати на практиці.

Це дослідження спирається на серію більш ранніх робіт. У жовтні 2025 року компанія опублікувала доповідь про формування інтроспективної усвідомленості, а у квітні 2025 року запустила ініціативи з вивчення благополуччя моделей. Важливе застереження: Anthropic підкреслює, що не стверджує, ніби Claude має свідомість або суб'єктивний досвід. У роботі використовується термін «усвідомлено доступна» інформація, запозичений з когнітивної науки, — він не означає наявності справжньої свідомості.

Думка експерта: Виявлення J-space — це не просто академічний курйоз, а крок до створення «білих ящиків» із «чорних». Для криптоіндустрії, де ШІ все активніше застосовується в аналізі ринків та управлінні активами, можливість зазирнути в «голову» моделі та зрозуміти її мотиви — це питання довіри та безпеки. Моніторинг J-space може стати стандартом верифікації ШІ-агентів у DeFi.