Дослідницька команда Anthropic здійснила прорив у розумінні внутрішньої архітектури великих мовних моделей. Під час аналізу моделей сімейства Claude було виявлено структуру, яку розробники не закладали в проєкт спочатку. Цей внутрішній механізм, названий «J-space», функціонує як загальний робочий простір: до нього звертаються різні компоненти моделі для обміну та обробки ключової інформації.

Результати дослідження, опубліковані 6 липня, стали значним кроком уперед в інтерпретації того, що саме відбувається всередині «чорної скриньки» сучасних ШІ-систем.

Що таке J-space і як він працює?

J-space — це внутрішній віртуальний простір, де Claude збирає та передає важливі дані по всій моделі. Найпростіше уявити його як «віртуальну дошку» всередині штучного інтелекту. Коли Claude відповідає на запитання, вирішує задачу або виконує інструкцію, ключова інформація з'являється в J-space, щоб різні частини моделі могли з нею працювати.

Виявити цю структуру вдалося за допомогою спеціального інструменту під назвою J-lens. Дослідники спостерігали, як інформація переміщується всередині моделі під час виконання завдання. Ключовий момент: J-space виник спонтанно в процесі навчання — він не був закладений конструкторами безпосередньо.

J-space у Claude багато в чому повторює те, що вчені називають «глобальним робочим простором» у людському мисленні.
J-space у Claude багато в чому повторює те, що вчені називають «глобальним робочим простором» у людському мисленні.

Ця концепція перегукується з теорією «глобального робочого простору» в нейронауках. У людини ця система забезпечує доступ до важливої інформації одразу для кількох розумових процесів. Наприклад, коли людина чує запитання, згадує потрібний факт і вирішує, як відповісти, мозок зводить усі необхідні дані в одному місці.

Claude працює подібним чином. Anthropic показала, що модель може не лише описувати вміст J-space за запитом, але й змінювати його, якщо її про це попросити. Більше того, коли дослідники вручну змінювали J-space, змінювалися і відповіді Claude, і його поведінка під час виконання завдань.

Чому це важливо для безпеки та інтерпретованості ШІ

Це відкриття має величезне значення для безпеки штучного інтелекту. Якщо вчені зможуть відстежувати активність J-space, у них з'явиться шанс виявляти приховані мотиви в поведінці ШІ-моделей. Завдяки цьому можна буде ефективніше помічати, коли система починає працювати ненадійно.

У тому числі — виявлення атак. Моніторинг J-space дозволяє побачити момент, коли модель стикається зі спробами prompt-injection (впровадження шкідливих інструкцій у запит, щоб перехопити керування відповіддю моделі). Крім того, навіть частковий доступ до такого «усвідомленого» шару обробки відкриває важливі перспективи для досліджень.

Поки що можливості обмежені. Більша частина обробки інформації у Claude, як і раніше, відбувається поза J-space. Тим не менш, Anthropic відкрила вихідний код реалізації J-lens і виклала демоверсію на Neuronpedia, запропонувавши дослідницькій спільноті перевірити результати на практиці.

Дослідження спирається на серію більш ранніх робіт. У жовтні 2025 року Anthropic опублікувала доповідь про формування інтроспективної усвідомленості. Раніше, у квітні 2025 року, компанія запустила ініціативи з вивчення благополуччя моделей, крок за кроком просуваючись у розумінні того, що відбувається всередині її систем.

Є й важливе застереження. Anthropic підкреслює, що не стверджує, ніби Claude має свідомість або суб'єктивний досвід. У роботі використовується термін «усвідомлено доступна» інформація, запозичений із когнітивної науки — він не означає наявності справжньої свідомості.

Коментар аналітика: Виявлення J-space — це не просто академічний курйоз. Для ринку ШІ та суміжних технологій це сигнал: «чорна скринька» нейромереж поступово стає прозорішою. Можливість моніторингу внутрішніх процесів безпосередньо впливає на безпеку смарт-контрактів і DeFi-протоколів, які використовують ШІ-агенти. Чим більше ми розуміємо внутрішню логіку моделі, тим надійніше можемо інтегрувати її в критично важливі фінансові системи.