Дослідницька група Anthropic здійснила несподіване відкриття всередині своєї мовної моделі Claude. Аналізуючи внутрішні процеси, інженери виявили структуру, яка не була закладена під час проєктування — так званий «J-space». Це внутрішній робочий простір функціонує як спільне «віртуальне креслення», до якого звертаються різні компоненти моделі під час виконання завдань.
Суть відкриття полягає в тому, що J-space є центральним вузлом, де збирається та обробляється ключова інформація. Коли Claude відповідає на запит або вирішує завдання, важливі дані стікаються в цей простір, дозволяючи різним частинам моделі ефективно взаємодіяти. Для виявлення цієї структури дослідники використали спеціальний інструмент «J-lens», який дозволяє спостерігати за переміщенням інформації всередині моделі в реальному часі.
Чому це важливо для безпеки та інтерпретованості ШІ
Дане відкриття має колосальне значення для безпеки та прозорості систем штучного інтелекту. Можливість відстежувати активність J-space відкриває шлях до виявлення прихованих мотивів у поведінці моделей. Наприклад, моніторинг цього простору дозволяє виявити момент, коли модель стикається зі спробою prompt-ін'єкції — впровадження шкідливих інструкцій у запит з метою перехоплення керування відповіддю. Навіть частковий доступ до цього «усвідомленого» шару обробки відкриває важливі перспективи для досліджень.
Важливе застереження: Anthropic підкреслює, що не заявляє про наявність у Claude свідомості або суб'єктивного досвіду. У роботі використовується термін «свідомо доступна» інформація, запозичений із когнітивної науки — він не означає наявності справжньої свідомості.
Дослідження спирається на серію більш ранніх робіт. У жовтні 2025 року Anthropic опублікувала доповідь про формування інтроспективної усвідомленості, а у квітні 2025 року запустила ініціативи з вивчення благополуччя моделей. Компанія також опублікувала вихідний код реалізації J-lens та виклала демоверсію на Neuronpedia, запропонувавши дослідницькій спільноті перевірити результати на практиці.
Аналітичний висновок: Виявлення J-space — це не просто технічний курйоз, а фундаментальний крок уперед у розумінні того, як працюють великі мовні моделі. Можливість «зазирнути» в центральний процесор прийняття рішень ШІ може кардинально змінити підходи до аудиту безпеки та верифікації поведінки моделей. Для криптоіндустрії, де смарт-контракти та децентралізовані додатки все частіше інтегруються зі ШІ, це відкриття може стати ключем до створення по-справжньому надійних та передбачуваних систем.