Дослідники Anthropic зробили несподіване відкриття: всередині їхньої флагманської мовної моделі Claude сформувалася структура, яку розробники не закладали на етапі проєктування. Цей внутрішній механізм, названий «J-space», функціонує як загальний робочий простір, до якого звертаються різні компоненти моделі для обміну даними.
Результати дослідження, опубліковані 6 липня, є значним кроком вперед у розумінні того, що саме відбувається «під капотом» великих мовних моделей (LLM). J-space — це віртуальна «дошка», де Claude збирає та передає ключову інформацію по всій мережі. Коли модель відповідає на запитання або виконує інструкцію, критично важливі дані з'являються в J-space, роблячи їх доступними для всіх задіяних нейронних ланцюгів.
Як працює J-space і чому це важливо
Anthropic ідентифікувала J-space за допомогою спеціального інструменту візуалізації під назвою J-lens. Спостерігаючи за переміщенням інформації всередині моделі під час виконання завдань, вчені виявили, що ця структура виникла спонтанно в процесі навчання. Вона не була запрограмована інженерами безпосередньо.
Концептуально J-space напрочуд нагадує те, що в когнітивній нейронауці називають «глобальним робочим простором». У людини ця система забезпечує одночасний доступ кількох розумових процесів до важливої інформації — наприклад, коли ви чуєте запитання, згадуєте факт і формулюєте відповідь, мозок зводить усі дані воєдино. Claude працює аналогічно: модель може не лише описувати вміст J-space на запит, але й змінювати його, якщо попросити про це. Більше того, ручне втручання в J-space безпосередньо змінювало відповіді та поведінку моделі.
Наслідки для безпеки та інтерпретованості ШІ
Це відкриття має величезне значення для безпеки штучного інтелекту. Можливість відстежувати активність J-space відкриває шлях до виявлення прихованих мотивів у поведінці моделей — наприклад, виявлення спроб атак типу prompt-injection, коли шкідливі інструкції намагаються перехопити керування відповіддю. Навіть частковий доступ до цього «усвідомленого» шару обробки інформації дає дослідникам потужний інструмент для моніторингу надійності систем.
Важливо підкреслити: Anthropic не стверджує, що Claude має свідомість або суб'єктивний досвід. Термін «усвідомлено доступна інформація» запозичений з когнітивної науки і не передбачає наявності справжньої свідомості. Тим не менш, компанія вже опублікувала вихідний код J-lens і виклала демо-версію на Neuronpedia, запрошуючи наукову спільноту перевірити результати на практиці.
Думка експерта: Виявлення J-space — це не просто академічний курйоз. Це практичний крок до створення «рентгенівського зору» для ШІ. У найближчі роки моніторинг подібних внутрішніх структур стане стандартом безпеки для всіх серйозних LLM-проєктів. Якщо ми зможемо «бачити», як модель приймає рішення, ми зможемо робити їх більш безпечними, передбачуваними і, що критично важливо, захищеними від маніпуляцій.