Дослідницька група Anthropic здійснила прорив, виявивши всередині своєї мовної моделі Claude раніше невідому внутрішню структуру. Цей механізм, названий «J-space», функціонує як загальний робочий простір, до якого звертаються різні компоненти моделі. Важливо підкреслити: інженери не закладали цю архітектуру в проєкт під час розробки — вона виникла спонтанно в процесі навчання.
Що таке J-space і як він працює?
За своєю суттю, J-space — це внутрішній віртуальний простір, де Claude збирає та передає ключові дані по всій моделі. Його можна уявити як своєрідну «дошку» всередині штучного інтелекту. Коли модель відповідає на запитання або вирішує завдання, критично важлива інформація з'являється в J-space, щоб різні частини моделі могли з нею взаємодіяти. Вчені виявили цю структуру за допомогою спеціального інструменту «J-lens», який дозволяє спостерігати за переміщенням інформації під час виконання завдання.
Примітно, що J-space багато в чому повторює концепцію «глобального робочого простору» в людському мисленні. Коли людина чує запитання, згадує потрібний факт і вирішує, як відповісти, її мозок зводить усі необхідні дані в одному місці. Claude працює схожим чином. Більше того, дослідники продемонстрували, що модель може описувати вміст J-space на запит і навіть змінювати його, якщо її про це попросити. Ручне втручання в J-space безпосередньо впливало на відповіді та поведінку моделі.
Чому це змінює правила гри для безпеки ШІ
Це відкриття має колосальне значення для безпеки та інтерпретованості штучного інтелекту. Можливість відстежувати активність J-space відкриває шлях до виявлення прихованих мотивів у поведінці моделей. Ми зможемо ефективніше помічати моменти, коли система починає працювати ненадійно. Зокрема, моніторинг J-space дозволяє побачити спроби prompt-ін'єкцій — впровадження шкідливих інструкцій у запит для перехоплення управління відповіддю моделі.
Звісно, можливості поки що обмежені. Більша частина обробки інформації у Claude, як і раніше, відбувається поза J-space. Тим не менш, Anthropic вже опублікувала вихідний код реалізації J-lens і виклала демо-версію на Neuronpedia, запропонувавши дослідницькій спільноті перевірити результати на практиці.
Це дослідження спирається на серію більш ранніх робіт. У жовтні 2025 року Anthropic опублікувала доповідь про інтроспективну «усвідомленість» моделей, що формується, а в квітні запустила ініціативи з вивчення їхнього благополуччя. Важливе застереження: компанія не стверджує, що Claude має свідомість або суб'єктивний досвід. Термін «усвідомлено доступна» інформація запозичений з когнітивної науки і не передбачає наявності справжньої свідомості.
Коментар експерта Cryptalist: Виявлення J-space — це не просто академічний курйоз. Це крок до створення «рентгенівського апарату» для нейромереж. Можливість зазирнути в «чорну скриньку» прийняття рішень — ключ до побудови по-справжньому безпечних і підконтрольних систем ШІ, що критично важливо для їхньої інтеграції у фінансові та управлінські процеси.