Дослідницька група Anthropic здійснила прорив у галузі інтерпретованості штучного інтелекту. Під час аналізу внутрішніх процесів моделі Claude було виявлено структуру, яку розробники не закладали в архітектуру спочатку. Йдеться про так званий «J-space» — внутрішній механізм, який функціонує як глобальний робочий простір для різних компонентів нейромережі.
Що таке J-space і як він працює?
По суті, J-space — це віртуальна «дошка», куди Claude стягує ключову інформацію під час обробки запиту. Коли модель вирішує завдання або відповідає на питання, важливі дані з'являються в цьому просторі, стаючи доступними для всіх частин системи. Anthropic виявила цю структуру за допомогою власного інструменту J-lens, який дозволяє спостерігати за переміщенням даних всередині моделі в реальному часі.
Примітно, що J-space виник спонтанно в процесі навчання. Конструктори не програмували його безпосередньо. Це відкриття від 6 липня є значним кроком вперед у розумінні того, що саме відбувається «під капотом» великих мовних моделей.
Аналогія з людським мозком та наслідки для безпеки
Концепція J-space напрочуд перегукується з нейробіологічною теорією «глобального робочого простору» в людському мозку. У людей ця система забезпечує одночасний доступ до важливої інформації для кількох розумових процесів. Наприклад, коли ми чуємо питання, згадуємо факт і формулюємо відповідь — мозок зводить всі дані в одну точку.
Експерименти показали, що Claude може не лише описувати вміст J-space за запитом, але й змінювати його, якщо його про це попросити. Більше того, ручне втручання в J-space безпосередньо впливало на відповіді та поведінку моделі. Це відкриває колосальні перспективи для безпеки ШІ. Моніторинг активності J-space дозволить виявляти приховані мотиви в поведінці моделі, виявляти атаки типу prompt-injection та відстежувати моменти, коли система починає працювати ненадійно.
Перспективи та обмеження
Anthropic вже опублікувала вихідний код реалізації J-lens та передала демо-версію платформі Neuronpedia, запрошуючи дослідницьку спільноту до перевірки результатів. Важливо підкреслити: компанія не стверджує, що Claude має свідомість або суб'єктивний досвід. Термін «свідомо доступна» інформація запозичений з когнітивної науки і не передбачає наявності справжньої свідомості.
Думка експерта: Виявлення J-space — це не просто академічний курйоз. Це перший практичний інструмент, який може кардинально змінити підхід до аудиту та безпеки ШІ-систем. Якщо ми зможемо «читати думки» моделі в реальному часі, це дасть нам безпрецедентний контроль над її поведінкою та дозволить запобігати збоям і атакам до того, як вони відбудуться. Однак поки що більша частина обробки інформації в Claude, як і раніше, відбувається поза J-space, тому говорити про повну прозорість «чорної скриньки» поки що рано.