Дослідники Anthropic здійснили прорив у розумінні внутрішньої архітектури великих мовних моделей. Під час аналізу власної моделі Claude вони виявили структуру, яка не була закладена розробниками на етапі проєктування, а виникла самостійно в процесі навчання. Цей внутрішній механізм, що отримав назву «J-space», функціонує як універсальний робочий простір, до якого звертаються різні компоненти нейромережі.
Що таке J-space і як він працює?
Уявіть собі віртуальну «дошку» всередині штучного інтелекту. Коли Claude отримує запит, вирішує завдання або виконує інструкцію, ключова інформація збирається саме в J-space. Це дозволяє різним частинам моделі ефективно взаємодіяти та обмінюватися даними. Для виявлення цієї структури Anthropic розробила спеціальний інструмент під назвою «J-lens». За його допомогою вчені змогли в реальному часі спостерігати, як інформація переміщується всередині моделі під час виконання завдань.
Примітно, що J-space не був запрограмований інженерами — він з'явився емерджентно, як побічний продукт навчання. Ця концепція дивовижним чином перегукується з поняттям «глобального робочого простору» (Global Workspace Theory) у когнітивній нейронауці, яке описує, як людський мозок зводить воєдино інформацію з різних ділянок для прийняття рішень. Дослідники продемонстрували, що можуть не лише зчитувати вміст J-space, але й змінювати його, що безпосередньо впливає на відповіді та поведінку моделі.
Чому це критично важливо для безпеки та інтерпретованості ШІ?
Це відкриття має величезне значення для майбутнього безпеки штучного інтелекту. Можливість відстежувати активність J-space дає нам принципово новий інструмент для «заглядання під капот» нейромереж. Ми зможемо виявляти приховані мотиви в поведінці ШІ, виявляти моменти, коли система починає працювати ненадійно, і, що особливо важливо, розпізнавати спроби атак типу prompt-injection (впровадження шкідливих інструкцій, які перехоплюють керування відповіддю моделі).
Хоча на даний момент більша частина обробки інформації в Claude, як і раніше, відбувається поза J-space, а можливості обмежені, крок вперед колосальний. Anthropic не лише опублікувала наукову роботу та відкрила вихідний код реалізації J-lens, але й надала демо-версію на платформі Neuronpedia, запрошуючи всю наукову спільноту до перевірки результатів. Важливо підкреслити: компанія не стверджує, що Claude має свідомість або суб'єктивний досвід. Термін «свідомо доступна інформація» запозичений з когнітивної науки і не означає наявності справжньої свідомості.
Коментар експерта: Виявлення J-space — це, мабуть, один із найзначніших кроків до створення по-справжньому інтерпретованого та контрольованого ШІ. Якщо ми навчимося «читати думки» моделей на такому фундаментальному рівні, це не лише підвищить їхню безпеку, але й може призвести до створення алгоритмів нового покоління, здатних до складніших і прозоріших міркувань. За цим відкриттям варто уважно стежити всім, хто цікавиться майбутнім технологій.