Дослідники Anthropic зробили несподіване відкриття, зазирнувши під капот своєї мовної моделі Claude. Вони виявили внутрішню структуру, яка не була запланована інженерами під час проєктування. Цей механізм, що отримав назву «J-space», функціонує як загальний робочий простір, до якого звертаються різні компоненти моделі під час виконання завдань.

По суті, J-space — це віртуальна «дошка», куди Claude стягує ключову інформацію, необхідну для відповіді на запит, вирішення проблеми або виконання інструкції. Цей внутрішній шар даних доступний різним частинам нейромережі, що дозволяє координувати їхню роботу. Відкриття було зроблено за допомогою спеціального інструменту візуалізації «J-lens», який дозволив спостерігати за переміщенням інформаційних потоків всередині моделі в реальному часі.

Найпримітніше — J-space виник спонтанно в процесі навчання. Це не було закладено розробниками. Концепція напрочуд перегукується з тим, що в нейронауці називають «глобальним робочим простором» — теорією, яка описує, як людський мозок зводить воєдино дані з різних ділянок для усвідомленої обробки інформації. Експерименти показали, що Claude може не лише зчитувати вміст J-space, але й змінювати його на запит, що безпосередньо впливає на його відповіді та поведінку.

Чому це змінює правила гри для безпеки ШІ?

Це відкриття має колосальне значення для безпеки та інтерпретованості штучного інтелекту. Можливість моніторингу J-space дає нам «вікно» в процес прийняття рішень моделлю. Тепер ми можемо потенційно відстежувати приховані мотиви або виявляти моменти, коли система починає працювати нестабільно. Наприклад, це відкриває нові горизонти для виявлення атак типу prompt-injection, коли шкідливі інструкції намагаються перехопити управління відповіддю моделі.

Anthropic вже опублікувала вихідний код реалізації J-lens і передала демо-версію платформі Neuronpedia для незалежної перевірки науковою спільнотою. Компанія продовжує серію робіт з вивчення внутрішніх процесів моделей, розпочату ще у 2025 році.

Думка експерта: Виявлення J-space — це, мабуть, один із найзначніших кроків у галузі інтерпретованості ШІ за останній час. Ми переходимо від «чорної скриньки» до розуміння того, як саме великі мовні моделі структурують та обробляють знання. Для криптоіндустрії, де ШІ все активніше використовується для аналізу ринків та управління активами, прозорість таких систем — критично важливий фактор довіри. Можливість «зазирнути в думки» алгоритму може стати стандартом безпеки нового покоління.