Дослідники Anthropic здійснили прорив у розумінні внутрішньої роботи своїх моделей Claude. Вони виявили структуру, яку інженери не закладали в архітектуру на етапі проєктування. Йдеться про так званий «J-space» — внутрішній робочий простір, який модель створила самостійно в процесі навчання.

J-space функціонує як глобальна дошка оголошень для даних. Коли Claude обробляє запит, вирішує задачу або виконує інструкцію, критично важлива інформація концентрується в цьому просторі. Різні компоненти моделі звертаються до J-space, щоб обмінюватися даними. Це нагадує концепцію «глобального робочого простору» в когнітивній нейронауці, де мозок зводить воєдино інформацію з різних ділянок для прийняття рішень.

Для виявлення цієї структури команда Anthropic розробила інструмент під назвою J-lens. За його допомогою дослідники спостерігали, як інформація переміщується всередині моделі під час виконання завдання. Ключовий висновок: J-space не був запрограмований — він виник спонтанно як емерджентна властивість навчання.

Чому це важливо для безпеки та інтерпретованості ШІ

Відкриття J-space має величезне значення для безпеки штучного інтелекту. Якщо вчені зможуть відстежувати активність у цьому просторі, у них з'явиться можливість виявляти приховані мотиви в поведінці моделей. Це відкриває шлях до більш ефективного виявлення атак, таких як prompt-injection, коли шкідливі інструкції намагаються перехопити управління відповіддю моделі.

Дослідники також продемонстрували, що можуть вручну змінювати вміст J-space, що безпосередньо впливає на відповіді та поведінку Claude. Це дає безпрецедентний рівень контролю та розуміння.

Anthropic опублікувала вихідний код реалізації J-lens і виклала демо-версію на Neuronpedia, запрошуючи наукову спільноту перевірити результати на практиці. Це продовження серії робіт компанії: у жовтні 2025 року вони опублікували доповідь про формування інтроспективної усвідомленості, а у квітні запустили ініціативи з вивчення благополуччя моделей.

Думка експерта: Виявлення J-space — це не просто академічний курйоз. Це крок до «прозорого ШІ», коли ми зможемо зазирнути в «чорну скриньку» нейромережі та зрозуміти, чому вона приймає ті чи інші рішення. Для криптоіндустрії, де ШІ все частіше використовується для аналізу ринків та управління активами, це прямий шлях до підвищення довіри та безпеки. Можливість моніторити внутрішні процеси моделі — це новий стандарт безпеки, до якого ми повинні прагнути.