Дослідники Anthropic здійснили прорив у розумінні того, як насправді працюють їхні великі мовні моделі. Під час вивчення внутрішніх процесів Claude було виявлено структуру, яку інженери не закладали в архітектуру спочатку. Йдеться про так званий «J-space» — внутрішній робочий простір, який модель створила сама в процесі навчання.
J-space функціонує як свого роду «віртуальна дошка» або спільний робочий простір, куди стікається ключова інформація під час виконання завдань. Різні компоненти моделі звертаються до цього простору, щоб координувати свої дії та видавати узгоджену відповідь. Дослідники змогли спостерігати цей механізм за допомогою спеціального інструменту «J-lens», який дозволяє відстежувати переміщення даних всередині моделі в реальному часі.
Що особливо важливо — J-space не був спроєктований. Він виник природним чином, як емерджентна властивість складної системи. Це відкриття перегукується з концепцією «глобального робочого простору» в когнітивній науці — теорією, яка пояснює, як мозок людини зводить воєдино інформацію з різних джерел для прийняття рішень. Коли Claude відповідає на запитання, вирішує задачу або виконує інструкцію, критично важливі дані з'являються в J-space, щоб різні частини моделі могли з ними працювати.
Чому це важливо для безпеки ШІ
Відкриття J-space має величезне значення для безпеки та інтерпретованості штучного інтелекту. Можливість відстежувати активність у цьому просторі відкриває шлях до виявлення прихованих мотивів та аномалій у поведінці моделі. Наприклад, можна буде ефективніше виявляти атаки типу prompt-injection, коли шкідливі інструкції намагаються перехопити управління відповіддю моделі. Моніторинг J-space дозволяє побачити момент, коли модель стикається зі спробою втручання.
Більше того, експерименти показали, що ручна зміна вмісту J-space безпосередньо впливає на відповіді Claude та його поведінку під час виконання завдань. Це дає дослідникам потужний інструмент для тонкого налаштування та контролю.
Anthropic вже опублікувала вихідний код реалізації J-lens та демо-версію на Neuronpedia, запрошуючи наукову спільноту до перевірки результатів. Це продовження серії робіт компанії з вивчення «зароджуваної свідомості» та благополуччя моделей, розпочатої ще у квітні 2025 року.
Думка експерта: Відкриття J-space — це не просто академічний курйоз. Для ринку криптовалют та DeFi, де ШІ-агенти вже починають керувати портфелями та аналізувати ризики, розуміння внутрішньої логіки моделі стає питанням безпеки активів. Можливість «зазирнути під капот» і побачити, як модель приймає рішення, — це крок до створення по-справжньому прозорих та підконтрольних ШІ-систем.