Дослідники з Anthropic зробили несподіване відкриття: всередині їхньої флагманської мовної моделі Claude сформувалася внутрішня структура, яку розробники не закладали в архітектуру спочатку. Цей механізм, названий «J-space», функціонує як загальний робочий простір, до якого звертаються різні компоненти моделі під час виконання завдань.

Що таке J-space?

По суті, J-space — це віртуальна «дошка» всередині нейромережі, куди стікається ключова інформація під час обробки запитів. Коли Claude відповідає на запитання або вирішує задачу, критично важливі дані з'являються в цій області, щоб різні частини моделі могли з ними взаємодіяти. Аналітики Anthropic виявили цю структуру за допомогою спеціального інструменту під назвою «J-lens», який дозволяє спостерігати за переміщенням інформації всередині моделі в реальному часі.

Примітно, що J-space виник спонтанно в процесі навчання — це не було запрограмовано інженерами. Концепція напрочуд перегукується з тим, що в нейронауці називають «глобальним робочим простором» — механізмом, який у людини забезпечує доступ до важливої інформації для кількох розумових процесів одночасно. Наприклад, коли ви чуєте запитання, згадуєте факт і формулюєте відповідь, ваш мозок зводить всі ці дані в одну точку.

Експерименти показали, що Claude може не лише описувати вміст J-space за запитом, але й змінювати його. Більше того, ручне втручання в цю структуру безпосередньо впливало на відповіді та поведінку моделі.

Чому це важливо для безпеки ШІ

Відкриття має колосальне значення для безпеки та інтерпретованості штучного інтелекту. Можливість відстежувати активність J-space відкриває шлях до виявлення прихованих мотивів у поведінці моделей та виявлення аномалій, включаючи атаки типу prompt-injection, коли шкідливі інструкції намагаються перехопити управління відповіддю.

Зараз, звісно, можливості обмежені: більша частина обробки інформації в Claude, як і раніше, відбувається поза J-space. Однак команда вже опублікувала вихідний код реалізації J-lens та виклала демо-версію на Neuronpedia, запрошуючи дослідницьку спільноту до перевірки результатів.

Це дослідження — частина більш широкої серії робіт Anthropic з вивчення «внутрішнього життя» моделей. Компанія послідовно рухається до розуміння того, що відбувається «під капотом» ШІ, і це, на мою думку, один із найважливіших трендів в індустрії прямо зараз.

Думка експерта: Виявлення J-space — це не просто академічний курйоз. Це крок до створення по-справжньому контрольованого та прозорого ШІ. Якщо ми зможемо «читати думки» моделей на рівні їхнього внутрішнього робочого простору, ми отримаємо ключ до вирішення фундаментальних проблем безпеки, які сьогодні стоять перед усією галуззю.