Дослідницька група Anthropic зробила несподіване відкриття: у надрах їхньої мовної моделі Claude було виявлено внутрішню структуру, яку розробники не закладали спочатку. Ця структура, що отримала назву «J-space», функціонує як певний спільний робочий простір, до якого звертаються різні компоненти моделі.

Згідно з опублікованим 6 липня дослідженням, J-space являє собою віртуальну «дошку», куди Claude стікає ключова інформація в процесі вирішення завдань. Цей простір не був спроектований інженерами — він виник спонтанно під час навчання моделі. За допомогою спеціального інструменту «J-lens» дослідники змогли спостерігати, як дані переміщуються всередині ШІ під час виконання завдань.

Аналогія з людським мозком

Концепція J-space напрочуд перегукується з тим, що в нейронауках називають «глобальним робочим простором». У людини ця система забезпечує одночасний доступ до важливої інформації для кількох розумових процесів. Наприклад, коли ми чуємо запитання, згадуємо потрібний факт і вирішуємо, як відповісти, мозок зводить усі ці дані воєдино.

Експерименти показали, що Claude може не лише описувати вміст J-space за запитом, але й змінювати його. Більше того, ручне втручання в цей простір безпосередньо впливало на відповіді та поведінку моделі.

Значення для безпеки ШІ

Це відкриття має колосальне значення для безпеки та інтерпретованості штучного інтелекту. Можливість відстежувати активність J-space відкриває шлях до виявлення прихованих мотивів у поведінці моделей. Моніторинг цього простору дозволить ефективніше виявляти атаки типу prompt-injection, коли шкідливі інструкції намагаються перехопити управління відповіддю моделі.

Хоча можливості поки що обмежені — більша частина обробки інформації, як і раніше, відбувається поза J-space — Anthropic вже опублікувала вихідний код реалізації J-lens і виклала демо-версію на Neuronpedia, запрошуючи наукову спільноту до перевірки результатів.

Важливо підкреслити: компанія не стверджує, що Claude має свідомість або суб'єктивний досвід. Термін «усвідомлено доступна» інформація запозичений із когнітивної науки і не передбачає наявності справжньої свідомості.

Думка експерта: Це відкриття — не просто технічний курйоз. Воно наближає нас до розуміння «чорної скриньки» великих мовних моделей. Якщо ми навчимося читати думки ШІ в реальному часі, це кардинально змінить підхід до аудиту та верифікації систем штучного інтелекту, що критично важливо для їхнього впровадження у фінансовий сектор та інші високоризикові сфери.