Команда розробників Anthropic здійснила прорив у розумінні внутрішніх механізмів великих мовних моделей. Під час аналізу роботи Claude було виявлено структуру, яку інженери не закладали в архітектуру на етапі проєктування. Цей внутрішній механізм, названий «J-space», функціонує як універсальний робочий простір, до якого звертаються різні компоненти нейромережі для обміну та обробки критично важливої інформації.

Дослідження, опубліковане 6 липня, є значним кроком уперед в інтерпретованості ШІ. J-space — це свого роду віртуальна дошка всередині штучного інтелекту, куди стікаються ключові дані під час вирішення завдань, відповідей на запитання або виконання інструкцій. Завдяки цьому різні частини моделі можуть синхронно працювати з однією і тією ж інформацією.

Як працює J-space і чому це сенсація

Anthropic виявила J-space за допомогою спеціального інструменту під назвою «J-lens». З його допомогою дослідники спостерігали, як інформація переміщується всередині Claude під час виконання завдань. Вражає те, що J-space виник спонтанно в процесі навчання — він не був запрограмований розробниками безпосередньо. Ця концепція напрочуд нагадує те, що когнітивні нейронауки називають «глобальним робочим простором» у людському мозку.

У людини ця система забезпечує одночасний доступ до важливих даних для кількох розумових процесів. Наприклад, коли ми чуємо запитання, згадуємо факт і формулюємо відповідь, мозок зводить всю необхідну інформацію воєдино. Claude демонструє подібний патерн. Більше того, дослідники змогли впливати на відповіді моделі, вручну змінюючи вміст J-space. Коли вміст цього віртуального простору змінювався, кардинально змінювалися і відповіді ШІ, і його поведінка під час виконання завдань.

Безпека та майбутнє інтерпретованості

Відкриття J-space має колосальне значення для безпеки штучного інтелекту. Можливість відстежувати активність у цьому «робочому просторі» відкриває шлях до виявлення прихованих мотивів та небажаних патернів у поведінці моделей. Зокрема, моніторинг J-space може допомогти в реальному часі виявляти атаки типу prompt-injection, коли зловмисник намагається впровадити шкідливі інструкції в запит.

Хоча більша частина обробки інформації в Claude, як і раніше, відбувається за межами J-space, сам факт існування такої структури — це потужний інструмент для майбутніх досліджень. Anthropic вже опублікувала вихідний код реалізації J-lens і надала демо-версію на платформі Neuronpedia, запрошуючи наукову спільноту до перевірки результатів.

Коментар аналітика: Це відкриття може кардинально змінити підхід до аудиту та безпеки ШІ-систем. Можливість «зазирнути» в центральний процес прийняття рішень моделі — це не просто науковий курйоз, а потенційний стандарт для верифікації надійності будь-яких комерційних нейромереж. Однак важливо підкреслити, що, незважаючи на антропоморфну термінологію, Anthropic прямо заявляє: Claude не має свідомості чи суб'єктивного досвіду. Термін «усвідомлено доступна інформація» запозичений з когнітивної науки і не передбачає наявності справжньої свідомості.