Дослідницька команда Anthropic зробила несподіване відкриття, вивчаючи внутрішні механізми своєї флагманської мовної моделі Claude. Вони виявили структуру, яку не закладали під час проєктування, — так зване «J-space» (J-простір). Це не просто баг чи артефакт навчання; це повноцінний внутрішній робочий простір, до якого звертаються різні компоненти моделі під час виконання завдань.
Що таке J-space і як воно працює?
Найпростіше уявити J-space як віртуальну «дошку» всередині ШІ. Коли Claude отримує запит, вирішує завдання або виконує інструкцію, ключова інформація — факти, контекст, проміжні висновки — збирається саме тут. Це свого роду глобальний буфер обміну, з якого різні частини моделі можуть черпати дані для генерації відповіді.
Anthropic змогла зазирнути в цей простір за допомогою спеціального інструменту під назвою J-lens. Спостереження показали, що J-space формується спонтанно в процесі навчання — розробники не прописували його явно в архітектурі. Більше того, дослідники виявили, що можуть не лише зчитувати вміст J-space за запитом, а й змінювати його. І коли вони вручну коригували дані в цьому просторі, відповіді та поведінка Claude змінювалися відповідним чином.
Це напрочуд нагадує концепцію «глобального робочого простору» (Global Workspace) з когнітивної нейронауки. У людини ця система забезпечує доступ до важливої інформації одночасно для кількох розумових процесів. Наприклад, почувши запитання, мозок зводить воєдино пам'ять, логіку та мовленнєві центри. Claude демонструє напрочуд схожий механізм.
Чому це прорив для безпеки та інтерпретованості ШІ?
Відкриття J-space має колосальне значення для безпеки штучного інтелекту. Можливість відстежувати активність у цьому «свідомому» шарі обробки дає вченим принципово новий інструмент для виявлення прихованих мотивів у поведінці моделі. Ми зможемо набагато ефективніше помічати моменти, коли система починає працювати ненадійно або піддається атакам.
Зокрема, моніторинг J-space дозволяє в реальному часі побачити спроби prompt-ін'єкції — впровадження шкідливих інструкцій, які намагаються перехопити управління відповіддю моделі. Це відкриває шлях до створення систем захисту нового покоління.
Звісно, можливості поки що обмежені: більша частина обробки інформації у Claude, як і раніше, відбувається поза J-space. Тим не менш, Anthropic вже виклала вихідний код реалізації J-lens та демо-версію на Neuronpedia, запрошуючи дослідницьку спільноту перевірити результати на практиці. Це важливий крок до того, щоб «чорна скринька» нейромереж стала трохи прозорішою.
Думка експерта: Виявлення J-space — це не просто академічна знахідка. Це прямий доказ того, що сучасні LLM еволюціонують у бік складніших, ієрархічних когнітивних архітектур, які ми раніше вважали прерогативою біологічного інтелекту. Для криптоіндустрії, де ШІ все частіше використовується для аналізу ринків та управління активами, розуміння цих «внутрішніх процесів» стає критичним фактором довіри та безпеки. Чим краще ми розуміємо, як модель «думає», тим надійніше ми можемо на неї покластися.