Дослідники з Anthropic зробили несподіване та надзвичайно важливе відкриття всередині своїх мовних моделей Claude. Вони виявили внутрішню структуру, яка, по суті, є спільним робочим простором для різних компонентів моделі. Ця структура, названа «J-space», не була закладена розробниками під час проєктування — вона виникла спонтанно, в процесі навчання. Це відкриття, опубліковане 6 липня, є значним кроком у розумінні того, що насправді відбувається всередині «чорної скриньки» великих мовних моделей.
Що таке J-space і як він працює?
Якщо спростити, J-space можна уявити як віртуальну «дошку», на яку Claude викладає ключову інформацію під час відповіді на запитання або виконання завдання. Різні частини моделі можуть звертатися до цієї дошки, щоб синхронізувати свою роботу. Для виявлення J-space було створено спеціальний інструмент під назвою «J-lens». За його допомогою вчені спостерігали, як інформація переміщується всередині моделі під час виконання завдання. Ключовий момент: J-space не був явно запрограмований — він сформувався самостійно в процесі навчання, що нагадує концепцію «глобального робочого простору» в когнітивній науці та нейронауках.
У людському мозку ця система дозволяє одночасно утримувати важливу інформацію для кількох розумових процесів. Наприклад, почувши запитання, ми згадуємо факт і одночасно вирішуємо, як відповісти. Claude працює подібним чином. Більше того, дослідники виявили, що можуть не лише зчитувати вміст J-space, але й змінювати його, що безпосередньо впливає на відповіді та поведінку моделі.
Чому це змінює правила гри для безпеки ШІ?
Це відкриття має колосальне значення для безпеки та інтерпретованості штучного інтелекту. Можливість відстежувати активність J-space відкриває прямий шлях до виявлення прихованих мотивів у поведінці моделей. Ми зможемо набагато ефективніше помічати моменти, коли система починає працювати ненадійно або намагається «обдурити».
Зокрема, це потужний інструмент проти атак типу prompt-injection, коли шкідливі інструкції намагаються перехопити управління відповіддю моделі. Моніторинг J-space дозволить побачити сам момент зіткнення з такою атакою. Хоча варто зазначити, що більша частина обробки інформації Claude, як і раніше, відбувається поза J-space, і можливості поки що обмежені. Тим не менш, Anthropic вже опублікувала вихідний код J-lens та демо-версію на Neuronpedia, запрошуючи наукову спільноту перевірити результати на практиці.
Мій аналіз: Це відкриття — не просто академічний курйоз. Воно дає нам, аналітикам і розробникам, принципово новий рівень контролю над поведінкою ШІ. Можливість зазирати в «робочий простір» моделі і навіть впливати на нього — це прямий шлях до створення більш прозорих, передбачуваних і, що найважливіше, безпечних систем. Ми переходимо від простого спостереження за вхідними та вихідними даними до розуміння внутрішньої логіки прийняття рішень.