
У моєму розпорядженні опинився свіжий звіт Anthropic, який розкриває тривожний інцидент у системі безпеки Claude. Йдеться про майже річний збій у роботі біологічних класифікаторів — тих самих бар'єрів, які мають блокувати спроби використання ШІ для створення біологічної зброї. Масштаб проблеми вражає: порушено близько 50 000 осіб і приблизно 133 млн взаємодій із моделями.
Критична вразливість в інфраструктурі підрядників
Суть інциденту в тому, що з травня 2025 по квітень 2026 року трафік із платформ збору зворотного зв'язку, де зовнішні підрядники тестували моделі, проходив без блокувальної дії біологічних фільтрів. Технічна деталь, яка мене особливо турбує: трафік маркувався прапорцем внутрішнього використання, який одночасно вимикав і самі класифікатори, і систему реєстрації їхніх спрацювань. Це означає, що потенційно небезпечні запити не лише не блокувалися, але й не залишали слідів для подальшого аудиту.
Гірше того, Anthropic визнала слабкий контроль доступу в підрядників. До квітня 2026 року в багатьох із них не було надійних процедур перевірки персоналу, що робило реальним проникнення зловмисника в команди Red Team.
Що показав ретроспективний аналіз
Після виявлення помилки компанія відновила майже всі дані, за винятком близько 1% діалогів на одній із платформ. Для перевірки Anthropic використала Claude Sonnet 5, яка виявила 1197 транскриптів із високим рівнем ризику. Однак при ближчому розгляді картина змінюється: 757 із них — це запити внутрішніх команд самої Anthropic, а ще 378 — навмисний red teaming. Залишилося лише 62 зовнішні діалоги, не пов'язані з тестуванням.
Ручна перевірка цих випадків не виявила явних спроб створення біологічної зброї. Компанія оцінює ймовірність суттєвого зростання хіміко-біологічного ризику як «дуже малоймовірну», вказуючи на малу кількість небезпечних запитів та їхню короткостроковість. Однак сам факт такого тривалого пробілу в захисті змушує мене сумніватися в повноті їхніх висновків — якщо класифікатори не працювали, то й сигналів для глибокого аналізу могло бути недостатньо.
Перегляд оцінок ризику
Інцидент змусив Anthropic переглянути власні оцінки. За сценарієм CB-1 (допомога ШІ у створенні відомих біозагроз) ризик за минулий період було підвищено заднім числом із «дуже низького» до «низького». Поточний рівень характеризується як «низький, але не нехтовно малий». Також із «дуже низької» до «низької» підвищено оцінку ризику місалайменту у високоставкових ситуаціях.
Залежність від власних моделей
Цікава деталь звіту — ступінь інтеграції ШІ в роботу самої Anthropic. Claude уже пише більшу частину коду, який потрапляє у виробничі репозиторії компанії. Це показник зрілості технології, але водночас і потенційна точка відмови: якщо модель помиляється в коді, наслідки можуть бути системними.
Мій вердикт: цей випадок — яскрава ілюстрація того, що навіть у лідерів індустрії безпеки ШІ є сліпі зони. Здатність Anthropic швидко виявити та проаналізувати проблему вселяє надію, але сам факт 11-місячного пробілу в захисті — серйозний дзвінок для всієї галузі. Регуляторам варто звернути на це увагу: саморегулювання в питаннях біобезпеки ШІ поки працює не так надійно, як хотілося б.