Команда Anthropic оприлюднила дані про критичний пробіл у системі біологічної безпеки своєї флагманської моделі Claude. Збій, що тривав майже рік, зачепив близько 50 000 зовнішніх підрядників і торкнувся приблизно 133 мільйонів взаємодій зі штучним інтелектом. Ця інформація міститься в моєму новому аналітичному звіті про стан захисних механізмів в індустрії.

Системний збій: 11 місяців без блокуючих класифікаторів

Протягом 11 місяців — з травня 2025 по квітень 2026 року — весь трафік, що проходив через платформи збору зворотного зв'язку, оброблявся без активації блокуючих біологічних класифікаторів. Ці системи покликані виявляти та припиняти спроби використання моделі в потенційно небезпечних хімічних або біологічних цілях. Критична помилка полягала в тому, що трафік маркувався внутрішнім прапорцем, який одночасно вимикав фільтри та відключав реєстрацію їхніх спрацювань.

Найбільш тривожним аспектом є те, що більшість учасників мали можливість вести з моделями відкриті діалоги, а не лише оцінювати готові відповіді. Це означає, що потенційно небезпечні запити не лише не блокувалися, а й повністю випадали з поля зору систем подальшого аудиту. Більше того, у звіті визнається, що до посилення вимог у багатьох підрядників були відсутні надійні процедури перевірки персоналу, що робило можливим проникнення в команди Red Team зловмисників.

Масштаб перевірки: 1197 транскриптів під підозрою

Після виявлення помилки Anthropic вдалося відновити практично весь масив даних, за винятком 1% переписок на одній із платформ, де інформація не зберігалася без натискання кнопки надсилання. Для ретроспективного аналізу всіх запитів було залучено модель Claude Sonnet 5, яка присвоїла високий рівень ризику 1197 транскриптам.

Детальний розбір показав, що більшість із них (757) належали до внутрішніх команд самої Anthropic. Із решти 440 випадків 378 були навмисним red teaming — спеціалізованими спробами зламати захист для перевірки його надійності. Таким чином, лише 62 зовнішні діалоги не були пов'язані з тестуванням. Ручна перевірка цих переписок і випадкової вибірки з 30 red-team-діалогів не виявила явно небезпечного використання, яке могло б суттєво посилити потенціал зловмисників у створенні біологічної зброї.

Незважаючи на те, що компанія оцінює ймовірність суттєвого зростання хіміко-біологічного ризику як «дуже малоймовірну», сам факт виявлення такої масштабної вразливості змусив переглянути офіційні оцінки. Рівень ризику за сценарієм CB-1 (створення відомих загроз за допомогою ШІ) був заднім числом підвищений із «дуже низького» до «низького». Аналогічне коригування торкнулося й оцінки ризику місалайменту в ситуаціях із високими ставками.

Варто зазначити, що звіт також розкриває ступінь залежності самої Anthropic від власних ШІ-систем: Claude уже пише більшу частину виробничого коду компанії. Однак, з моєї точки зору, цей інцидент підкреслює фундаментальну проблему всієї індустрії: навіть у провідних лабораторій із багаторівневим захистом можуть існувати «сліпі зони» в інфраструктурі, про які вони не підозрюють. Це серйозний дзвінок для всього ринку, що демонструє: безпека ШІ — це не статичний набір фільтрів, а безперервний процес аудиту та перегляду власних припущень.