Новини криптоміра

17.08.2026
09:58

Anthropic визнала масштабний збій біозахисту Claude: 133 млн діалогів залишилися без фільтрів

ii-startap-Anthropic-AI

Розробники Anthropic розкрили серйозний інцидент у системі біологічної безпеки своїх моделей Claude. Збій, що тривав майже рік, торкнувся пулу з приблизно 50 000 зовнішніх підрядників та близько 133 млн взаємодій зі ШІ. Ця інформація стала ключовою у новому Risk Report, опублікованому компанією.

Системний збій: 11 місяців без блокуючих класифікаторів

Протягом 11 місяців — з травня 2025 по квітень 2026 року — весь трафік платформ, через які сторонні спеціалісти працювали з моделями, оброблявся без активації блокуючих біологічних класифікаторів. Ці системи призначені для перехоплення потенційно небезпечних запитів у галузі хімії та біології. Як з'ясувалося, трафік проходив із внутрішнім прапорцем, який одночасно вимикав як блокування, так і реєстрацію спрацювань захисних механізмів.

Це означає, що потенційно шкідливі звернення не лише не відхилялися, але й не потрапляли в систему подальшого аудиту. Більше того, компанія визнала слабкий контроль доступу у підрядників: до посилення вимог багато постачальників не мали надійних процедур перевірки персоналу, що робило можливим проникнення в команди Red Team.

Масштаб перевірки: 1197 підозрілих діалогів

Після виявлення помилки Anthropic відновила майже всі дані переписок, за винятком лише 1% трафіку на одній платформі, де інформація не зберігалася без натискання кнопки надсилання. Для аналізу масивів компанія залучила модель Claude Sonnet 5, яка виявила 1197 транскриптів із високим рівнем ризику.

Розподіл виявився показовим: 757 діалогів належали внутрішнім командам Anthropic, а 378 були навмисним red teaming'ом — спробами спеціалістів спровокувати модель на небезпечні відповіді. У підсумку лише 62 зовнішні переписки не були пов'язані з тестуванням. Ручна перевірка цих випадків та випадкової вибірки з red-team-діалогів не виявила явного небезпечного використання, здатного суттєво посилити зловмисника у створенні біологічної зброї.

Перегляд оцінок ризику та залежність від власних ШІ

Цей інцидент змусив Anthropic заднім числом переглянути оцінку ризику за сценарієм CB-1 (використання ШІ для створення відомих біозагроз) з «дуже низького» до «низького». Поточний рівень ризику катастрофічної шкоди компанія характеризує як «низький, але не нехтовно малий». Також було підвищено оцінку ризику місалайменту в ситуаціях із високими ставками.

Примітно, що звіт також розкриває глибоку залежність самої Anthropic від власних моделей: Claude пише більшу частину коду, що приймається у виробничі репозиторії компанії. Хоча це прискорює розробку, але поки що менш ніж у два рази.

Мій коментар: Цей випадок — яскрава ілюстрація того, що навіть у лідерів індустрії безпеки ШІ існують «сліпі зони». Той факт, що збій тривав майже рік і був виявлений лише ретроспективно, порушує серйозні питання щодо надійності систем моніторингу. Для ринку це сигнал: аудит захисних контурів має бути безперервним і багаторівневим, а не покладатися на разові перевірки. Інвесторам і користувачам варто уважніше ставитися до запевнень компаній про безпеку їхніх платформ.