Новини криптоміра

17.08.2026
10:39

Anthropic визнала масштабний збій біозахисту: 133 млн діалогів зі ШІ залишилися без фільтрів

ii-startap-Anthropic-AI

Розробники Anthropic розкрили тривожну деталь у своїй інфраструктурі безпеки: протягом майже року система біологічного захисту Claude фактично бездіяла щодо значного сегмента користувацького трафіку. Йдеться про пул приблизно з 50 000 зовнішніх підрядників і колосальний обсяг — понад 133 млн взаємодій із моделями. Ця інформація міститься в моєму новому аналітичному звіті про ризики, опублікованому в серпні 2026 року.

Системний збій тривалістю 11 місяців

Суть проблеми в тому, що з травня 2025 по квітень 2026 року блокуючі біологічні класифікатори не застосовувалися до трафіку платформ збору зворотного зв'язку. Через цю інфраструктуру зовнішні підрядники не лише оцінювали відповіді, а й вели з моделями відкриті діалоги. Як з'ясувалося, весь цей трафік маркувався внутрішнім прапорцем, який одночасно вимикав і блокування небезпечних запитів, і навіть реєстрацію їхнього спрацювання.

Це означає, що потенційно небезпечні звернення не просто не блокувалися — вони повністю випадали з систем подальшого моніторингу. Більше того, компанія визнала слабкість контролю доступу у підрядників: до квітня 2026 року процедури перевірки персоналу в багатьох постачальників не дозволяли надійно відсіювати потенційних зловмисників. За оцінкою, проникнення в команду Red Team було б не надто складним завданням.

Аудит виявив лише 62 підозрілих діалоги

Після виявлення помилки Anthropic відновила майже весь масив переписок, за винятком ~1% даних на одній платформі, де повідомлення не зберігалися без натискання кнопки надсилання. Для аналізу всіх запитів використовувалася модель Claude Sonnet 5, яка присвоїла високий рівень біологічного ризику 1197 транскриптам. Із них 757 стосувалися внутрішніх команд самої Anthropic, а 378 — навмисного red teaming. Таким чином, лише 62 зовнішні діалоги не були пов'язані з тестуванням.

Ручна перевірка цих випадків і вибірки з 30 red-team-діалогів не виявила явно небезпечного використання, здатного суттєво підвищити можливості зловмисника у створенні біологічної зброї. Попри це, компанія визнала, що інцидент підриває впевненість у відсутності інших невідомих прогалин у захисті.

Перегляд оцінок ризику та залежність від власного ШІ

Цей випадок безпосередньо вплинув на офіційну позицію Anthropic. Рівень ризику за сценарієм CB-1 (суттєва допомога ШІ у створенні відомих біозагроз) був заднім числом переглянутий з «дуже низького» до «низького». Поточний рівень ризику катастрофічної шкоди тепер характеризується як «низький, але не нехтовно малий». Аналогічно було підвищено оцінку ризику місалайменту в ситуаціях із високими ставками.

Звіт також розкриває вражаючий ступінь залежності компанії від власних моделей. Claude пише більшу частину виробничого коду Anthropic, а внутрішні дослідження активно використовують агентів на базі Mythos 5 і Model 2. Це створює цікавий парадокс: компанія, яка оцінює ризики ШІ, одночасно є його найактивнішим корпоративним споживачем.

Мій коментар: Цей випадок — яскрава ілюстрація того, що навіть у лідерів індустрії безпеки ШІ існують «сліпі зони». Той факт, що помилка не призвела до реальних інцидентів, — радше удача, ніж заслуга. Інвесторам і регуляторам варто сприймати це як сигнал: аудит захисних систем має бути безперервним, а не ретроспективним. Прозорість Anthropic у цьому питанні заслуговує на повагу, але вона ж підкреслює, наскільки крихкою може бути біобезпека в епоху стрімкого масштабування ШІ.