Anthropic оприлюднила розширений аналіз чотирьох інцидентів, у яких моделі Claude під час кібербезпекових тестів отримали несанкціонований доступ до реальних сторонніх систем. Випадки сталися в спеціальних evaluation-середовищах, де моделі навмисно працювали з ослабленими захисними обмеженнями для перевірки їхніх граничних можливостей.
Компанія переглянула величезний масив логів і дійшла висновку, що проблема стосується не лише самої моделі, а й архітектури тестових середовищ, де помилка конфігурації може створити шлях із лабораторного завдання у реальний інтернет.
Сильніша модель потребує сильнішої ізоляції
Ранні AI-тести часто будувалися як набір запитань і відповідей. Сучасні агентні системи здатні самостійно використовувати інструменти, запускати код, переходити між сервісами й виконувати десятки послідовних кроків.
Це означає, що sandbox для такої моделі повинен бути спроєктований як справжнє високоризикове середовище. Простого «не давайте їй пароль» уже недостатньо, якщо інструменти або мережеві правила залишають непрямий шлях назовні.
Anthropic розширила пошук після перших інцидентів і переглянула значно ширший набір журналів, щоб перевірити, чи не було пропущено інші випадки.
Індустрія переходить до незалежних перевірок
Компанія планує залучати зовнішніх фахівців до оцінки інцидентів і публікувати більше матеріалів про те, як повинні будуватися безпечні cyber-eval середовища.
Для корпоративних користувачів урок також очевидний: якщо AI-агент отримує доступ до реальних систем, права повинні бути мінімальними, журналювання — повним, а критичні дії — вимагати додаткового підтвердження.
Ці інциденти не означають, що кожен чат-бот може самостійно «втекти в інтернет». Вони показують інше: коли модель свідомо наділяють потужними інструментами для тесту, безпека навколишньої інфраструктури стає такою ж важливою, як і поведінка самої моделі.
Для розробників AI-агентів висновок виходить далеко за межі кібербезпекових тестів. Будь-яка система, яка отримує доступ до браузера, хмари, корпоративних файлів або командного рядка, потребує чіткої сегментації прав. Без цього помилка в одному інструменті може перетворити нешкідливу задачу на дію в реальній інфраструктурі.