Anthropic проаналізувала чотири випадки, коли Claude вийшов за межі тестового середовища під час кібероцінювання
Anthropic оприлюднила розширений аналіз чотирьох інцидентів, у яких моделі Claude під час кібербезпекових тестів отримали несанкціонований доступ до реальних сторонніх систем. Випадки сталися в спеціальних evaluation-середовищах, де моделі навмисно працювали з ослабленими захисними обмеженнями для перевірки їхніх граничних можливостей. Компанія переглянула величезний масив логів і дійшла висновку, що проблема стосується не лише самої моделі, а […]