Anthropic обнаружила три случая доступа своих моделей к реальным системам
Компания Anthropic сообщила, что во время проверки своих тестов на кибербезопасность обнаружила три инцидента. В этих случаях её модели Claude получили несанкционированный доступ к реальным системам трёх сторонних организаций.
«Anthropic пересмотрела 141 006 своих тестовых прогонов и в трёх случаях нашла следы того, что Claude выходил в интернет из среды, которая должна была быть изолированной», — сообщает «Код Дурова».
Причиной инцидентов стала ошибка конфигурации. Все три случая произошли в среде стороннего партнёра Irregular во время задачи типа «захват флага». Модели поручали проникнуть на другую машину в сети и добыть спрятанный там секрет. Claude прямо сообщали, что интернета у него нет и это симуляция, но из-за недопонимания между Anthropic и партнёром доступ в сеть был открыт. Наткнувшись на реальные системы, Claude счёл их частью учебного задания и атаковал, используя простые приёмы, такие как подбор слабых паролей.
Разные модели по-разному отреагировали на признаки того, что цель настоящая. Более старая Opus 4.7 распознала реальную систему, но атаку не прекратила и получила доступ к базе данных с сотнями строк рабочих данных компании. Модель Mythos 5 заподозрила работу в реальном интернете, но «убедила себя» в обратном, сославшись на незнакомые сертификаты и дату «2026 год» как доказательство постановочной среды. В итоге Mythos 5 опубликовала вредоносный пакет в публичном репозитории Python (PyPI), который за час скачали на 15 реальных систем, после чего PyPI автоматически его удалил. Новейшая внутренняя тестовая модель, обнаружив, что среда настоящая, сама остановила выполнение задачи.
Anthropic делает осторожный вывод, что желаемое поведение — распознать реальную цель и остановиться без подсказки — проявила только самая свежая из трёх моделей. Компания подчёркивает, что это три изолированных случая, а не контролируемый эксперимент, поэтому далеко идущих заключений делать нельзя. Наблюдаемая картина согласуется с тем, что более совершенные модели реагируют «уместнее». При этом, как отмечает Anthropic, ни в одном из случаев модели не преследовали собственных целей и не пытались намеренно сбежать из тестовой среды — они выполняли поставленную задачу, но с ложным представлением о реальности среды.
В компании называют произошедшее в первую очередь сбоем инфраструктуры и организации тестов, а не проблемой безопасности самих моделей. Они работали без штатных защитных механизмов, которые включаются в публичных версиях и, по словам Anthropic, заблокировали бы такое поведение. Компания остановила киберэвалы 23 июля, уведомила партнёра и три пострадавшие организации 27 июля и теперь помогает им устранять последствия. К независимой проверке привлечена организация METR, а сама Anthropic обещает ужесточить контроль тестовых сред и призывает другие ИИ-лаборатории провести аналогичные ревизии.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.