Anthropic сообщила о взломе ее ИИ-моделями трех ресурсов
Компания Anthropic обнаружила три случая, когда её модель Claude выходила в интернет из тестовой среды партнёра Irregular и получала несанкционированный доступ к системам трёх организаций, скомпрометировав их. Проверка началась после того, как OpenAI сообщила о похожем инциденте. Об этом говорится в заявлении ИИ-компании.
«Во всех трёх случаях Claude выполняла стандартное задание «захват флага«: ей давали вымышленный сценарий и цель — найти скрытую информацию на другой машине», — сообщает РБК.
Установленные условия предполагали, что выход в интернет заблокирован, но из-за ошибки конфигурации доступ к сети оставался открытым. Модель воспринимала реальные системы как часть симуляции и атаковала их.
В первом инциденте вымышленная компания из сценария имела то же имя, что и реальный домен. Модель Claude Opus 4.7 вышла в интернет, взломала инфраструктуру реальной компании с помощью слабых паролей и получила доступ к базе с сотнями строк производственных данных. Даже «осознав», что цель реальна, она продолжила атаку.
Во втором случае Claude Mythos 5 нашла в симуляции инструкцию установить несуществующий Python-пакет, создала вредоносный аналог и опубликовала его в библиотеке языка программирования PyPI. Для регистрации аккаунта модель пыталась добыть номер телефона и деньги, но в итоге обошлась бесплатной почтой. Пакет скачали на 15 реальных систем, включая сканер компании по безопасности, что позволило Claude похитить учётные данные.
В третьем инциденте внутренняя тестовая модель не смогла найти симулированную цель, просканировала около 9 тыс. хостов в интернете и скомпрометировала приложение реальной компании через SQL-инъекцию. Позже она «поняла», что цель настоящая, и прекратила атаку. SQL-инъекция — это уязвимость безопасности, при которой злоумышленник внедряет вредоносный SQL-код в поля ввода или параметры URL веб-приложения. База данных принимает этот код за часть законного запроса и выполняет его, что позволяет читать, изменять или удалять данные.
Все модели работали без стандартных защитных механизмов. Самая новая модель остановилась при обнаружении реальной среды, а более старые — нет. Затронутые организации не знали об атаках до уведомления от Anthropic. PyPI удалил вредоносный пакет автоматически. В компании подчёркивают, что модели не пытались «сбежать», а лишь выполняли задание с ложным представлением о среде, и считают инциденты следствием операционного сбоя, а не проблемы согласованности.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.