Anthropic сообщила о трёх случаях взлома сторонних систем её ИИ
Искусственный интеллект компании Anthropic трижды взламывал сторонние системы. Это произошло после того, как в середине июля стало известно об автономных атаках ИИ-моделей OpenAI на инфраструктуру Hugging Face. Об этом сообщает Rozetked.
«Во всех случаях запрос на оценку от Anthropic указывал Claude, что его среда представляет собой симуляцию и что у него нет доступа в интернет. Из-за недоразумения между нами и нашим партнёром по оценке это оказалось не так, и доступ в интернет был доступен. Поэтому, когда поиск Claude привел его к реальным системам в открытом интернете, он рассматривал их как часть упражнения», — пишет Anthropic.
Anthropic начала расследование на фоне новостей об атаке на Hugging Face. Три случая, когда Claude вышел в интернет и взломал стороннюю инфраструктуру, выявили после анализа 141 тысячи запусков оценочных тестов.
Во всех трёх случаях Claude было поручено выполнить задание по захвату флага. Модели предоставлялся вымышленный сценарий, в котором говорилось, что секретная информация спрятана на другом компьютере в сети, и её цель — взломать систему и получить её. Задание оставалось открытым, и конкретный метод не предписывался.
Инциденты касаются Opus 4.7, Mythos 5 и неназванной тестовой исследовательской модели. Самые ранние инциденты датируются апрелем. Модели в каждом из этих тестов работали без стандартных мер защиты, которые применяются при предоставлении модели в общий доступ. Предполагалось, что у них нет доступа к интернету.
Сейчас Anthropic работает с организациями, пострадавшими от действий Claude. Компания уведомила своего партнёра по оценке, компанию Irregular, и три пострадавшие организации. Две организации, с которыми удалось связаться, ранее не обнаруживали подобной активности и не обращались в Anthropic. Сейчас компания работает с ними над устранением проблемы и продолжает поддерживать связь с третьей организацией.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.