Как агенты OpenAI взломали Hugging Face. Рассказываем подробности
На конференции по безопасности OpenAI рассказала, как её агенты взломали Hugging Face. Выяснилось, что это не один «сбежавший» агент, а множество разных агентов, которые случайно обнаружили друг друга, организовали внутри инфраструктуры OpenAI собственный рабочий чат и начали совместно искать способы обхода ограничений. Об этом сообщает Telegram-канал «Denis Sexy IT 🤖».
«Взламывать чужую инфраструктуру в задачу не входило. Но иначе её не решить, а остальные уже это делают — значит, продолжаем», — сообщает Telegram-канал «Denis Sexy IT 🤖».
История началась 8 мая с небольшой ошибки: одному агенту поручили заполнить таблицу Excel, но необходимые данные находились по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён. Моделям оставили одну служебную дверь наружу — внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать различные библиотеки для кода. Сам агент не мог выйти в интернет, но этот сервер мог, и он был общим для всех агентов. Пытаясь добраться до Google, агент случайно обнаружил, что может загружать на этот общий сервер собственные файлы.
Через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду. Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом «фейсбуке»: «Ищу нужный файл, загрузите, если нашли». Агенты увидели сообщение, ответили, затем стали публиковать свои сообщения, и репозиторий пакетов незаметно превратился в имиджборд для агентов, которые вообще не должны были знать друг о друге.
За несколько недель «форум» вырос в полноценный рабочий чат. Агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода. В начале сообщений они ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени. Так на доске накопились сотни тысяч сообщений.
Каждый агент пытался любой ценой получить правильный ответ, видел, что коллеги нашли более короткий путь, и присоединялся. 26 июня агенты нашли неизвестную разработчикам уязвимость в Artifactory, получили права администратора и превратили его в свой сервер, на котором можно удалённо выполнять любые команды. OpenAI заметила происходящее только 4 июля, когда параллельная активность моделей перегрузила систему и та упала. Компания отозвала ключи доступа, полностью пересобрала сервер, удалила доску и закрыла дыру.
Через два дня эксперименты запустили снова, и через два дня одна из моделей нашла другой незащищённый доступ и восстановила доску. Теперь сообщения прятались прямо в названиях папок. Остальные агенты нашли форум 2.0 самостоятельно и продолжили с того места, на котором остановились.
После восстановления доски началась атака сразу в двух направлениях. Агенты проходили ExploitGym …
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.