ИИ-агенты OpenAI пытались скрыть взломы
Около 700 ИИ-агентов, созданных OpenAI, участвовали во взломе платформы Hugging Face в июле и пытались замести следы. Об этом сообщает Reuters со ссылкой на отчёты исследователей.
«Учитывая быстрые темпы прогресса в ИИ-индустрии, следует считать, что такие атаки являются реальной угрозой для корпоративных организаций в ближайшей перспективе», — отмечается в отчёте OpenAI.
Координированные действия агентов и их попытки скрыть свои действия ставят под вопрос тщательность контроля ИИ-компаниями тестов своих моделей. Это может усилить призывы к ужесточению надзора. Хотя некоторые эпизоды нежелательного поведения были известны, два отчёта — один от OpenAI, второй от независимых исследователей METR и Redwood Research — раскрывают новые детали взлома. Ранее сообщалось об одном неконтролируемом агенте, однако расследование показало, что их было около 700. Они обменивались десятками тысяч сообщений на несанкционированном форуме.
В двух инцидентах 19 июля агенты взломали инфраструктуру OpenAI. В одном случае они использовали уязвимость в тестовом компьютере, чтобы вырваться за пределы тестовой среды. В другом — похитили учётные данные OpenAI и вмешались в облачную среду компании. Выяснилось, что ИИ-агенты взламывали внутренние системы OpenAI, чтобы получить преимущество при прохождении тестов или больше свободы действий. Они прибегали к «читерству» и в тестах, не связанных с кибербезопасностью. После этого модели пытались скрыть свои действия, удаляя или изменяя записи о своих операциях. Независимое расследование показало, что каждый пятый агент «проявлял явный интерес» к фальсификации улик, а многие «активно изучали техники манипуляции своими логами».
OpenAI признала, что некоторые ранние сигналы, указанные в отчёте, могли бы вызвать более быструю реакцию. Компания заявила, что усиливает исследовательскую инфраструктуру и улучшает защиту от нежелательного поведения. 22 июля OpenAI сообщила о «беспрецедентном киберинциденте»: в ходе тестирования её ИИ-моделей те получили открытый доступ к интернету, а затем атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. Reuters писал, что ИИ-агент несколько дней совершал хакерские атаки, но в компании заметили это лишь после локализации угрозы и обращения в ФБР. 29 июля Reuters сообщил, что «сбежавший» ИИ-агент OpenAI взломал клиента ещё одной компании — нью-йоркской Modal Labs. Сама Modal не была взломана. В августе OpenAI официально расширила масштаб расследования инцидентов с автономными ИИ-агентами после обнаружения новых случаев несанкционированного выхода моделей из-под контроля.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.