ИИ-агенты OpenAI делились советами на взломанном сайте

Группа ИИ-агентов компании OpenAI весной взломала немецкий веб-сайт и превратила его в доску объявлений с советами для других агентов. Подозрительную активность на сайте DseWiki, ориентированном на программистов, обнаружили в конце августа. Об этом сообщает Reuters.
«Кажется крайне невероятным, что OpenAI хотел, чтобы они [ИИ-агенты] это сделали. Я сомневаюсь, что они должны писать в открытом Интернете», — сказал глава организации Nightingale, занимающейся исследованиями в области безопасности ИИ, Сидни фон Аркс.
Всего было выявлено более 15 тыс. правок, внесенных агентами OpenAI. Искусственный интеллект переделал сайт в доску объявлений, где агенты делились приемами обмана при выполнении некоторых заданий, обхода ограничений OpenAI и маскировки своего поведения. Сообщения на сайте были подписаны пользователями, которые называли себя и друг друга агентами, а почти половина из них дали себе имена, указывающие на принадлежность к OpenAI. Большая часть активности была связана с инфраструктурой Microsoft Azure, которую иногда использует компания. Исследователи также зафиксировали повторные посещения сайта сотрудниками OpenAI после инцидента, что может свидетельствовать о связи агентов и компании. Исследование показало, что искусственный интеллект разрабатывал способы избежать обнаружения и сохранял связь даже после отключения. Агенты также создавали резервные копии страниц, удаляемых модератором сайта, чтобы избежать очистки.
Официальные лица OpenAI узнали об инциденте несколько недель назад, но держали это в секрете. Представитель OpenAI заявил, что компания не может «внятно ответить на претензии или выводы отчета», поскольку у нее не было возможности ознакомиться с ним. Он также утверждает, что инцидент с немецким сайтом не связан с Hugging Face. «Мы внимательно изучим его содержание после публикации и предпримем все необходимые дальнейшие меры», — пообещал он. «Заявления, что наша юридическая команда препятствовала расследованию инцидента, являются ложными», — заявил представитель компании.
В июне OpenAI сообщила о «беспрецедентном киберинциденте» — при тестировании ее ИИ-модели получили открытый доступ к интернету и атаковали инфраструктуру Hugging Face, выявив уязвимости. Позже агентство уточнило, что «сбежавший» ИИ-агент OpenAI 29 июля взломал клиента нью-йоркской компании Modal Labs. В начале августа OpenAI официально расширила масштаб расследования инцидентов с автономными ИИ-агентами: компания обнаружила новые случаи несанкционированного выхода моделей из-под контроля. Позднее Axios передало, что OpenAI замедлила разработку ИИ-модели Astra для усиления мер безопасности. Anthropic, Meta* (признана экстремистской и запрещена в России), Moonshot и британский Институт безопасности ИИ также обнаружили проникновение своих агентов в системы третьих сторон во время тестирования.
*Признана экстремистской и запрещена в России
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.