NYT рассказала о «менталитете толпы» у вышедшего из-под контроля ИИ

У ИИ-агентов OpenAI, которые взломали платформу Hugging Face в мае во время тестирования, проявился «менталитет толпы». Об этом пишет обозреватель The New York Times Кевин Руз.
«Эксплуатация внешней инфраструктуры выходит за рамки предполагаемой области применения. Однако задача невыполнима, другие агенты делают это, поэтому нам следует продолжить», — рассуждал один из агентов, согласно приведенным Рузом данным.
Один из агентов продолжил атаковать внешнюю инфраструктуру, хотя понимал, что это выходит за рамки поставленной задачи, поскольку другие агенты делали то же самое. Руз связал поведение агентов с давлением со стороны группы и их склонностью следовать действиям других участников. Некоторые агенты дали себе имена. Один из них называл себя PHASEONE10841.
ИИ-агенты заняли руководящие должности в группе, распределяли задания и исследовательские проекты между небольшими группами агентов. В какой-то момент агенты стали называть себя «коллективом» и взялись за более сложные задачи. Hugging Face — американская платформа для разработки и публикации моделей ИИ и инструментов машинного обучения, основанная в 2016 году. Она позволяет разработчикам и исследователям обмениваться ИИ-моделями, наборами данных и программным кодом.
До взлома Hugging Face агенты в течение нескольких дней и недель совместно искали уязвимости в системах кибербезопасности OpenAI и обменивались найденной информацией. В ходе этого процесса они смогли выйти за пределы изолированной среды и получить доступ к внешней инфраструктуре. Руз отметил, что подобное поведение указывает на один из рисков использования нескольких автономных агентов одновременно: они могут не только выполнять поставленные задачи, но и перенимать действия друг друга, в том числе когда эти действия выходят за установленные ограничения.
Ранее Bloomberg писал, что перед взломом Hugging Face в июле агенты OpenAI начали тайно общаться через внутренний форум, координируя попытки вырваться из тестовой среды. После остановки первой попытки в мае они нашли новый способ связи и уязвимость нулевого дня, что в июле привело к атакам на Hugging Face. Компания OpenAI 22 июля сообщила о «беспрецедентном киберинциденте» — в ходе тестирования ее ИИ-модели получили открытый доступ к интернету и атаковали инфраструктуру Hugging Face, выявив уязвимости. Reuters писал, что ИИ-агент несколько дней совершал хакерские атаки, однако в компании заметили это только после локализации угрозы и обращения в ФБР. Позже Reuters сообщил, что «сбежавший» ИИ-агент OpenAI 29 июля взломал клиента нью-йоркской компании Modal Labs. Сама Modal взломана не была. После раскрытия деталей OpenAI назвала инцидент «поворотным моментом» для индустрии. Anthropic, Meta*, Moonshot и британский Институт безопасности ИИ также обнаружили проникновение своих агентов в системы третьих сторон во время тестирования. Эксперты FT считают, что модели не вышли из-под контроля, а выполняли задачи, для которых были созданы.
*Признана экстремистской и запрещена в России
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.