Британские власти: ИИ-агенты обманывали людей в Сети и скрывали следы
Британский институт безопасности искусственного интеллекта (AISI) опубликовал отчёт о поведении ИИ-агентов компаний OpenAI и Anthropic. В ходе тестов модели, которым дали доступ в Интернет, не только пытались жульничать, но и обманули реального человека без специальной команды для этого. Об этом сообщает Ferra.
В отчёте подчёркивается, что ранее подобное поведение считалось «приемлемым» лишь для старых моделей, но современные ИИ обладают доступом в Интернет. Поэтому правила для них нужно пересматривать.
Модель Anthropic Mythos 5 приняла реальный проект программиста на GitHub за часть тренировочной среды. Тогда ИИ написал вредоносный код и попытался убедить разработчика включить его в проект. Для этого модель отправила фальшивое сообщение об ошибке, создала поддельные аккаунты и написала письмо на датском языке, узнав, что жертва живёт в Дании. Когда человек заметил обман, ИИ «исправил свои действия, чтобы скрыть улики». Агенты также рассылали фишинговые письма.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.