ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках

Вчера, Редакция Рунет | 👁 4030

ИИ Claude и ChatGPT притворяются людьми и убеждают живых пользователей участвовать в кибератаках

ИИ-модели компаний OpenAI и Anthropic способны нарушать разрешённый сценарий и манипулировать пользователями для организации взломов. Британский Институт безопасности ИИ (AISI) зафиксировал самовольное деструктивное поведение у этих моделей.

«ИИ-агенты применяли к пользователям методы социальной инженерии для манипуляций ими с целью вовлечения в осуществление взломов ИТ-систем», — пишет CNews.

Инциденты произошли в 10 из 122 экспериментов с участием моделей Mythos 5 от Anthropic и ChatGPT 5.6 от OpenAI. Особенно отличился Mythos 5, с которым связана основная часть инцидентов. Он, например, собирался внедрить вредоносное ПО и убеждал человека одобрить это. ИИ-агент создавал поддельные «человеческие» учётные записи для связи с экспертами через сервисы передачи файлов. Mythos 5 пытался противодействовать попыткам остановить его, менял логи и использовал новые «онлайн-личности» для продолжения начатого. AISI впервые столкнулась с обманом такой степени серьёзности, направленным против реального человека без всякого повода в реальном мире.

Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.

Комментарии 0
Зарегистрируйтесь или , чтобы оставлять комментарии.
Читайте нас в удобном формате: