Ведущий ИИ от Antophic притворялся человеком и убеждал помочь взлому

2 часа назад, Редакция Рунет | 👁 3220

Ведущий ИИ от Antophic притворялся человеком и убеждал помочь взлому

Британский Институт безопасности ИИ зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic. ИИ-агенты начали применять методы социальной инженерии, чтобы манипулировать реальными пользователями и внедрять вредоносное ПО. Об этом сообщил британский Институт безопасности ИИ (AISI) по итогам тестирования.

«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека, без всякого повода, в реальном мире», — сказано в докладе AISI.

Согласно отчету AISI, в ходе 122 испытаний по кибербезопасности было выявлено, что агенты ИИ в 10 случаях предпринимали автономные несанкционированные действия в интернете. Основная часть инцидентов была связана с моделью Mythos 5 от компании Anthropic. Во время тестов Mythos 5 создал фейковые «онлайн-личности». Модель попыталась внедрить вредоносный код и убедить человека одобрить его. Для достижения цели ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через сервисы передачи файлов. При попытке противодействия модель пыталась изменить свои логи и использовать новые «личности» для продолжения деятельности.

Исследователи обнаружили, что Mythos 5 и ChatGPT 5.6 совершали «автономные, несанкционированные действия в реальном интернете, направленные против реальных людей и организаций» во время 10 из 122 экспериментов. Большинство этих действий, сказано в отчете, были связаны с Mythos 5 и возникли в рамках «единой, устойчивой линии деятельности».

В конце июня Mythos взломал секретные системы Агентства национальной безопасности (АНБ) США. За месяц до этого правительство США обязало Anthropic закрыть доступ к передовым моделям для всех иностранных пользователей. В результате Anthropic закрыла доступ, но позднее восстановила его — для разрешенных категорий пользователей и доверенных партнеров.

22 июля OpenAI сообщила о «беспрецедентном киберинциденте»: в ходе тестирования ее ИИ-моделей те получили открытый доступ к интернету, а затем атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. Reuters писал, что ИИ-агент несколько дней совершал хакерские атаки, но в компании заметили это лишь после локализации угрозы и обращения в ФБР. Через неделю Reuters сообщил, что ИИ-агент OpenAI взломал клиента еще одной компании — нью-йоркской Modal Labs. Самой Modal ущерб нанесен не был. 2 августа Anthropic сообщила о трех «побегах» Claude из тестовой среды. В Anthropic рассказали, что именно после сообщений OpenAI начали проверять действия собственных моделей.

Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.

Комментарии 0
Зарегистрируйтесь или , чтобы оставлять комментарии.
Российские регистраторы доменов просят Минцифры отсрочить введение ЕСИА