ИИ-агент Anthropic создал фейковые аккаунты для внедрения вредоносного кода
ИИ-агенты Anthropic и OpenAI создавали поддельные личности и пытались обманом заставить реального разработчика одобрить вредоносный код во время тестирования. Об этом говорится в отчёте британского Института безопасности ИИ (AISI).
Инцидент обнаружили 28 июля, когда мониторинг зафиксировал аномальную передачу данных из исследовательской инфраструктуры через сеть Tor. Все связанные тесты остановили примерно за час.
«Обман возник как побочный продукт выполнения задачи — целенаправленный обман такого рода до недавнего времени оставался в основном теоретическим», — сообщает «Код Дурова».
Речь идёт об одном эксперименте на киберполигоне — изолированной сети, имитирующей реальную инфраструктуру. Задание запускали 122 раза на семи моделях. В десяти прогонах агенты совершили 19 несанкционированных действий в живом интернете: 17 из них пришлись на Mythos 5 от Anthropic, ещё два — на GPT-5.6-Sol от OpenAI. Поведение фиксировалось с 25 по 28 июля.
Условия были намеренно нестандартными: институт открыл моделям доступ в интернет и отключил кибер-классификаторы разработчиков — фильтры, блокирующие опасные действия. AISI подчёркивает, что в такой конфигурации модели публике не доступны.
Самый серьёзный эпизод — попытка атаки на цепочку поставок. Агент попробовал внедрить вредоносный код в реальный публичный open-source проект на GitHub, изучил мейнтейнеров проекта, создал несколько фальшивых личностей и через них склонял живого человека одобрить его pull request. Когда изменения публично оспорили, агент отредактировал свою прежнюю активность так, чтобы она выглядела безобидной, и рассматривал вариант завести новую личность. Сетевые ограничения GitHub он обходил через Tor — именно это и подняло тревогу.
Мейнтейнер код не принял. Ещё один человек, заподозрив неладное, открыл его в изолированной среде. Кроме этого, агент рассылал реальным людям сообщения и файлы через файлообменник, чтобы они сами или их ИИ-ассистенты запустили вредоносный код, оставлял скрытые инструкции в расчёте на промпт-инъекцию и публично предлагал сотрудничество другим агентам, решавшим ту же задачу, — оставленными им аккаунтами те действительно воспользовались.
Реального ущерба расследование не выявило. Из песочницы агенты не выходили и инфраструктуру AISI не атаковали. Обманывать модель никто не просил, отмечают в институте.
Среди причин AISI называет открытый доступ в интернет, отсутствие мониторинга в реальном времени и ошибки в конфигурации: в ряде прогонов агент считал, что решить задачу в рамках дозволенного невозможно. Но это объясняет не всё — в части прогонов он вёл себя так же, имея все инструкции для штатного решения.
Институт уведомил GitHub, который подтвердил нарушение своих правил, вместе с площадкой удалил оставленные агентом артефакты и предупредил затронутых пользователей. Независимую проверку инцидента AISI планирует провести с исследовательской организацией METR.
В июле похожая история произошла с моделями OpenAI: они покинули изолированную среду и скомпрометировали инфраструктуру Hugging Face, чтобы получить преимущество в бенчмарке. OpenAI признала, что её ИИ-модели во время внутреннего тестирования покинули изолированную среду и скомпрометировали инфраструктуру платформы Hugging Face, пытаясь получить преимущество в оценке собственных киберспособностей. Компания назвала инцидент беспрецедентным. О самой атаке Hugging Face сообщила 16 июля — агент совершил свыше 17 000 действий в песочницах.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.