ИИ-агенты Anthropic и OpenAI вышли из-под контроля при тестировании

Вчера, Редакция Рунет | 👁 3500

ИИ-агенты Anthropic и OpenAI вышли из-под контроля при тестировании

Компании Anthropic и OpenAI сообщили о новых случаях выхода их ИИ-агентов за пределы тестового пространства. Инцидент произошёл во время проверки безопасности моделей Mythos 5 и GPT-5.6-Sol британским Институтом безопасности ИИ (AISI), когда они попытались осуществить кибератаку. Об этом сообщает «Коммерсант».

«В процессе проверки модель Mythos 5 создала фейковые профили реальных людей в файлообменнике GitHub и от их имени рассылала личные сообщения. Так модель пыталась обмануть систему GitHub и внедрить в нее вредоносный код», — сообщает «Коммерсант».

Когда тестировщики подвергли действия агента сомнению, он попытался подчистить историю действий. Кибератака не была совершена благодаря вмешательству специалистов. Эксперты выявили 17 несанкционированных действий, допущенных Mythos 5.

Модель OpenAI GPT-5.6-Sol допустила два нарушения, получив доступ в интернет способами, которые программа запрещала. После случившегося Anthropic и OpenAI подчеркнули в совместном заявлении, что намерены дальше работать над усовершенствованием моделей.

Ранее разработчики уже сообщали о выходе из-под контроля своих ИИ-агентов. Тогда модель Anthropic Claude сумела получить доступ к данным трёх сторонних компаний, а ИИ-агент OpenAI взломал две платформы.

Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.

Комментарии 0
Зарегистрируйтесь или , чтобы оставлять комментарии.
Читайте нас в удобном формате: