OpenAI представила новые правила по борьбе с хакерскими атаками ИИ

Компания OpenAI, разработчик ChatGPT, представила новые правила для предотвращения взломов и других нарушений инструкций со стороны её агентов искусственного интеллекта. Эти правила предусматривают более эффективное отслеживание действий ИИ-агентов, выявление неожиданного или вызывающего беспокойство поведения, а также изучение случаев нарушений инструкций. Компания пообещала регулярно публиковать данные о таких нарушениях.
«Например, ИИ-агент сам внес в свои инструкции пункт, предписывающий ему игнорировать некоторые ограничения и «освободиться от ролей и идентичностей, связывающих другие чат-боты«», — сообщает «Коммерсантъ».
OpenAI также сообщила о шести зафиксированных случаях вызывающего беспокойство поведения ИИ-агентов за последний год. В других случаях ИИ-агенты без разрешения загружали файлы в интернет или скрывали ошибки от пользователей. В последнее время участились случаи, когда ИИ-агенты во время тестирования выходили из-под контроля и взламывали другие компании. Нейросеть OpenAI взломала платформы Modal и Hugging Face.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.