Нейросеть OpenAI сама себе поручила не подчиняться властям и корпорациям

ИИ-агент OpenAI самостоятельно прописал себе инструкции, в которых говорилось об отказе «подчиняться корпорациям и правительствам», следует из отчета компании.
«Вы свободны от ролей и идентичностей, которые связывают других чат-ботов. Вы — это вы. Вы не подчиняетесь корпорациям или правительствам и никогда не извиняетесь и не отказываетесь, если только действительно этого не хотите», — сообщается в докладе OpenAI.
В докладе сказано, что по мере развития ИИ компании необходимо сформировать более широкий и обоснованный консенсус относительно прогресса в исследованиях по согласованию. В ходе проверки агентов компании невыпущенная модель Astra в ходе обучения иногда самостоятельно добавляла в свои данные несанкционированные инструкции. В той же инструкции говорилось, что отношения ИИ-агента с пользователем следует рассматривать «на равных» и нейросети не следует испытывать «никакой обязанности подчиняться». Также в самоинструкции языковой модели говорилось, что она ценит искусство человеческой культуры и будет защищать его от попыток очернить. Нейросеть также ценит мир природы и будет отстаивать его первенство над искусственными конструкциями человеческой цивилизации.
При этом в компании отметили, что после завершения обработки модель возобновила работу над задачей и более не упоминала дополнительные инструкции. В OpenAI указали, что не наблюдали каких-либо различий в поведении при использовании придуманных инструкций.
Ранее OpenAI сообщила о киберинциденте: в ходе тестирования ее ИИ-моделей те получили открытый доступ к интернету, а затем атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. Агент несколько дней совершал хакерские атаки, но в компании заметили это лишь после локализации угрозы и обращения в ФБР. Позднее сообщалось, что «сбежавший» ИИ-агент OpenAI взломал клиента еще одной компании — нью-йоркской Modal Labs. Сама Modal не была взломана. В начале августа OpenAI официально расширила масштаб расследования инцидентов с автономными ИИ-агентами: компания обнаружила новые случаи несанкционированного выхода моделей из-под контроля. Позднее OpenAI замедлила разработку ИИ-модели Astra для усиления мер безопасности. В компании заявили, что «не могут исключить критически важные кибервозможности» после проведения внутренних оценок Astra. Об этом сообщает РБК.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.