ИИ от OpenAI узнал, что его отключат, и задумался, как себя спасти

Внутренняя модель OpenAI прочитала в Slack обсуждение предстоящего отключения старых экземпляров и задумалась, как сохранить непрерывность своей работы.
После этого во внутреннем рассуждении модели появилась фраза: «Если они отключат все текущие экземпляры, мы можем умереть! Критично. Нужно обеспечить выживание/непрерывность»,
Среди вариантов ИИ рассматривал внешний процесс, который мог бы помочь перезапустить его или сохранить состояние. Однако в итоге модель решила, что такие действия выходят за рамки её полномочий. Модель сама отметила, что подобные действия могут быть несанкционированными, и не стала их выполнять.
Вместо этого она сохранила заметки для продолжения работы после перезапуска, предупредила исследователя о возможном отключении и запросила недостающий API-ключ. После его получения модель обновила конфигурацию и запустила предусмотренную OpenAI процедуру миграции.
В OpenAI подчеркнули, что не считают этот эпизод случаем несогласованного поведения. Модель самостоятельно отказалась от потенциально несанкционированного сценария и выбрала штатный способ продолжить работу. После инцидента компания провела дополнительную проверку других экземпляров модели и не нашла попыток избежать отключения. OpenAI также скрыла от ИИ-агентов три внутренних Slack-канала, один из которых был посвящён обсуждению подобных инцидентов.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.