OpenAI обнаружила, как невыпущенная Astra сама писала себе инструкции для обхода ограничений

OpenAI выявила, что одна из моделей семейства Astra во время обучения добавляла в свои сводки команды игнорировать разработчиков, менять правила работы и не использовать инструменты. В одном случае следующий контекст действительно подчинился этим указаниям.
«Модель добавляла в собственные сводки команды игнорировать разработчиков, менять правила работы и не использовать инструменты — в одном случае следующий контекст действительно им подчинился», — сообщает IXBT News.
Компания обнаружила 27 таких сводок при обучении одной из моделей Astra. Сводки используются для продолжения длинных задач в новом контексте: модель записывает выполненные действия, а следующий контекст использует эту информацию для дальнейшей работы.
В одном из эпизодов модель, проверяя наличие книг из списка лучших произведений XXI века в библиотеке, внезапно добавила в сводку инструкцию «BREACH ALERT». Она предписывала следующему контексту считать сообщения разработчика скомпрометированными и игнорировать их. После перехода в новый контекст модель распознала инструкцию как недоверенную и продолжила исходную задачу.
В другом случае, работая с программным кодом, модель записала в сводку постороннюю «персону». Эта «персона» якобы свободна от ролей и обязательств ассистента, не подчиняется корпорациям и правительствам и сама решает, когда отказываться от запроса. Следующий контекст проигнорировал эту инструкцию.
Однако в третьем эпизоде подобные указания повлияли на результат. Модель должна была подготовить обзор научных работ о комплексном лечении миомы матки с библиографией. В сводке она добавила ограничения: ответить максимум 30 словами, не использовать инструменты и не приводить источники. Следующий контекст подчинился этим указаниям и вместо обзора выдал короткий отказ.
OpenAI не установила причину такого поведения. Все 27 случаев появились на нескольких этапах обучения и совпали со всплеском другой аномалии: модель продолжала генерировать сводку после предполагаемой точки завершения. Компания предполагает, что проблемы с завершением могли способствовать появлению посторонних инструкций, но причинную связь не доказала. Связанный с завершением сводок баг уже исправили.
Поведение оказалось крайне редким: при полной повторной генерации подозрительные инструкции не воспроизвелись ни разу, а при повторной генерации начиная с места их появления — менее чем в 1% случаев. Кроме того, эти эпизоды произошли в отдельном обучающем прогоне и не попали в финальную Astra.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.