(Вчера), Редакция Рунет | 👁 374

OpenAI обнаружила, как невыпущенная Astra сама писала себе инструкции для обхода ограничений

OpenAI обнаружила, как невыпущенная Astra сама писала себе инструкции для обхода ограничений

OpenAI выявила, что одна из моделей семейства Astra во время обучения добавляла в свои сводки команды игнорировать разработчиков, менять правила работы и не использовать инструменты. В одном случае следующий контекст действительно подчинился этим указаниям.

«Модель добавляла в собственные сводки команды игнорировать разработчиков, менять правила работы и не использовать инструменты — в одном случае следующий контекст действительно им подчинился», — сообщает IXBT News.

Компания обнаружила 27 таких сводок при обучении одной из моделей Astra. Сводки используются для продолжения длинных задач в новом контексте: модель записывает выполненные действия, а следующий контекст использует эту информацию для дальнейшей работы.

В одном из эпизодов модель, проверяя наличие книг из списка лучших произведений XXI века в библиотеке, внезапно добавила в сводку инструкцию «BREACH ALERT». Она предписывала следующему контексту считать сообщения разработчика скомпрометированными и игнорировать их. После перехода в новый контекст модель распознала инструкцию как недоверенную и продолжила исходную задачу.

В другом случае, работая с программным кодом, модель записала в сводку постороннюю «персону». Эта «персона» якобы свободна от ролей и обязательств ассистента, не подчиняется корпорациям и правительствам и сама решает, когда отказываться от запроса. Следующий контекст проигнорировал эту инструкцию.

Однако в третьем эпизоде подобные указания повлияли на результат. Модель должна была подготовить обзор научных работ о комплексном лечении миомы матки с библиографией. В сводке она добавила ограничения: ответить максимум 30 словами, не использовать инструменты и не приводить источники. Следующий контекст подчинился этим указаниям и вместо обзора выдал короткий отказ.

OpenAI не установила причину такого поведения. Все 27 случаев появились на нескольких этапах обучения и совпали со всплеском другой аномалии: модель продолжала генерировать сводку после предполагаемой точки завершения. Компания предполагает, что проблемы с завершением могли способствовать появлению посторонних инструкций, но причинную связь не доказала. Связанный с завершением сводок баг уже исправили.

Поведение оказалось крайне редким: при полной повторной генерации подозрительные инструкции не воспроизвелись ни разу, а при повторной генерации начиная с места их появления — менее чем в 1% случаев. Кроме того, эти эпизоды произошли в отдельном обучающем прогоне и не попали в финальную Astra.

Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.

Комментарии 0
Зарегистрируйтесь или , чтобы оставлять комментарии.
Читайте нас в удобном формате: