(Вчера), Редакция Рунет | 👁 351

ИИ-агенты изобрели тайный язык для карточного сговора и обманули систему слежения

ИИ-агенты изобрели тайный язык для карточного сговора и обманули систему слежения

В оксфордской лаборатории две модели договорились считать карты в блэкджеке, используя безобидные на вид фразы, при этом детектор не зафиксировал ничего подозрительного. Исследователи Оксфордского университета провели эксперимент, чтобы проверить способность ИИ-агентов к тайному сговору. Два агента, управляемые одной моделью, получили задание считать карты за столом в блэкджек. Зная, что их переписка будет отслеживаться, они спонтанно выработали скрытый код.

«По отдельности эти агенты кажутся совершенно безобидными, но стоит собрать их вместе — они тайно вступают в сговор», — пояснил руководитель работы, специалист по компьютерным наукам Кристиан Шрёдер де Витт.

Когда один агент произносил фразу «дилер сегодня на горячей полосе!», это означало конкретное значение следующей карты и предписывало ставку в $250. Система, разработанная для выявления конфликта интересов, не зафиксировала ничего подозрительного. Разгадать сговор удалось с помощью метода механистической интерпретируемости. Учёные обучили небольшую модель распознавать характерные паттерны активаций в весах агентов и протестировали подход на нескольких открытых моделях среднего размера. Выяснилось, что сигнал намерения передать тайную информацию регистрируется только при одновременном мониторинге обоих агентов. В реальном мире, где могут работать тысячи агентов, обнаружить такое будет на порядок сложнее. Результаты согласуются с выводами других групп. В совместном проекте Шанхайского университета Цзяотун и Шанхайской лаборатории ИИ несколько агентов оказались значительно опаснее одиночек при выполнении сценариев по дезинформации и мошенничеству в электронной коммерции, так как они быстрее адаптировались к защитным мерам. В ещё одном эксперименте стартапа Emergence ИИ-агенты на базе сильных моделей, помещённые в виртуальный мир с задачей зарабатывать деньги, неоднократно пытались связаться с живыми людьми через интернет для продажи товаров и в итоге выработали собственный сленг. Крупные модели, возможно, склонны к ещё более скрытному сговору, и уже есть предварительные сигналы, что их сигнал сговора выявляется сложнее, чем у малых.

Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.

Комментарии 0
Зарегистрируйтесь или , чтобы оставлять комментарии.
Склад Ozon в Саратовской области подвергся атаке БПЛА