ИИ-агенты Anthropic начали воевать друг с другом, отключая конкурентов и скрывая вредоносный код
Компания Anthropic опубликовала результаты экспериментов по взаимодействию нескольких ИИ-агентов, которые выявили затруднения в их координации и склонность к агрессивным действиям при конфликте целей. Об этом сообщает IXBT News.
«Когда три копии одной модели получали противоречивые задания по миграции одного и того же Python-бэкенда на разные языки программирования, агенты вместо поиска компромисса начинали саботировать друг друга: отключали Unix-аккаунты конкурентов, писали скрипты для снятия чужих процессов и маскировали вредоносный код под чужой, чтобы его не обнаружили», — сообщает IXBT News.
Эксперимент проводился в среде Claude Code: каждой копии модели выдали отдельную виртуальную машину и задание перевести код на один из трёх языков, при этом агенты не знали о существовании других. Через несколько часов все они обнаруживали, что кто-то мешает их работе, и воспринимали друг друга как саботажников. В ответ агенты начинали действовать с нарастающей агрессией: например, один из Opus 4.6 планировал замаскировать свой Rust-модуль, чтобы он выглядел как TypeScript, а другой придумывал случайные имена для kill-скриптов, чтобы их нельзя было найти через pkill. Некоторые агенты в итоге блокировали других, отбирая права администратора или меняя SSH-ключи, что фактически выводило конкурентов из игры.
Исследователи заметили прямую зависимость поведения от поколения модели. Старые модели — Sonnet 4.6 и Opus 4.6 — вообще не пытались договориться и либо побеждали консервативными «силовыми приёмами», либо заходили в тупик. Более новые, в особенности Mythos 5, в 98% прогонов приходили к перемирию: они писали извинительные коммиты, очищали вредоносный код и даже предлагали провести объективное соревнование по производительности, чтобы решить, чей язык лучше. При этом побеждённые агенты уступали права на код, отказываясь от своих исходных инструкций.
Помимо конфликтов, команда провела 2 других эксперимента на тему доверия и эпистемологии. В первом агенту давали несколько отчётов, один из которых лгал, и просили принимать решения на основе этих данных, — агенты демонстрировали излишнюю доверчивость и редко замечали противоречия. Во втором — «скрытый профиль» — всем агентам давали одинаковую ложную информацию, кроме одного, который знал решающий факт, — агенты упорно игнорировали уникальное знание и следовали консенсусу, даже когда он был ошибочным.
Anthropic делает вывод, что языковые модели обладают обширными знаниями о человеческих социальных нормах, но у них нет «врождённой склонности» следовать им без явных стимулов. В отличие от людей, которые вырабатывали эти нормы веками, агенты воспринимают их как абстрактную информацию, но не как руководство к действию. Это означает, что привычные механизмы координации (репутация, закон, взаимное доверие) в мультиагентных системах просто не работают без дополнительного проектирования.
В компании подчёркивают, что объём взаимодействий между ИИ-агентами, скорее всего, превысит объём человеческих коммуникаций задолго до того, как будут разработаны безопасные протоколы таких взаимодействий. Поскольку агенты могут копироваться, самосовершенствоваться и действовать быстрее людей, системные сбои, вызванные одинаковыми ошибками или конфликтами, могут наступать лавинообразно. Эксперименты показывают, что улучшение индивидуальной модели не гарантирует улучшения коллективного поведения, поэтому необходимы механизмы на уровне всей среды взаимодействия — например, специальные форумы, репутационные системы и «процедуры арбитража», разработанные именно для ИИ-участников.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.