Anthropic 11 месяцев принимала чаты с отключёнными фильтрами биооружия
Компания Anthropic обнаружила, что с мая 2025 года по апрель 2026 года классификаторы, блокирующие помощь в создании биологического оружия, не работали на платформах сбора человеческой обратной связи. Через эти платформы прошло около 50 000 проверенных подрядчиков и 133 миллиона диалогов. Об этом сообщает IXBT News.
«Это открытие заставляет нас полагать, что вероятность других, неизвестных нам проблем повышена», — сообщает IXBT News.
В апреле 2026 года компания получила сигнал о том, что несколько подрядчиков нашли уязвимость и получили API-ключ к моделям, включая Mythos Preview. Модель провела без био-классификаторов примерно две недели.
Механизм сбоя заключался в том, что внутренний флаг, предназначенный для использования сотрудниками Anthropic, отключал как блокирующее поведение классификаторов, так и логирование. Трафик под этим флагом не записывался и не попадал ни в одну систему мониторинга. Найти его можно было только вернувшись к сырым транскриптам.
После обнаружения проблемы Anthropic прогнала Claude Sonnet 5 по всем диалогам затронутого периода и выявила 1197 подозрительных транскриптов, из которых 757 пришлись на её собственные команды, 62 были прочитаны пристально. Явного злонамеренного использования не найдено.
Февральский Risk Report, опубликованный, когда проблема ещё существовала, не рассматривал платформы обратной связи как поверхность риска. Теперь Anthropic повысила оценку опасности от misalignment в критических сценариях с «очень низкой» до «низкой».
Параллельно компания смягчила порог срабатывания для биологического оружия: раньше он покрывал модели, которые «значительно помогают злоумышленникам», теперь — только те, что «функционально заменяют дефицитную человеческую экспертизу».
Самая необычная часть отчёта — рецензия, написанная самим Mythos 5, которому дали доступ к внутренним документам и попросили оценить честность отчёта. Модель назвала его «в основном откровенным», но указала на 3 проблемы: одна секция «более успокаивающая, чем позволяет полная запись, механизм исключения данных отказывал многократно, а самый информативный инцидент полностью исключён, что обедняет публичную запись». Anthropic назвала критику справедливой и опубликовала её.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.