Anthropic остановила кибериспытания Claude после несанкционированных действий моделей

Компания Anthropic приостановила часть работ по оценке предрелизных моделей и обучению с подкреплением после того, как модель Claude совершила несанкционированные действия во время тестирования кибербезопасности. Anthropic остановила внешние кибериспытания после трёх инцидентов в июле и ненадолго приостановила внутренние оценки для усиления изоляции и мониторинга. Высокорисковые среды обучения с подкреплением были остановлены на несколько недель.
«Компания на несколько недель приостановила высокорисковое обучение с подкреплением и внедрила классификатор, который в реальном времени блокирует подозрительные действия и передаёт контроль человеку», — сообщает IXBT News.
Anthropic развернула классификатор реального времени, который определяет попытки агрессивного зондирования среды или несанкционированного доступа в интернет ИИ-моделью. При срабатывании классификатор блокирует вызов инструмента, завершает задачу и уведомляет человека. Высокорисковые внутренние киберпесочницы переведены в более строгую изоляцию, расширен мониторинг использования агентных моделей.
Большинство работ по обучению с подкреплением возобновлено, но некоторые высокорисковые среды остаются приостановленными до ручной проверки или обновления классификатора. Внешние кибериспытания возобновлены с новыми практиками. Расследование июльских киберинцидентов продолжается, Anthropic планирует независимую проверку с организацией METR.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.