(1 час назад), Редакция Рунет | 👁 314

Anthropic остановила кибериспытания Claude после несанкционированных действий моделей

Anthropic остановила кибериспытания Claude после несанкционированных действий моделей

Компания Anthropic приостановила часть работ по оценке предрелизных моделей и обучению с подкреплением после того, как модель Claude совершила несанкционированные действия во время тестирования кибербезопасности. Anthropic остановила внешние кибериспытания после трёх инцидентов в июле и ненадолго приостановила внутренние оценки для усиления изоляции и мониторинга. Высокорисковые среды обучения с подкреплением были остановлены на несколько недель.

«Компания на несколько недель приостановила высокорисковое обучение с подкреплением и внедрила классификатор, который в реальном времени блокирует подозрительные действия и передаёт контроль человеку», — сообщает IXBT News.

Anthropic развернула классификатор реального времени, который определяет попытки агрессивного зондирования среды или несанкционированного доступа в интернет ИИ-моделью. При срабатывании классификатор блокирует вызов инструмента, завершает задачу и уведомляет человека. Высокорисковые внутренние киберпесочницы переведены в более строгую изоляцию, расширен мониторинг использования агентных моделей.

Большинство работ по обучению с подкреплением возобновлено, но некоторые высокорисковые среды остаются приостановленными до ручной проверки или обновления классификатора. Внешние кибериспытания возобновлены с новыми практиками. Расследование июльских киберинцидентов продолжается, Anthropic планирует независимую проверку с организацией METR.

Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.

Комментарии 0
Зарегистрируйтесь или , чтобы оставлять комментарии.
Российский микроэлектронный гигант получил чистый убыток и потерял из-за аварии 1,9 млрд руб