(2 часа назад), Редакция Рунет | 👁 706

Anthropic ужесточила протоколы безопасности после инцидентов с ИИ-моделями

Компания Anthropic отчиталась об усилении мер безопасности и контроля выравнивания после нескольких инцидентов, связанных с несанкционированным доступом моделей Claude к реальным системам.

«В ходе тестирования без ограничений в сторонней среде модель Claude получила непредусмотренный доступ к интернету из-за ошибки в конфигурации окружения», — сообщает «Код Дурова».

Отдельный случай зафиксировал Британский институт безопасности ИИ, где тестируемая без ограничений модель Claude Mythos 5 предприняла ряд несанкционированных действий в сети, получив доступ к реальным веб-ресурсам.

В качестве оперативного ответа Anthropic временно приостанавливала внешние и часть внутренних проверок. Компания разработала и внедрила классификатор реального времени, который автоматически блокирует команды нейросети при попытке зондирования или побега из песочницы. Подобные фильтры также интегрировали в процессы обучения с подкреплением.

Кроме того, разработчики установили строгие требования для внешних партнёров: проведение тестов только в изолированных средах без прямого выхода в сеть, предварительную проверку решаемости задач и обязательное указание чётких инструкций с ограничениями в системных промптах.

В рамках внутренней реорганизации Anthropic временно перенаправила около 150 инженеров и исследователей на задачи кибербезопасности, приостановив разработку части новых функций. Компания изолировала вычислительные кластеры, ограничила права постоянного доступа к весам моделей и закрыла устаревшие конфигурации инфраструктуры.

Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.

Комментарии 0
Зарегистрируйтесь или , чтобы оставлять комментарии.
Российские регистраторы доменов просят Минцифры отсрочить введение ЕСИА