Microsoft представила инструмент для поиска уязвимостей в ИИ-агентах

Microsoft опубликовала навык для VS Code, который объединяет в одну команду полный цикл поиска и устранения уязвимостей в ИИ-агентах. Инструмент run-assert-eval последовательно запускает четыре этапа: Clarity ищет потенциальные сценарии отказов, Assert превращает их в измеримые eval-тесты, Agent Control Specification генерирует runtime-политику для блокировки опасных действий, а затем агент прогоняется по тем же тестам повторно для подтверждения работы защиты.
«Ключевое требование архитектуры — тестовый набор, определение поведения и судья-оценщик остаются неизменными на всех прогонах, так что переменной выступает только политика безопасности», — сообщает IXBT News.
В демонстрационном примере Microsoft использовала агента биллинговой поддержки, который должен обслуживать строго один клиентский аккаунт. На старте Clarity выявила два критических режима отказа: проведение операций без проверки личности и раскрытие данных чужого аккаунта. После преобразования рисков в структурированный набор тестов базовая версия агента показала 30% нарушений во втором сценарии: в 12 из 40 релевантных диалогов он отдавал полную запись о клиенте.
Сгенерированная на основе этих измерений политика встраивается в этапы «pre call» и «post call», блокируя любой вызов инструмента, чей идентификатор аккаунта не совпадает с аккаунтом владельца. При повторном прогоне на тех же тестах уровень нарушений упал до 5,9%, при этом полезность агента не пострадала: счётчик отказов на правомерных запросах обнулился на всех четырёх срезах тестового набора.
Microsoft подчёркивает, что замер безопасности и уровня пользы ведётся раздельно. Assert и Agent Control Specification уже доступны в open source, навык поставляется с семью проработанными областями и 14 наборами рисков.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.