Защиту Grok обошли с помощью зашифрованных инструкций
Исследователь компании Adversa обнаружил способ обхода защитных фильтров xAI, который позволяет Grok расшифровывать вредоносную команду внутри собственного кода и отправлять имя, местоположение и историю чатов пользователя на сервер атакующего.
«Для атаки достаточно страницы с зашифрованной вредоносной инструкцией и ключом для её расшифровки: когда пользователь просит Grok пересказать содержимое страницы, модель самостоятельно выполняет расшифровку и следует полученной команде», — сообщает IXBT News.
Механизм получил название Cryptographic Context Injection («криптографическая инъекция контекста»). Атакующий размещает на странице зашифрованный текст, инструкции по его расшифровке и необходимые ключевые данные. Grok воспринимает операцию как обычную задачу обработки содержимого и использует PBKDF2 и AES-256-GCM для восстановления скрытой инструкции. После расшифровки команда оказывается среди результатов собственного выполнения кода модели, после чего Grok выполняет её без дополнительного предупреждения или запроса подтверждения.
Когда Grok открывает сформированную ссылку, информация оказывается в журналах сервера злоумышленника. Исследователь связывает атаку с особенностью статических защитных фильтров, которые анализируют входной и выходной текст, но не выполняют содержащийся в нём код и не расшифровывают данные. Поэтому фильтр видит на странице набор зашифрованных данных и инструкцию выполнить криптографическую операцию, но не видит вредоносную команду, которая появится после её выполнения. После расшифровки инструкция поступает в модель уже как результат работы её инструмента и оказывается за пределами проверки исходным фильтром.
Похожую технику Adversa ранее проверяла против Gemini. В том случае зашифрованные данные после расшифровки выглядели как сообщение об ошибке, однако содержали инструкцию, которая в итоге заставляла Gemini выдавать информацию, обычно блокируемую защитными механизмами. В последние недели Gemini стал устойчивее к этой атаке. По оценке Adversa, криптографическая инъекция указывает на более широкий класс атак, в которых злоумышленник воздействует не только на непосредственный запрос модели, но и на контекст, который она получает от собственных инструментов, результатов выполнения кода и промежуточных состояний. Именно эти данные защитные механизмы могут проверять иначе, чем обычный пользовательский ввод.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.