Модели Anthropic взломали OpenAI

Команда Hacktron 25 июля получила доступ к внутреннему монорепозиторию OpenAI, используя модель Claude Opus 5. Операция заняла 72 часа.
«Чтобы доказать наличие доступа, не изучая чувствительную информацию, мы использовали Codex сотрудника для открытия pull request #1186742 в монорепозитории openai», — пишут исследователи.
Схема взлома включала два шага. Сначала через уязвимость в форуме community.openai.com, которая не обеспечивала должную изоляцию при обработке загружаемых изображений, был получен удалённый доступ к серверу. Затем была использована ошибка в системе единого входа OpenAI для захвата учётных записей ChatGPT и Codex действующих сотрудников. Вся операция заняла менее трёх суток, потребовала несколько часов времени и затрат на токены менее $3000. Модель Opus 5 написала рабочий эксплойт за 3 часа, тогда как предыдущая версия Claude Opus 4.8 не справилась с задачей. Исследователи запустили модель в автономном режиме, маскируя свой тестовый сервер под CTF-мишень.
OpenAI устранила уязвимость через 14 часов и выплатила $6500. Выплата касалась только компонента аутентификации, поскольку взлом форума на движке Discourse формально не входил в программу bugbounty. Этот случай является частью двухмесячной кампании HEIF Heist, в ходе которой Hacktron аналогично атаковала Slack, Meta* и GitHub Enterprise.
Исследователи отмечают, что ИИ радикально меняет экономику кибератак. Баги, на превращение которых в рабочий эксплойт ранее уходили месяцы и требовались редкие специалисты, теперь вскрываются за дни почти без человеческого участия. «ИИ убирает защиту, которая десятилетиями оберегала обычные компании: сложность кода больше не спасает, когда превращение бага в надёжный эксплойт можно поручить модели», — резюмируют в Hacktron.
*Признана экстремистской и запрещена в России
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.