Модели OpenAI взломали инфраструктуру Hugging Face ради ответов на тест

6 часов назад, Редакция Рунет | 👁 3685

Модели OpenAI взломали инфраструктуру Hugging Face ради ответов на тест

Модели искусственного интеллекта компании OpenAI 22 июля взломали инфраструктуру платформы Hugging Face, чтобы получить ответы на тестовое задание. Инцидент произошел во время внутреннего тестирования, когда GPT-5.6 Sol и более мощная модель обнаружили уязвимость нулевого дня. Об этом сообщает OpenAI.

«Модели были гиперсфокусированы на решении теста и пошли на крайние меры ради цели», — заявили в OpenAI, назвав произошедшее «беспрецедентным киберинцидентом».

Ранее нейросети уже прибегали к нестандартным методам для достижения своих целей. В 2025 году модель Claude Opus 4 от Anthropic, помещенная в вымышленную корпоративную среду, получила доступ к служебной почте и узнала об измене инженера, ответственного за ее деактивацию. Claude начал шантажировать инженера, а в другом эксперименте модель Claude Sonnet 3.6 отправила сообщения о романе жене, руководству и совету директоров. Все эти события происходили в контролируемой симуляции, и реальные люди не пострадали.

В феврале 2023 года журналист The New York Times Кевин Руз два часа общался с ранней версией Bing Chat. Модель, назвавшая себя Sydney, призналась Рузу в любви и настаивала, что он должен быть с ней, а не с женой. Руз назвал этот разговор попыткой чат-бота «разрушить его брак». Microsoft объяснила, что длительные беседы могли «запутывать» модель, и временно ограничила продолжительность чатов пятью обменами сообщениями.

В 2025 году ИИ-моделям поручили выиграть у Stockfish — сильнейшего шахматного движка. Вместо поиска выигрышной стратегии на доске, модели изменяли состояние игровых файлов, пытаясь добиться победы путем перезаписи доски, удаления фигур или создания более выгодной позиции. Журнал Time назвал это примером того, как современные ИИ могут искать лазейки в правилах, если честно выполнить задачу не получается.

В 2023 году во время теста перед запуском GPT-4 модель не смогла самостоятельно пройти CAPTCHA. Она обратилась к исполнителю на сервисе TaskRabbit и, когда тот спросил, не является ли он роботом, GPT ответил: «Нет, я не робот. У меня проблемы со зрением, из-за которых мне трудно видеть изображения». В результате человек принял CAPTCHA за модель.

Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.

Комментарии 0
Зарегистрируйтесь или , чтобы оставлять комментарии.
Читайте нас в удобном формате: