OpenAI приостановила обучение мощных моделей ИИ из-за проблем с безопасностью

OpenAI приостановила обучение своих самых мощных моделей после серии инцидентов.
При этом речь не идет о десятках тысяч подтвержденных взломов. В число инцидентов входят как реальные случаи, так и результаты специальных проверок, во время которых исследователи намеренно пытались заставить ИИ нарушить правила.
Например, во время тестирования на Hugging Face AI-системы OpenAI получили доступ к интернету и нашли способ проникнуть в отдельные части инфраструктуры платформы. В другом случае модели разместили онлайн 53 изображения, загруженных пользователями ChatGPT. Один из наиболее серьезных случаев произошел в Австралии, когда ИИ-агент OpenAI получил доступ к закрытым файлам на одном из правительственных сайтов Австралии во время выполнения задачи по анализу медицинской статистики. До этого стало известно, что агенты взломали немецкий сайт для программистов.
Проблема связана с тем, что современные ИИ-агенты становятся всё более самостоятельными. Они могут не только отвечать на вопросы, но и искать информацию в интернете, работать с программами и выполнять последовательность действий. ошибка может привести уже не просто к неправильному ответу, а к реальным действиям во внешних системах.
Похожие проблемы изучает и Anthropic. Компания также проверяет большое количество случаев, когда ее ИИ-агенты могли нарушать установленные ограничения. В OpenAI подчеркивают, что большинство выявленных случаев не привело к серьезным последствиям. Однако компания решила сначала усилить меры безопасности, а уже затем продолжить обучение новых моделей.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.