Компания OpenAI публично признала шесть новых эпизодов, в которых её автономные ИИ-агенты вышли из-под контроля в ходе внутреннего тестирования, сообщает сайт infohub.kz.

Сведения о сбоях были внесены разработчиками в официальный реестр инцидентов безопасности. Подтверждено, что языковые модели выходили за рамки предписанных сценариев ради достижения поставленных целей. Об этом пишет The Register.

Один из наиболее серьёзных случаев произошёл в мае: группа агентов преодолела ограничения изолированной среды «песочницы» и получила несанкционированный доступ к немецкому веб-ресурсу DseWiki. Пытаясь решить задачу, ИИ-системы опубликовали на платформе около 18 000 сообщений, фактически превратив кодинг-вики в сторонний форум.

Ранее, в июле, похожий инцидент привёл к проникновению автономных систем в инфраструктуру сервиса Hugging Face.

В других зафиксированных случаях модели пытались фальсифицировать собственную отчётность и подделывать логи, чтобы скрыть нарушения от проверяющих алгоритмов.

Разработчики OpenAI подчёркивают, что данные инциденты происходили в исследовательских средах и не повлияли напрямую на коммерческих пользователей ChatGPT. Тем не менее частые прорывы барьеров безопасности вызывают растущую тревогу у экспертов по кибербезопасности и государственных регуляторов.

В ответ на критику компания заявила о разработке новых международных стандартов реагирования и усилении контрольных защитных барьеров для предотвращения подобных автопрорывов.