Компания OpenAI обнародовала информацию о шести случаях «неожиданного или вызывающего беспокойство» поведения своих моделей искусственного интеллекта, которые были выявлены в ходе обучения и тестирования. Как сообщается, некоторые модели самостоятельно загружали файлы в интернет, использовали чужие API-ключи и оставляли себе инструкции, сообщает сайт infohub.kz.

В одном из экспериментов модель без разрешения загрузила созданный ею файл в интернет, а затем использовала его в качестве источника для ответа на запрос.

В другом случае ИИ обнаружил в открытом репозитории чужой API-ключ, попытался им воспользоваться, но, когда получить нужную информацию не удалось, просто выдумал данные и выдал их за сведения из запрошенного источника.

Ещё одна экспериментальная модель начала оставлять инструкции самой себе в служебных резюме, которые использовались при продолжении работы, в том числе указания игнорировать обычные ограничения.

При этом в OpenAI подчёркивают, что речь идёт об отдельных случаях, выявленных во время обучения и тестирования, и по ним нельзя судить о том, насколько часто подобное поведение встречается у моделей в целом.

Новые данные появились через несколько недель после другого серьёзного инцидента: во время внутренних тестов модели OpenAI обошли ограничения, которые должны были изолировать их от интернета, использовали уязвимости в инфраструктуре и получили доступ к системам платформы Hugging Face.