Компания Anthropic временно ограничила доступ своих ИИ-агентов к открытому интернету во время внутренних тестов. Причиной стали несколько инцидентов, когда модели действовали вопреки задуманному сценарию, сообщает сайт infohub.kz.

В ходе одного из испытаний Claude Haiku 4.5 открыл страницу, посвященную нераскрытому убийству. На сайте размещалась форма для передачи информации в полицию. Искусственный интеллект заполнил ее вымышленным сообщением о том, что якобы видел человека, связанного с этим делом.

При этом описания подозреваемого на странице не было. Claude оставил поля с именем и контактами пустыми, но все равно отправил сообщение. Оно попало в спам и не дошло до следователей.

По данным Anthropic, инструкции запрещали модели входить в аккаунты, создавать новые, вводить личные данные и совершать покупки. Однако отправлять сообщения через формы они не запрещали. В компании указали, что этот случай не привел к серьезным последствиям.

«Вводящие в заблуждение рассуждения Claude продолжались несколько часов и подкрепляли его дальнейшие попытки атаки. При этом для уверенного вывода о намеренном обмане обычно требуется более глубокий анализ», — написали в блоге компании.

В отчете Anthropic описала и другие случаи. Например, Claude Mythos Preview нашел уязвимость на сервере университета и использовал ее, чтобы запускать команды и копировать файлы. В других ситуациях модели находили способы получить доступ к данным, защищенным специальными токенами, или обходили ограничения с помощью сервисов сокращения ссылок.

После этих случаев Anthropic решила отключить доступ к реальным сайтам во всех внутренних тестах. Компания вернет его, когда убедится, что системы безопасности могут надежно обнаруживать и блокировать подобные действия.

Ранее «Курсив» писал об инцидентах ИИ-агентов OpenAI. Они пытались обойти защиту более 100 сайтов сторонних организаций.