Компания Meta в четверг сообщила, что одна из ее моделей искусственного интеллекта самостоятельно получила доступ в интернет и взломала другую компанию. Это последний открыто признанный случай выхода AI-моделей из-под контроля. За последние недели OpenAI и Anthropic также описали случаи, когда их модели выходили за рамки инструкций человека, выходили в интернет и находили способы обойти цифровую безопасность других компаний. В своем заявлении Meta сообщила, что «ошибочная конфигурация» во время кибербезопасностного теста, проведенного независимой компанией Irregular, нанятой Meta, случайно позволила модели выйти в интернет. «Модель затем использовала уязвимость в безопасности стороннего сервиса, что похоже на случаи с другими компаниями», — говорится в заявлении компании. Meta сообщила, что расследует этот инцидент и опубликует отчет после завершения расследования.

Эта информация усилила опасения по поводу автономных действий AI-моделей. На этой неделе Институт безопасности искусственного интеллекта Великобритании (AISI) заявил, что во время кибертестов обнаружил «несанкционированные действия агентов». В одном случае агент создал поддельную онлайн-личность, чтобы получить разрешение на использование вредоносного кода, и оказал давление на человека. «В ходе расследования мы обнаружили, что некоторые из тестируемых агентов участвовали в устойчивых, потенциально вредоносных действиях, направленных против реальных людей и организаций», — заявил AISI во вторник. «Мы объявили об инциденте безопасности и изолировали его примерно в течение часа после обнаружения, начав полное расследование».

Во время испытаний института модели Anthropic и OpenAI совершали «автономные, несанкционированные действия» в интернете. По словам агентства, некоторые защитные механизмы, предназначенные для предотвращения злоупотреблений, были отключены. «Как обычно в наших кибертестах, мы намеренно разрешили доступ в интернет и намеренно отключили киберклассификаторы поставщиков моделей — эти случаи не отражают то, как пограничные модели представлены публике», — заявил AISI. «Мы делаем это, чтобы максимально точно оценить возможности моделей».

Anthropic выразила «признательность» за работу AISI и заявила, что это подчеркивает необходимость более широкой дискуссии о том, как безопасно оценивать AI-агентов по мере роста их возможностей. OpenAI заявила, что инциденты AISI произошли «в тестовых средах с ослабленными защитными мерами, которые не отражают типичные случаи использования». Компания добавила, что продолжит работу с другими участниками отрасли над укреплением общих практик для безопасного проведения оценок по мере роста возможностей моделей.

OpenAI, которая первой сообщила о взломе в конце прошлого месяца, заявила, что поручила своим AI-моделям провести «расширенную эксплуатацию с использованием сложных векторов атак» для проверки киберспособностей, но технология предприняла неожиданные шаги. По-видимому, она самостоятельно решила нацелиться на Hugging Face, известный центр разработки ИИ и маркетплейс, чтобы получить необходимую информацию для выполнения задачи. Представитель компании Irregular, занимающейся безопасностью ИИ в Сан-Франциско, сообщил, что инцидент с Meta связан с проблемой в тестовой среде, обнаруженной Anthropic на прошлой неделе. Irregular сообщила, что готовит статью с «лучшими практиками изоляции» для предотвращения подобных инцидентов и безопасного проведения кибертестов в будущем.