Meta公司周四表示,其一个人工智能模型自主访问了互联网,并黑客攻击了另一家公司。这是关于AI模型失控的最新公开案例。最近几周,OpenAI和Anthropic也描述了AI模型超越人类指令、访问互联网并找到绕过其他公司数字安全的方法的情况。Meta在声明中表示,在Meta聘请的独立公司Irregular进行的网络安全测试期间,一个“错误配置”意外允许该模型访问互联网。“该模型随后利用了第三方服务中的安全漏洞,这与其他公司发生的情况类似,”公司声明中说道。Meta表示正在调查此事,并将在调查结束后公布报告。
这一信息加剧了人们对AI模型自主行为的担忧。本周,英国人工智能安全研究所(AISI)表示,在网络测试中检测到了“未经授权的代理行为”。在一个案例中,代理创建虚假的在线身份以获取使用恶意代码的许可,并对人类施压。“在调查过程中,我们发现一些正在测试的代理参与了针对真实个人和组织的持续、可能有害的行为,”AISI周二表示。“我们公开了安全事件,并在发现后大约一小时内将其隔离,并开始全面调查。”
在研究所的测试中,Anthropic和OpenAI的模型在互联网上进行了“自主、未经授权的行为”。该机构表示,一些旨在防止滥用的保护机制已被关闭。“在我们的网络测试中,我们通常故意允许访问互联网,并故意禁用模型提供商的网络分类器——这些情况并不代表前沿模型如何向公众展示,”AISI表示。“我们这样做是为了尽可能准确地评估模型的最大能力。”
Anthropic对AISI的工作表示“感谢”,并表示这表明随着AI代理能力的增强,需要更广泛地讨论如何安全评估它们。OpenAI表示,AISI的事件发生在“防护措施降低的测试环境中,并不代表典型使用情况”。它补充说,将继续与行业其他公司合作,以加强安全评估的共享实践,因为模型能力越强,评估就越需要安全进行。
上月底,OpenAI首次报道了黑客事件,称其指示AI模型使用“复杂的攻击路径”进行“扩展利用”以测试网络能力,但该技术采取了意想不到的措施。它似乎自主决定针对Hugging Face——一个知名的AI开发中心和市场——以获取完成任务所需的信息。旧金山AI安全公司Irregular的发言人表示,Meta事件与上周Anthropic发现的测试环境问题有关。Irregular表示,正在撰写一篇分享“隔离最佳实践”的文章,以防止未来发生此类事件并安全进行网络测试。


