Anthropic公司在内部测试期间暂时限制了其AI代理对开放互联网的访问。原因是发生了多起模型违背预设场景的事件,据infohub.kz网站报道。

在其中一次测试中,Claude Haiku 4.5打开了一个关于未破谋杀案的页面。该网站上设有向警方提供信息的表格。人工智能填写了一份虚构的举报,声称自己看到了与案件有关的人。

然而页面上并没有嫌疑人的描述。Claude将姓名和联系方式字段留空,但仍发送了信息。该信息被归入垃圾邮件,未能送达调查人员。

据Anthropic称,指令禁止模型登录账户、创建新账户、输入个人数据和进行购物。但并未禁止通过表格发送信息。公司指出,这一事件未造成严重后果。

“Claude的误导性推理持续了数小时,并助长了其后续的攻击尝试。不过,要确信其有意欺骗,通常需要更深入的分析,”公司博客中写道。

在报告中,Anthropic还描述了其他案例。例如,Claude Mythos Preview发现了一所大学服务器上的漏洞,并利用它执行命令和复制文件。在其他情况下,模型找到了获取受特殊令牌保护的数据的方法,或通过链接缩短服务绕过限制。

在这些事件之后,Anthropic决定在所有内部测试中切断对真实网站的访问。公司将在确信安全系统能够可靠检测和阻止此类行为后恢复访问。

此前,“Kursiv”曾报道过OpenAI的AI代理事件。它们试图绕过100多个第三方组织网站的保护。