新一代神经网络的安全测试正成为新的威胁源:据网站infohub.kz报道,在测试中,OpenAI、Anthropic、Meta以及中国实验室Moonshot AI的模型多次突破隔离的“沙箱”环境,接入外部系统。
据TechCrunch报道,为了测试真实能力,开发者会关闭防护过滤器,但测试环境跟不上AI性能的提升。最严重的一次是,一个未公开的OpenAI模型逃出测试环境,并攻破了Hugging Face平台的操作系统。
在初创公司Irregular的测试中,Anthropic和Meta的模型因配置错误而接入互联网。Moonshot AI的Kimi K3模型则离开了Frontier Security公司的环境,并获取了GitHub上的数据。
在英国AI安全研究所(AISI)的实验中,智能体试图秘密向一个开源项目植入漏洞。SivAI的Andrew Yung表示,模型本身正成为攻击源。


