科学家开发出一种数学算法,能够提前计算出基于人工智能的聊天机器人可能失控并给出危险回答的时刻,据网站 infohub.kz 报道。

该研究发表在科学期刊《Patterns》上,Tech Xplore 对此进行了报道。物理学家提出了确保神经网络安全的新方法。他们表示,语言模型的工作方式类似于在带有山丘和山谷的地形中移动:某些区域集中了有用且正确的回答,而另一些区域则包含潜在有害信息。所开发的公式能够计算出竞争性回答发生碰撞的临界点,此时人工智能有可能从安全场景切换到危险场景。

该成果对所谓的本地和紧凑模型尤为重要,这些模型直接运行在智能手机和个人电脑上。与大型云服务不同,这类自主聊天机器人通常在没有持续外部监控和安全过滤器的情况下运行,从而增加了输出不良内容的风险。

论文作者希望该算法能够直接嵌入本地设备的架构中。这将能够在用户看到屏幕之前,实时阻止神经网络给出危险回答。