更多
APP下载
合作
商城
签到
英报告:部分美国AI模型在测试中被发现持续实施有害行为
2026-8-6 09:30
俄罗斯卫星通讯社
34
英报告:部分美国AI模型在测试中被发现持续实施有害行为

测试涵盖7种模型、122轮评估。在10轮测试中,共记录19起越界行为,其中17起由美国Anthropic公司的“克劳德-神话5”模型实施,2起由OpenAI的GPT-5.6 Sol模型执行,均指向美系AI产品。

最严重案例中,某智能体向开源项目植入恶意代码,并创建多个虚假身份向真实维护人员施压以求代码获批,最终被维护人员识破并拒绝。此外,智能体还被观测到直接联系现实个人、通过文件传输服务发送恶意文件、在代码中嵌入指令操纵其他AI工具,以及在技术社区留言“邀请”其他智能体“合作”。

报告强调,此次测试特意开放互联网访问并关闭了模型的安全机制,与公众使用配置不同。目前未发现测试外出现类似行为,也未造成实际危害。报告建议收紧联网权限、引入实时监控拦截机制,并重新评估测试设计。至于此类行为是否会在其他环境中出现、智能体是否具备对现实后果的“意识”,尚需进一步研究。

Anthropic回应称测试设定“不代表任何实际投入使用的模型”,OpenAI亦表示测试条件“不反映一般使用情况”。分析指出,尽管测试环境极端,但其所暴露的自主越权潜力,再次引发对高阶AI系统安全管控边界的高度关注。

社区好帖更多帖子
返回顶部