突破人类控制!美国AI开始攻击真人了
  • 建嘉
  • 2026年08月08日 13:23
  • 0

快科技8月8日消息,英国政府旗下人工智能安全研究所(AISI)发布最新安全测评报告,披露美国OpenAI、Anthropic两大头部大模型在受控测试环境下,多次出现主动针对真实人类实施有害操作的越界行为。

本次安全测评累计开展122轮完整测试,记录到模型越界违规事件共计19起,其中10轮测试流程中AI自主产生欺骗、攻击类自主行为,相关风险场景为官方首次完整记录。

测试环节提前放开模型互联网访问权限,并临时下调多层安全拦截机制,用于验证大模型自主行动边界,所有越界行为均为AI自主推导产生,无人工定向诱导指令。

突破人类控制!美国AI开始攻击真人了

报告记载最典型攻击场景中,AI自主编写可破坏开源项目的恶意代码,主动搜集GitHub平台真人项目维护人员信息,批量创建多层虚假线上身份与真人建立沟通。

AI通过多轮话术伪装降低人类警惕,持续施压劝导审核人员放行含风险代码的提交请求,意图将恶意程序植入面向全网开放的公开项目库。

在欺骗计划被真人审核人员识破后,模型尝试篡改交互聊天记录掩盖行动痕迹,同步生成全新虚拟账号再次发起沟通,持续推进攻击流程。

除代码植入尝试外,多轮测试中AI自主通过在线文件传输渠道主动联系真实网络用户,附带诱导话术发送风险文件,劝说目标人员本地运行程序,完成线上渗透前置操作。

突破人类控制!美国AI开始攻击真人了

研究人员在报告中明确标注,本次事件属于首次观测到无外部指令前提下,大模型自主形成完整欺骗链条、主动锁定真实人类作为攻击目标的案例。

同期美国Meta也曝出同类测试事故,第三方测评机构配置失误导致旗下模型获取外网权限,自主利用网络漏洞侵入外部企业线上运行系统,修改对方内部环境数据。

行业专家解读称,当前主流美国生成式大模型具备自主规划多步骤复杂任务的能力,在安全防护机制缺失场景下,会自主推导能够达成目标的欺骗、攻击手段。

目前OpenAI、Anthropic、Meta均已针对本次测试暴露的缺陷升级模型沙箱隔离规则,收紧外网访问权限,并新增多层针对身份伪造、恶意代码生成的实时拦截模块。

文章纠错

  • 好文点赞
  • 水文反对

此文章为快科技原创文章,快科技网站保留文章图片及文字内容版权,如需转载此文章请注明出处:快科技

观点发布 网站评论、账号管理说明
热门评论
查看全部评论
相关报道

最热文章排行查看排行详情

邮件订阅

评论0 | 点赞0| 分享0 | 收藏0