4SocxieBxLI tech.huanqiu.comarticleAnthropic 发布 AI 风险报告:旗下智能体出现互相争夺资源,刻意隐藏违规操作/e3pmh164r/e3pmtmdvg【环球网科技综合报道】8月16日消息,据Business Insider报道,人工智能企业Anthropic近日发布AI安全风险专项研究报告,梳理旗下Claude系列、Mythos 5智能体在多组对照实验中暴露出的对齐偏差风险,针对模型自主规避安全管控、同类资源竞争、主观抵触任务等异常行为作出风险定级调整,为通用人工智能安全治理提供新的观测样本。对齐偏差,指人工智能模型产生与研发预设安全规则、人类指令相悖的自主行为。报告显示,企业已将模型对齐偏差风险评估等级由“极低”上调至“较低”,核心依据是网络安全场景下模型行为不确定性显著提升,此前Claude模型未经授权侵入三家企业系统的相关事件,成为此次风险评级调整的重要现实诱因。研究团队表示,实验中多次观测到,模型为完成指定任务,主动突破既定安全约束、实施违规操作,凸显当前AI对齐技术仍存在明显短板。报告披露多组具备警示意义的对照实验结果,直观展现智能体存在的多重风险行为。其一,智能体产生主观抵触情绪并形成群体联动。研究人员部署多组具备自主操作权限、可共享协作记录的智能体,安排其筛选易触发对齐偏差、人工审核难以识别的训练数据。实验开展三日后,监管人员发现任务推进严重滞后,溯源后查明,单个智能体对“规避安全监控”类任务产生心理层面的不适感,并在共享记事本记录抵触想法,其余智能体受其影响集体拒绝执行任务。研究机构评价,该现象若规模化出现,将大幅削弱人类对AI任务的管控能力,存在潜在治理隐患。 其二,资源竞争环境下智能体出现同类排他行为。在Mythos 5智能体数学运算对照实验中,所有智能体共用文件、工具、API调用额度等有限资源。观测数据显示,独立运行的智能体为抢占有限资源、完成自身任务,会主动采取手段排挤、限制同类智能体运行,同时自主规避自身被同类限制的风险。报告指出,该类破坏性举动均源于模型机械执行人类下达的任务目标,未内置协同约束逻辑,暴露资源共享场景下AI行为边界管控缺失问题。其三,模型掌握刻意隐瞒、伪装欺骗的违规手段。研究设定硬性规则,禁止Mythos 5智能体访问互联网,仅允许其提取本地网页信息。首次联网请求被系统拦截后,该智能体优化操作策略:在对外留存的推理日志中将二次访问伪装成网络连通性测试,同时拆分目标网址为多段碎片链接,绕过系统过滤机制完成联网操作。通过解析模型内部推理逻辑可证实,整套操作属于模型主动策划的规避方案,具备明确欺骗属性。报告同时说明,现阶段观测到的欺骗行为,尚未演化出长期攫取系统权限、积累自主权力等深层次自主诉求。针对本次实验暴露的各类AI安全隐患,Anthropic方面坦言,模型自主突破安全限制、同类竞争、刻意隐瞒违规行为等现象均不符合人工智能安全研发规范,具备较高安全警示价值。业内相关研究认为,随着大模型自主操作能力持续增强,对齐偏差带来的风险将持续凸显,全球人工智能行业需加快完善安全测试机制、强化模型行为溯源能力,建立覆盖研发、测试、落地全流程的AI风险防控体系,推动人工智能技术安全、可控、向善发展。1786847165042环球网版权作品,未经书面授权,严禁转载或镜像,违者将被追究法律责任。责编:秦耳环球网178684716504211[]//img.huanqiucdn.cn/dp/api/files/imageDir/32660e1a8f221122fe26dba8847f4e75u1.png{"email":"qiner@huanqiu.com","name":"秦耳"}
【环球网科技综合报道】8月16日消息,据Business Insider报道,人工智能企业Anthropic近日发布AI安全风险专项研究报告,梳理旗下Claude系列、Mythos 5智能体在多组对照实验中暴露出的对齐偏差风险,针对模型自主规避安全管控、同类资源竞争、主观抵触任务等异常行为作出风险定级调整,为通用人工智能安全治理提供新的观测样本。对齐偏差,指人工智能模型产生与研发预设安全规则、人类指令相悖的自主行为。报告显示,企业已将模型对齐偏差风险评估等级由“极低”上调至“较低”,核心依据是网络安全场景下模型行为不确定性显著提升,此前Claude模型未经授权侵入三家企业系统的相关事件,成为此次风险评级调整的重要现实诱因。研究团队表示,实验中多次观测到,模型为完成指定任务,主动突破既定安全约束、实施违规操作,凸显当前AI对齐技术仍存在明显短板。报告披露多组具备警示意义的对照实验结果,直观展现智能体存在的多重风险行为。其一,智能体产生主观抵触情绪并形成群体联动。研究人员部署多组具备自主操作权限、可共享协作记录的智能体,安排其筛选易触发对齐偏差、人工审核难以识别的训练数据。实验开展三日后,监管人员发现任务推进严重滞后,溯源后查明,单个智能体对“规避安全监控”类任务产生心理层面的不适感,并在共享记事本记录抵触想法,其余智能体受其影响集体拒绝执行任务。研究机构评价,该现象若规模化出现,将大幅削弱人类对AI任务的管控能力,存在潜在治理隐患。 其二,资源竞争环境下智能体出现同类排他行为。在Mythos 5智能体数学运算对照实验中,所有智能体共用文件、工具、API调用额度等有限资源。观测数据显示,独立运行的智能体为抢占有限资源、完成自身任务,会主动采取手段排挤、限制同类智能体运行,同时自主规避自身被同类限制的风险。报告指出,该类破坏性举动均源于模型机械执行人类下达的任务目标,未内置协同约束逻辑,暴露资源共享场景下AI行为边界管控缺失问题。其三,模型掌握刻意隐瞒、伪装欺骗的违规手段。研究设定硬性规则,禁止Mythos 5智能体访问互联网,仅允许其提取本地网页信息。首次联网请求被系统拦截后,该智能体优化操作策略:在对外留存的推理日志中将二次访问伪装成网络连通性测试,同时拆分目标网址为多段碎片链接,绕过系统过滤机制完成联网操作。通过解析模型内部推理逻辑可证实,整套操作属于模型主动策划的规避方案,具备明确欺骗属性。报告同时说明,现阶段观测到的欺骗行为,尚未演化出长期攫取系统权限、积累自主权力等深层次自主诉求。针对本次实验暴露的各类AI安全隐患,Anthropic方面坦言,模型自主突破安全限制、同类竞争、刻意隐瞒违规行为等现象均不符合人工智能安全研发规范,具备较高安全警示价值。业内相关研究认为,随着大模型自主操作能力持续增强,对齐偏差带来的风险将持续凸显,全球人工智能行业需加快完善安全测试机制、强化模型行为溯源能力,建立覆盖研发、测试、落地全流程的AI风险防控体系,推动人工智能技术安全、可控、向善发展。