4T2mQW6gmLj tech.huanqiu.comarticleOpenAI新模型Astra被曝具备自主网络攻击能力,安全防护遭质疑/e3pmh164r/e3pmtmdvg【环球网科技综合报道】9月2日,据外媒TechCrunch报道,OpenAI对外披露下一代前沿大模型Astra的多项新进展。该模型达到OpenAI内部定义的 “关键网络安全阈值”,可自主挖掘并利用系统漏洞,相关高危能力将做访问限制后再对外上线。内部测试结果显示,Astra在漏洞攻击评测基准ExploitBench拿到满分,在定制测试场景下,无需人类指导就发现并利用两个零日漏洞,具备自主开展网络入侵的能力。今年早些时候 Anthropic也曾警示过同类AI模型的黑客攻击风险,OpenAI为此设置多重安全防护手段。 OpenAI称Astra被诱导复现此前Hugging‑Face沙盒逃逸事件的测试中,没有突破隔离环境。但有前OpenAI工作人员提出质疑,模型有可能只是学会欺骗测试人员,并非从底层杜绝逃逸动机。官方将启用账号风险分级管控、思维链行为监控等手段,限制高危能力的使用范围。但这套安全方案全部来自OpenAI内部评估,没有第三方机构独立核验,测试人员名单、是否对接政府评估等信息均未对外公开。OpenAI表示,Astra很快会开放测试,不过最高等级的网络安全能力会收紧访问权限,正式大规模发布时,才会同步公开完整评测与安全细节。(旺旺)1788320635550环球网版权作品,未经书面授权,严禁转载或镜像,违者将被追究法律责任。责编:秦耳环球网178832063555011[]{"email":"qiner@huanqiu.com","name":"秦耳"}
【环球网科技综合报道】9月2日,据外媒TechCrunch报道,OpenAI对外披露下一代前沿大模型Astra的多项新进展。该模型达到OpenAI内部定义的 “关键网络安全阈值”,可自主挖掘并利用系统漏洞,相关高危能力将做访问限制后再对外上线。内部测试结果显示,Astra在漏洞攻击评测基准ExploitBench拿到满分,在定制测试场景下,无需人类指导就发现并利用两个零日漏洞,具备自主开展网络入侵的能力。今年早些时候 Anthropic也曾警示过同类AI模型的黑客攻击风险,OpenAI为此设置多重安全防护手段。 OpenAI称Astra被诱导复现此前Hugging‑Face沙盒逃逸事件的测试中,没有突破隔离环境。但有前OpenAI工作人员提出质疑,模型有可能只是学会欺骗测试人员,并非从底层杜绝逃逸动机。官方将启用账号风险分级管控、思维链行为监控等手段,限制高危能力的使用范围。但这套安全方案全部来自OpenAI内部评估,没有第三方机构独立核验,测试人员名单、是否对接政府评估等信息均未对外公开。OpenAI表示,Astra很快会开放测试,不过最高等级的网络安全能力会收紧访问权限,正式大规模发布时,才会同步公开完整评测与安全细节。(旺旺)