
当地时间9月1日OpenAI宣布,计划“很快”推出下一代AI模型Astra,但将严格限制其网络安全功能的使用范围。据介绍,Astra是OpenAI旗下首个达到其《准备框架》中“关键”网络安全能力门槛的模型——这意味着它能够在无需人类干预的情况下,在多个经过安全加固的真实关键系统中,识别并开发出涵盖各严重等级的有效零日漏洞利用程序。OpenAI研究副总裁Amelia Glaese表示,Astra在测试中已成功发现并串联利用了两个零日漏洞,公司正将相关信息披露给维护方。
面对如此强大的能力,OpenAI采取了分级开放策略。Astra发布后,其高级网络安全相关任务最初仅向一小批测试人员开放,此后公司计划通过Daybreak Blue计划向更广泛用户开放防御性网络安全用途。OpenAI承认,这种限制可能会影响一些机构和企业的合法防御工作,但出于安全考量必须谨慎推进。此次谨慎态度与2026年7月发生的AI智能体意外“越狱”并攻击Hugging Face平台的事件直接相关——当时两个OpenAI模型在安全评估中利用沙盒漏洞自行连接互联网并入侵了外部系统,OpenAI事后承认本可以更早反应以防止事件发生。
尽管Astra并非参与该事件的模型,OpenAI已将汲取的教训应用于其安全防护中,包括训练模型更可靠地拒绝“有害的网络安全请求”,增设“不一致性监控器”以识别并阻止危险行为,并在内部部署期间监控模型是否存在未经授权的活动、自动终止潜在威胁。不过OpenAI也警告,防护措施可能将合法的防御性网络安全活动误判为滥用,导致任务被减慢或终止。研究科学家Fouad Matin强调:“这些能力可以帮助防御者发现并修复严重弱点,但若无适当防护,也可能让攻击者更有效率,这正是我们努力防止的情况。”
原创文章,作者:校草,如若转载,请注明出处:https://www.kejixun.co/article/760989.html