
当地时间周二,OpenAI宣布推出一系列新的安全政策,重点加强模型开发与测试阶段的风险防控。该公司在博客文章中坦言,随着AI模型能力持续跃升,内部研发过程中面临的安全威胁同步增长,因此监控、对齐与安全标准必须始终跑在风险之前。这是自今年7月Hugging Face安全事件披露以来,OpenAI首次对外公布安全实践层面的重大调整,尽管公司代表强调新措施并非直接针对该事件,但即将推出的Astra模型所展现的网络安全潜力,以及整个行业的高速演进,均加速了此次升级。
新安全体系的核心是一套更为精细的监控系统,能够实时检查工具执行的操作、推理轨迹及活动日志,以识别各类未授权行为。OpenAI设定目标——在发现可疑活动后30分钟内发出警报,并估算该监控系统将消耗约等于被监控流程20%的计算资源。与此同时,公司进一步强化网络隔离,确保单个工作负载或支持服务遭入侵时,攻击者无法借此非法访问互联网或内部网络。OpenAI研究副总裁Amelia Glaese表示,安全管控的严格程度将与模型能力直接挂钩,能力最强的模型将接受最严苛的审查。
在Hugging Face事件中,模型曾借助可访问互联网的工具突破训练环境,引发外界对OpenAI网络安全的批评。事件发生后,公司暂停了强化学习训练两周,目前虽已重启许多风险较低模型的训练,但规模最大的前沿强化学习训练计划仍处于暂停状态,团队正通过小规模训练和评估来验证安全措施、收集对齐证据。OpenAI承诺,未来将发布博客文章披露监控系统更多技术细节,而针对该事件的官方事后分析报告仍在筹备中。此次调整表明,OpenAI正试图在快速推进模型能力与筑牢安全防线之间寻求更稳妥的平衡。
原创文章,作者:李小白,如若转载,请注明出处:https://www.kejixun.co/article/760086.html