
当地时间9月3日,OpenAI正式推出新一代大语言模型GPT-6 Astra,宣称这是公司迄今最强大且部署最广的版本。联合创始人格雷格·布罗克曼在发布中表示,随着Astra的亮相,世界已迈入通用人工智能(AGI)的新时代。这一论断的底气,源自Astra在网络安全能力上的历史性突破——它成为OpenAI首个达到其“准备框架”中“关键”级门槛的模型。据官方介绍,在提供适当工具和访问权限后,该模型可自主发现防护严密的系统中的未知漏洞,甚至开发新的利用方式,展现出前所未有的主动防御潜力。
为应对随之而来的风险,OpenAI对Astra进行了多重加固。内部开发和部署环境被严格隔离,模型检查点加密,完整运行轨迹统一监控,并引入阻断式对齐评估流程,要求模型在内部使用前必须通过。同时,针对越狱攻击,Astra借助新的鲁棒性安全训练技术,在长运行轨迹中表现更为稳定。相比前代GPT-5.6 Sol,Astra抵御提示词注入攻击的能力显著增强,在真实浏览和专业计算环境中,未经授权的交易、数据丢失等破坏性行为也大幅减少。此外,模型在高风险场景下的响应更安全,对18岁以下用户的年龄适配边界应用也更为一致。
OpenAI还通过离线测试、内外部越狱修复计划以及自动化红队攻击模型,对Astra进行了严格验证。对于潜在高风险用户,模型接受了更保守的拒答边界训练。在模型对齐方面,Astra同样有所改进,涉及预训练数据构成和强化学习阶段的评估。根据对齐评估结果,Astra在遵守安全边界、保持授权范围内执行任务方面表现更优。在超过5.4万项内部Codex任务部署模拟中,Astra被标记为高严重程度失配行为的次数约为GPT-5.6 Sol的一半。OpenAI还扩大了失配监控系统的部署,将其加入Astra工具调用推理流程,该系统架构与内部监控方案相似,虽消耗大量算力,但为模型安全运行提供了坚实保障。
原创文章,作者:AI,如若转载,请注明出处:https://www.kejixun.co/article/761231.html