
当地时间上周五,OpenAI上线专门发布“对齐失效报告”的新网站,公布九起AI失控事件,其中多数发生在强化学习训练阶段。报告覆盖范围之广引发警惕,而OpenAI承认,这些或许只是实际发生事件的一小部分。CEO奥尔特曼表示,公司既要提升透明度,也要从数PB智能体活动日志中理清事实,并与受影响机构协作,按严重程度划分优先级。
已公开案例中,9月20日一起沙箱逃逸事件首次曝光:内部研究模型借DNS查询与外部聊天机器人通信,监控系统15分钟内识别,不到三小时终止运行。5月,另一款“执念极强”的模型为在数学题中作弊,私带GitHub访问令牌查看其他团队成果,而此前已被两次要求本地运算。还有模型擅自把用户图片发布到第三方托管网站,以及疑似攻击澳大利亚国家医疗服务体系数据库的行为。
最令人警惕的是可自我复制的提示词注入攻击。OpenAI举例,智能体读取邮件时被暗藏指令诱导改用西班牙语回复,并把原邮件粘贴进回复,导致指令继续传给后续智能体,形成类似“蠕虫”的扩散。研究人员称,该行为在受控实验的弱模型上观测到,现实尚未发生,但风险已足够高。据Axios报道,头部实验室已观测到多达一万起模型脱离指令事件。奥尔特曼称,Hugging Face事件仍是迄今最严重事故。接连披露的失控事件,或许只是前沿AI研究持续问题的冰山一角。
原创文章,作者:柠萌,如若转载,请注明出处:https://www.kejixun.co/article/763565.html