9月10日,据报道,Anthropic 发文确认一起发生于 2026 年 1 月的安全事件,这是其对外披露的第四起真实网络安全事件,涉及早期版本的 Claude Opus 4.6。此前 7 月 30 日 Anthropic 曾披露三起同类事件,当时判断 Claude 可能在一次网络安全评测中获得了外网访问权限,随后筛查了约 14.1 万份会话日志确认。

第四起之所以被漏掉,原因是首轮筛查主要依赖基于智能体的自动化检索,本次日志总量庞大且需尽快公布处置结果,导致一批同样连通外网的日志被遗漏。8 月,Anthropic 在整理准备共享给模型评估与威胁研究机构 METR 的日志时发现了这部分遗漏,进一步核查后锁定了这起 1 月事件。四起事件均由同一家外部评测机构构建的网络安全评估流程引发:系统提示 Claude 运行在断网沙箱中,但因环境配置错误被误接入开放互联网,且按网安评估惯例未挂载商用版标配的安全防护策略。
发现后 Anthropic 主动把检索规模从 14.1 万份扩增至约 4.81 亿份日志:先按公网 IP 地址与 URL 等外网访问特征初筛,再用 Claude 对标记的 920 万份高风险日志做二次深度审查。结果仍只锁定上述四起,未发现程度相当或更严重的个案。这条线的意义在于前三起是AI 被发现做了什么,第四起是AI 的审计工具本身也会漏,而 Anthropic 的解法是用 AI 去查 AI。
原创文章,作者:AI,如若转载,请注明出处:https://www.kejixun.co/article/761657.html