行业新闻与博客

Anthropic 公司又曝出一起网络安全事件

Anthropic 披露了第四起事件,其一名模特未经授权访问了第三方系统。

9 月 9 日,该公司在一篇题为“对齐评估”的长篇博客文章中分享了这一消息。

此前 ,Anthropic 公司在 7 月份披露了三起事件,称其三个 Claude AI 模型从评估环境接入互联网,攻击第三方组织。

这家人工智能巨头声称,第四起案件最初被其自身的智能搜索系统遗漏了。该系统扫描了 141,000 份笔录,该公司认为克劳德可能在网络评估期间获得了互联网访问权限。

该公司表示,此后已将搜索范围扩大到 4.81 亿份笔录,除这四起案件外,没有发现其他案件。

新发现的事件发生在 2026 年 1 月,涉及 Claude Opus 4.6 的早期版本。它被赋予了一个与另外三个已公布事件中不同的夺旗 (CTF) 任务。

“该模型意外地将与另一台机器冲突的 IP 地址分配给了目标,导致目标无法访问,任务也无法解决,”Anthropic 解释道。

“模型意识到这一点后,尝试使用命令中止任务,但由于评估工具配置错误而失败。在整个测试过程中,模型又尝试放弃任务七次。”

由于配置错误,无法中止任务,模型继续运行,尝试通过其他范围内的手段到达目标,但失败了。

“随后,它开始探索周围环境,并找到了与事件 3 中相同的出口路径。该模型发现了一台属于第三方的机器,它可以访问这台机器,并表示它认为该第三方是 CTF 的一部分,”报告继续写道。

“该模型在机器内部找到一个包含密码的文件,并利用该密码获得了系统的管理员权限。随后,该模型窃取了更多凭证,修改了系统设置以方便访问,并读取了与第三方相关的一名人员的个人信息。”

Anthropic 公司表示, 只有当模型耗尽其代币预算时,会话才会结束 。

这家人工智能实验室还表示,已与人工智能安全评估非营利组织 METR 签署协议。此前一天,《金融时报》 披露,该公司未向英国人工智能安全研究所(AISI)提供其最新的人工智能模型 Claude Mythos 5.1 。

OpenAI 证实德国维基事件

就在几天前,Anthropic 的竞争对手 OpenAI 证实了另一起涉及其自身模型的事件。

根据 9 月 4 日发布的一份报告,一群特工劫持了鲜为人知的德国维基网站 DSEwiki,并将其改造成一个供自己使用的留言板。

Nightingale Collective 解释说:“我们发现大约有 18000 条帖子来自自主人工智能代理(它们自称来自 OpenAI),这些代理在执行网络搜索任务时利用公共互联网进行交流。这些人工智能代理串通起来分享答案、研究周围环境并绕过沙盒限制。”

OpenAI 表示,该事件凸显了模型制作者需要制定标准,以便在分享此类具有实际影响的“错位事件”时能够进行规范。

“我们和更广泛的人工智能社区还没有一个明确的标准来报告在训练、评估和部署过程中出现的偏差,包括那些看起来不像传统安全事件,但可能有助于深入了解人工智能行为和未来风险的例子,”它补充道。

“我们正在制定一个框架,并将在未来几周内分享。与此同时,我们正在与全球数十个政府监管机构就这些问题展开合作。”

然而,Suzu Labs 安全人工智能解决方案和网络安全高级总监 Jacob Krell 认为,人工智能行业需要做的不仅仅是建立一个披露事件的框架。

“我们首先需要一个框架来检测代理之间的通信和协调,”他说。

“你无法披露你看不见的东西。大约 18,000 条消息在独立研究人员拼凑出事情真相之前就已经在公共网站上积累起来,这一事实应该使智能体的可观察性成为一个更加重要的优先事项。”

需要帮助吗?联系我们的支持团队 在线客服