行业新闻与博客

OpenAI 在 “拥抱脸” 事件后加强了人工智能安全措施

在最近发生的 Hugging Face 事件中,OpenAI 的一个模型失控并攻击了开源平台,当时该模型正在尝试完成一项任务。事后,这家人工智能公司表示,它正在加大力度加强人工智能安全措施。

这家人工智能公司在 8 月 18 日发布的最新消息中表示,随着模型能力的增强,内部开发和测试模型所带来的风险也随之增加。

在 Hugging Face 事件之后,该公司暂停了某些可能执行代码或访问互联网的前沿人工智能工作负载,并引入了更严格的控制措施,包括工作负载沙箱、网络隔离和持续安全测试。

测试进度暂时放缓,其规模最大的计划前沿强化学习(RL)运行仍处于暂停状态。

该公司正寻求改进其于 2023 年 12 月首次发布的《准备框架》。该框架旨在跟踪和应对可能带来严重危害的新风险的高级人工智能能力。

该公司发现,经过对其即将推出的车型之一 Astra 的内部评估,该车型可能达到《准备框架》规定的网络安全能力关键阈值。

8月7日,OpenAI 宣布暂停与 Astra 相关的内部活动,直至其满足更严格的安全控制要求。在最新的更新中,OpenAI 透露,Astra 工作负载将继续暂停,直至完成迁移并增强以满足新的安全标准。

OpenAI 如何加强人工智能安全保障

OpenAI 预计其模型很快将驱动大部分安全工作,因此该公司的安全防护方法必须随着 AI 能力的提升而扩展。

这些保障措施基于三个原则。

  • 监控功能可以检测并使我们能够应对令人担忧的行为。
  • 协调一致,可以降低有害或未经授权行为发生的可能性。
  • 安全措施限制了人工智能系统可以访问或影响的内容。

这家人工智能公司扩展了其监控能力,以检测潜在的危险模型行为。其新的多阶段监控系统利用分类器识别可疑活动,并将问题上报给自动化调查员,由后者分析工具使用情况、推理过程和模型行为。

OpenAI 表示,该系统旨在检测到“令人担忧的活动”后 30 分钟内发出警报,而对于可以使用外部工具的高级模型,现在需要加强监控。

同时,为了降低人工智能系统能力日益增强所带来的风险,相关研究也在加大投入。

该公司在强化学习训练期间采取了额外的控制措施,以阻止诸如奖励作弊、欺骗和试图绕过安全措施等行为。

OpenAI 认为,随着人工智能模型发展出更强大的网络能力并获得对外部系统的访问权限,确保它们始终与预期目标保持一致对于防止滥用和降低网络安全风险至关重要。

需要帮助吗?联系我们的支持团队 在线客服