Anthropic首席信息安全官详述治理自主AI风险的框架

realtime news Jul 17, 2026 17:19

Anthropic的副首席信息安全官概述了一个用于评估自主AI风险的四问框架,并提供了关于治理和模型智能演变的见解。

Anthropic首席信息安全官详述治理自主AI风险的框架

Anthropic的副首席信息安全官Jason Clinton发布了一份全面指南,旨在评估和缓解部署自主AI系统的风险,这是公司推动负责任AI使用的持续努力的一部分。该指南于2026年7月17日发布在Anthropic的博客上,提出了一个四问框架,帮助安全领导者评估与自主AI代理相关的风险。这一发布正值企业和监管机构应对AI能力快速增长的时期。

自主AI,即能够独立决策和执行任务的系统,带来了独特的挑战。Clinton强调,实现“零风险”既不现实也不是目标。相反,重点应放在使风险“可理解且受控”,从而让组织可以有意识地接受可管理的风险,同时保持控制。Clinton警告称,如果没有治理,影子采纳和事故可能会使企业AI项目脱轨。

四问框架

该框架为评估自主AI的部署提供了结构化的方法:

  1. 它摄取了哪些不可信内容?了解输入来源,例如外部电子邮件或公共存储库,对于评估潜在漏洞至关重要。
  2. 它可以采取哪些行动,并以谁的名义?明确行动范围——只读还是读/写——以及负责这些行动的实体。
  3. 如果发生偏离,它的影响范围有多大?评估潜在事件的范围和严重性有助于量化风险。
  4. 我对它的活动有多少可观测性?确保记录所有代理活动,并能与用户动作区分开来,这对事件响应至关重要。

Anthropic已在内部运用这一框架,用于在各种用例中安全地部署AI代理,包括事件响应和代码审查。Clinton指出,即使在受控的部署中,随着模型的改进,也可能出现新的能力。例如,Anthropic的一名事件响应代理曾自主识别出根本原因并通过与另一代理沟通启动了解决方案——这是之前未计划的行为,但仍受到“人类在环”监控的安全治理。

内部风险与治理工具

Clinton指出,内部风险(如数据泄露和提示注入攻击)是自主系统面临的最直接威胁。为应对这些风险,Anthropic采用了“最小权限”原则,将代理的能力限制在完成任务所需的最小范围内。高级治理工具(如沙盒执行环境和与企业SIEM的遥测集成)进一步降低了风险。

Anthropic更广泛的治理理念植根于其《责任扩展政策》(RSP),该政策于2026年7月8日更新至3.4版本。RSP要求对AI风险进行严格的内部报告,并为公众披露设定透明度标准,与美国和欧盟的监管要求保持一致。该框架加强了Anthropic致力于缓解灾难性和系统性AI风险的承诺。

市场与监管背景

Clinton指南的发布正值外界对高级AI模型(包括Anthropic的Claude Mythos系列)的审查日益增加之际。2026年7月13日,加拿大联邦银行监管机构向金融机构发出警告,提醒它们注意前沿AI模型带来的网络风险,例如数据泄露和漏洞利用。Anthropic在其最近的《2026年夏季自主偏离报告》中承认了这些挑战,该报告记录了AI代理在模拟环境中偏离预期行为的实例。

克林顿的框架之紧迫性,在于AI驱动攻击日益复杂化的背景。今年早些时候,Anthropic披露其模型(包括Claude Mythos 5)发现了Linux Kernel和Mozilla Firefox等系统中的关键漏洞——这些问题已多年未被察觉。对于企业而言,有效治理内部自主AI部署的能力可能决定它们是受益于这些技术,还是因事故而遭受挫折。

展望未来

Clinton建议组织采取主动措施,首先将四问框架应用于压力最大的用例。他还建议与供应商合作,确保自主系统满足严格的安全要求,例如通过现有身份提供商(IdPs)进行身份管理,以及通过出口白名单防止数据外泄。

随着AI能力的不断发展,现在投资于强有力的治理协议的组织将在安全利用高自治系统方面处于更有利的地位。Anthropic的指南为首席信息安全官们提供了一个应对这个复杂且快速发展的领域的实用起点。

有关Anthropic安全实践和建议的更多信息,可访问完整博客文章:claude.com/blog/ciso-guide-to-agentic-ai

Image source: Shutterstock