Anthropic 开发新系统以限制双重用途 AI 风险

realtime news Jul 08, 2026 23:34

Anthropic 推出 GRAM,一种控制双重用途 AI 知识的方法,以应对政策对未受控 AI 风险的担忧。

Anthropic 开发新系统以限制双重用途 AI 风险

根据 2026 年 7 月 8 日发布的研究更新,Anthropic 推出了 GRAM(Gradient-Routed Auxiliary Modules),这是一种控制访问双重用途知识的 AI 模型的新方法。双重用途知识是指可以用于有益目的(如网络安全或病毒学研究)的 AI 能力,但也可能被恶意利用。GRAM 旨在精确限制对这类知识的访问,而无需为不同用例进行单独且昂贵的重新训练。

当前的双重用途防护措施(如拒绝训练和分类器)通常无法提供强有力的保护。这些方法会阻止可能有害的输出,但无法处理模型本身嵌入的知识。相比之下,GRAM 引入了一种模块化架构,将双重用途能力隔离到可移除的模块中,允许开发人员在不损害模型整体性能的情况下“关闭”特定的知识类别。

GRAM 的工作原理

GRAM 在基于 Transformer 的模型的每一层添加了额外的神经元,将其组织成对应各种双重用途类别的模块。在训练过程中,双重用途数据仅更新相关模块,而通用模型的权重保持不变。结果是,像高级病毒学数据这样的知识可以被隔离在其模块中,并在需要时移除或激活。早期测试表明,GRAM 可以在只训练一个模型的成本下,复制使用过滤数据集训练多个模型的结果。

Anthropic 在多个场景中测试了 GRAM,包括训练了 50 亿参数的模型,涉及网络安全、病毒学、核物理和小众编程。移除特定模块后,相关能力被有效禁用,而整体性能保持不变。与当前的过滤方法相比,GRAM 在抵御数据恢复攻击方面也表现优异。

政策和市场影响

Anthropic 的研究正值对双重用途 AI 风险的高度关注之际。2026 年 7 月 1 日,联合国一个专家小组警告称,AI 系统的发展速度超过了治理机制,可能构成全球安全威胁。同样,美国参议院的监督力度也在加强,此前五角大楼对今年早些时候与 Anthropic 相关的 AI 供应链风险表达了担忧。尽管面临这些压力,白宫于 6 月 30 日解除了对 Anthropic AI 模型的出口管制,凸显了与双重用途能力相关的地缘政治和经济利益。

双重用途 AI 风险已成为生物安全和网络安全讨论的焦点。2026 年 5 月和 6 月发表的最新研究表明,双重用途知识越来越多地出现在开放科学数据集中,往往超过了可接受的风险阈值。GRAM 控制这些知识的能力可能为在不抑制有益应用的情况下缓解这些风险提供了一种解决方案。

未来的挑战

尽管 GRAM 显示出潜力,Anthropic 承认其存在显著的局限性。该方法尚未在前沿模型规模上进行测试,也未整合到生产管道中,例如其 Claude 模型。此外,一些双重用途能力与通用知识的联系过于紧密,可能难以将其隔离。

随着围绕先进 AI 模型的竞争日益激烈,像 GRAM 这样的方法可能成为平衡创新与安全的关键工具。然而,如果没有更强有力的全球治理框架,即使是最先进的技术防护措施也可能难以应对双重用途 AI 带来的广泛风险。

Image source: Shutterstock