NVIDIA的NOOA框架将AI代理性能提升超过10%
realtime news Jul 27, 2026 09:47
NVIDIA推出了NOOA,一个开源框架,通过优化AI代理的操作机制来提高效率和准确性,在各类基准测试中表现出色。
NVIDIA推出了NVIDIA实验室面向对象代理(NOOA)框架,旨在通过优化AI代理的操作机制重新定义其性能。于2026年7月27日发布的NOOA框架是一个基于Python的开源架构,旨在提升代理的效率、准确性和成本效益,适用于软件工程、网络安全和通用推理等行业。
操作机制设计(Harness design)往往被忽视,但它在AI性能中扮演着关键角色。NOOA框架将操作机制——即围绕AI模型的系统层——定位为提升性能的重要因素,而无需修改基础模型。NVIDIA声称,NOOA可以在基准测试中实现两位数的性能提升,同时将Token使用量和运营成本减少高达50%。
关键指标上的性能提升
NOOA在各类基准测试中展示了显著的成果。在SWE-Bench Verified中,该框架使用GPT-5.5达到了82.2%的准确率,超越了之前79.2%的最佳成绩。这是在每个任务仅使用110万Tokens的情况下完成的,相较之下,效率较低的操作机制则需要220万Tokens。在CyberGym L1的网络安全测试中,NOOA同样表现出色,解决了86.8%的任务,成为开源代理中的领先者。
在通用推理方面,NOOA在ARC-AGI-3基准测试中使用GPT-5.6-sol达到了85.1%的RHAE(相对假设准确性误差),相比之前的基线实现了显著提升。值得注意的是,这些结果的每任务成本低于20美元,突出了该框架的成本效率。
NOOA方法的六大支柱
NOOA架构的核心是六项能力,旨在优化代理性能:
- 类型化输入/输出:通过验证的参数和返回值,确保数据一致性。
- 按引用传递:允许模型与实时Python对象交互,而非序列化数据,从而减少Token开销。
- 代码即操作:支持模型直接执行Python代码,从而简化工作流程。
- 可编程循环设计:支持开发者控制的迭代循环。
- 显式对象状态:维护持久化的、类型化的状态,以便更好地管理上下文。
- 模型可调用API:提供用于检查和管理上下文及事件历史的工具。
这些功能使得NOOA代理的表现更接近传统的软件程序,能够在开发过程中进行广泛的调试、版本控制和人机协作。
成本效率和实际应用
NOOA的按引用传递机制和高效的上下文管理显著减少了Token消耗。例如,在SWE-Bench任务中,竞争对手的操作机制使用多达220万Tokens,而NOOA仅使用其一半的Tokens就能达到相同或更高的准确率,从而不需要昂贵的上下文压缩策略。
除了效率提升,NOOA还使代理能够在多个会话中积累知识而无需重新训练,将数据存储在易读的SQLite文件中。这一方法对网络安全等行业特别有利,例如NOOA在漏洞发现等任务中表现出色。NVIDIA报告称,在CyberGym L1测试中任务完成率达到了86.8%,并通过确定性验证步骤确保了可靠性。
操作机制设计中的更广泛变革
NVIDIA的NOOA加入了越来越多强调操作机制设计重要性的研究浪潮之中。2026年的研究,包括微软研究院的《回顾性操作机制优化》和arXiv论文《更好的操作机制,更小的模型》,表明精细化的操作机制可以让较小的模型以远低于成本的代价媲美更大的模型。
行业对操作机制设计的兴趣正在增长,首席信息官(CIO)们认识到减少延迟、提高可重复性和降低运营成本的潜力。NVIDIA发布的开源NOOA框架旨在加速这一趋势,为AI社区提供一个透明、可扩展的框架以推动进一步创新。
下一步是什么?
NOOA现在以研究预览的形式发布,其代码和基准测试可在NVIDIA的GitHub上访问。开发者还可以将该框架与NVIDIA的OpenShell运行时配对,以实现安全部署。
随着操作机制设计成为AI性能的关键杠杆,NVIDIA的NOOA框架为优化基础模型周围的架构设立了新标杆。在鼓励开放合作的背景下,NOOA可能为下一代成本高效、高性能的AI代理铺平道路。
Image source: Shutterstock