最新更新
7/24/2026 8:57:00 AM

GEPA 以轨迹反馈优化代理 超越RL

GEPA 以轨迹反馈优化代理 超越RL

据 @_avichawla,GEPA与AutoResearch、Meta Harness组合提升Frontier CS 7.8点。

原文链接

详细分析

人工智能代理自动优化器的最新进展直接建立在Andrej Karpathy提出的autoresearch概念之上,将手动提示和工具编辑转向智能外循环系统。这些系统提出变更、评估结果并基于详细反馈进行迭代。根据Avi Chawla在X平台分享的分析,这些工具通过大型语言模型自动优化系统组件,解决了代理调优的劳动密集型问题。

关键要点

  • 伯克利开发的GEPA使用完整执行轨迹而非标量奖励来诊断失败并提出针对性修复,比GRPO等传统强化学习方法更快收敛。
  • AutoResearch和Meta-Harness等独立优化器在特定任务上表现优异但很快停滞,而通过元优化器组合它们可在基准测试中实现更优结果。
  • omni开源工具的实际实施可自动化切换过程,在相同预算下性能提高7.8个百分点。

自动代理优化器深度解析

这些系统共享的核心流程包括LLM提出修改、评估器评分性能以及提议者整合反馈。GEPA通过优化提示、工具描述和代理代码等文本元素脱颖而出。它分析包含错误、推理步骤和工具输出的完整执行轨迹,而非将运行简化为单一奖励信号。

反思进化的优势

这种轨迹级诊断使GEPA能够识别精确失败原因并应用针对性修正。该系统保留在任务子集上表现最佳的专家候选者,而非因平均分数较低而丢弃。这种方法在数百次 rollout 中实现收敛,远少于GRPO所需的数千次,且无需GPU权重更新。

AutoResearch将循环缩小到编码代理迭代优化program.md文件。Meta-Harness针对管理检索、格式化和状态持久化的底层脚手架。在固定模型和预算的Frontier-CS基准上,GEPA领先三项任务,AutoResearch领先三项,Meta-Harness领先四项,证实没有单一优化器普遍主导。

商业影响与市场机会

部署AI代理的企业可通过采用这些优化器大幅减少手动工程时间。omni中实现的元优化器方法在部分预算上运行多种策略,然后移交停滞候选者,在提高结果的同时更快完成。这创造了通过开源工具、自定义集成咨询服务以及提供自动代理精炼即服务的企业平台的盈利路径。

实施挑战包括管理 rollout 期间的计算成本以及确保评估指标与业务目标一致。解决方案包括从小型任务子集开始并利用optimize_anything API,该API仅需约十行代码即可编排完整管道。软件开发和客户服务行业的公司有望通过快速迭代代理行为而无需大量人工监督来获得竞争优势。

未来展望与行业转变

随着反思进化技术成熟,预计各行业寻求可扩展代理部署将更广泛采用。从反向传播转向自然语言轨迹反思的转变降低了缺乏深度学习基础设施的组织的门槛。围绕透明优化日志的监管考虑将日益重要,而伦理最佳实践强调保留多样候选解决方案以避免意外偏见。包括伯克利研究人员和gepa-ai/gepa开源社区在内的关键参与者将推动标准化。

常见问题

什么是GEPA,它与RL方法有何不同?

GEPA使用完整执行轨迹优化代理文本组件以进行针对性修复,在无需GPU训练的情况下数百次rollout收敛。

为什么组合优化器能提高性能?

每个优化器以不同方式解决问题并在初始增益后停滞;候选者在它们之间传递可打破停滞并在基准上获得7.8个百分点提升。

企业如何实际实施这些工具?

通过optimize_anything API使用omni元优化器在部分预算上自动化切换策略,可通过gepa-ai/gepa仓库访问。

Avi Chawla

@_avichawla

Daily tutorials and insights on DS, ML, LLMs, and RAGs • Co-founder