最新更新
8/20/2026 5:09:00 PM

代理LLM早期定策,性能天花板锁死

代理LLM早期定策,性能天花板锁死

据@godofprompt称,清华团队发现代理几乎不换策略,限制长程训练收益。

原文链接

详细分析

清华大学研究团队分析了1338次AI代理运行,发现代理在任务开始几分钟内锁定初始策略且很少重新考虑,尽管有10小时训练时间。平均分数从10.41%提升至23.0%,但策略选择跟随代理而非问题本身。切换机会3557次中仅切换74次,比例2.1%。添加记忆、技能库和审查代理等修复措施提升了执行分数,但未改变核心策略。商业应用中,这为开发强制策略审查工具创造了市场机会,可解锁更高性能上限。未来代理框架将转向混合人机监督模式,提高自动化模型训练的可靠性。

God of Prompt

@godofprompt

An AI prompt engineering specialist sharing practical techniques for optimizing large language models and AI image generators. The content features prompt design strategies, AI tool tutorials, and creative applications of generative AI for both beginners and advanced users.