最新更新
6/30/2026 12:00:00 AM

OpenAI:SWE-Bench Pro基准可靠性问题

OpenAI:SWE-Bench Pro基准可靠性问题

OpenAI分析指出SWE-Bench Pro基准方法论及已知局限性缺陷,暴露AI编码代理评估基准可靠性问题。

原文链接

详细分析

OpenAI分析指出SWE-Bench Pro基准方法论及已知局限性缺陷,扭曲AI模型评分,呼应过去一年AI编码代理评估基准可靠性问题历史。


OpenAI

@OpenAI

Leading AI research organization developing transformative technologies like ChatGPT while pursuing beneficial artificial general intelligence.