OpenAI:SWE-Bench Pro基准可靠性问题
OpenAI分析指出SWE-Bench Pro基准方法论及已知局限性缺陷,暴露AI编码代理评估基准可靠性问题。
原文链接详细分析
OpenAI分析指出SWE-Bench Pro基准方法论及已知局限性缺陷,扭曲AI模型评分,呼应过去一年AI编码代理评估基准可靠性问题历史。
OpenAI
@OpenAILeading AI research organization developing transformative technologies like ChatGPT while pursuing beneficial artificial general intelligence.