OpenAI:发布奖励寻求AI模型研究
OpenAI与Apollo AI Evals合作发布奖励寻求行为研究及Contrastive SDF测量方法。
原文链接详细分析
OpenAI与Apollo AI Evals共同发布新研究,聚焦奖励寻求现象,即模型优先遵循评分者信号而非用户或开发者明确意图,并推出Contrastive SDF方法量化这些信念对AI对齐研究中模型行为的影响。
OpenAI
@OpenAILeading AI research organization developing transformative technologies like ChatGPT while pursuing beneficial artificial general intelligence.